出典:OpenAI Blog原文を見る ↗
原文の著作権は出典元に帰属します。当サイトでは収録、翻訳、体裁調整のみを行います。
事実関係
解説と影響
OpenAI 官方博客披露,在未进行任何底层模型改动的情况下,仅通过优化 API 调用策略,就显著提升了 GPT-5.6 在 ARC-AGI-3 二维解谜基准上的表现。该基准此前曾让 GPT-5.6 Sol 的得分低至 7.8%,而更早的 GPT-5.5 仅获 0.4%,一度引发外界对模型解谜能力的质疑。OpenAI 团队调查后发现,问题并非出在模型本身,而是基准测试中那些不易察觉的 API 设置与测试框架设计 [来源:openai.com]。
突破的关键在于 Responses API 中两项新功能的组合运用。第一项是“保留推理”,它允许模型在多轮交互中持续保留有用的推理过程,避免重复思考;第二项是“推理压缩”,能将冗长的推理链条压缩为简洁形式,同时不丢失关键上下文。两者配合,使模型在复杂任务中既能保持思考的连贯性,又能大幅削减冗余输出。根据 OpenAI 公布的数据,启用这两项设置后,GPT-5.6 不仅准确率翻了三倍,输出 Token 用量也降至原来的约六分之一,实现了准确性与效率的双重提升 [来源:explainx.substack.com]。
这一结果也引发了行业对基准测试评估方式的反思。有观点指出,此前 Anthropic 发布的 ARC-AGI-3 成绩,在 OpenAI 的优化成果面前显得黯然失色,这凸显了测试框架本身对模型能力展现的巨大影响 [来源:startupfortune.com]。OpenAI 的实践表明,评估 AI 能力时,不能只看模型参数或训练数据,API 设置、提示词工程等“非模型因素”同样至关重要。这些发现为开发者提供了新的优化思路:在不增加训练成本的前提下,通过精细化的推理管理即可挖掘出模型更大的潜力。
参考資料
- OpenAI Blog ↗
- OpenAI Triples AI Performance with Just Two Settings ↗
- OpenAI has successfully tripled its ARC-AGI-3 score by improving the GPT-5.6 harness, demonstrating that not only the model's performance but also the harness is important. - GIGAZINE ↗
- Peter Steinberger called out Anthropic for posting ARC-AGI-3 results that OpenAI quickly made look absurd - Startup Fortune ↗