仅通过开启 retained reasoning 和 compaction 两个设置,GPT-5.6 Sol 在 ARC-AGI-3 公开集成绩从 13.3% 提升至 38.3%,输出 token 降至约六分之一。
📝 详细摘要
文章详细复盘 OpenAI 关于 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的表现提升。最初仅使用官方 Harness 时模型得分仅 13.3%,随后发现问题在于每步结束后模型的私有推理状态被清除,导致需要重复思考。通过在 Responses API 中启用 retained reasoning(保留上一轮的 previous_response_id)以及 compaction(上下文压缩)两个开关,模型能够在多轮交互中保留关键推理并把冗余历史压缩为不透明条目。实验结果显示,得分跃升至 38.3%,接近原来的三倍,同时每局输出 token 减少至约六分之一。文章指出,这一提升完全来源于 harness 的配置变动,而非模型权重或额外训练,强调了工程框架对 LLM 代理能力的重要影响。
💡 主要观点
- 每步结束后私有推理状态被清除导致重复思考。 ARC Harness 在每次动作结束后丢掉模型的私有推理,使模型无法记住之前验证的规则或当前计划,必须重新从头推理,这严重拖慢了效率和得分。
💬 文章金句
- 只给负责调用模型的运行框架打开两个设置,ARC-AGI-3 公开集成绩就从 13.3% 跑到 38.3%,接近原来的 3 倍;输出 token 同时降到了原来的约六分之一。
- 两个设置一起打开后,GPT-5.6 Sol 每次行动前少了大量重复思考,策略也不再频繁断线。
📊 文章信息
AI 初评:87
来源:AINLP
作者:AINLP
分类:人工智能
语言:中文
阅读时间:7 分钟
字数:1508
标签: 大语言模型, 模型推理, 上下文压缩, 响应式 API, ARC-AGI-3