← 回總覽

只改两个设置,GPT-5.6 的 ARC-AGI-3 成绩翻了 3 倍

📅 2026-07-30 15:56 AINLP 人工智能 2 分鐘 1557 字 評分: 87
大语言模型 模型推理 上下文压缩 响应式 API ARC-AGI-3
📌 一句话摘要 仅通过开启 retained reasoning 和 compaction 两个设置,GPT-5.6 Sol 在 ARC-AGI-3 公开集成绩从 13.3% 提升至 38.3%,输出 token 降至约六分之一。 📝 详细摘要 文章详细复盘 OpenAI 关于 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的表现提升。最初仅使用官方 Harness 时模型得分仅 13.3%,随后发现问题在于每步结束后模型的私有推理状态被清除,导致需要重复思考。通过在 Responses API 中启用 retained reasoning(保留上一轮的 previous_re

📌 一句话摘要

仅通过开启 retained reasoning 和 compaction 两个设置,GPT-5.6 Sol 在 ARC-AGI-3 公开集成绩从 13.3% 提升至 38.3%,输出 token 降至约六分之一。

📝 详细摘要

文章详细复盘 OpenAI 关于 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的表现提升。最初仅使用官方 Harness 时模型得分仅 13.3%,随后发现问题在于每步结束后模型的私有推理状态被清除,导致需要重复思考。通过在 Responses API 中启用 retained reasoning(保留上一轮的 previous_response_id)以及 compaction(上下文压缩)两个开关,模型能够在多轮交互中保留关键推理并把冗余历史压缩为不透明条目。实验结果显示,得分跃升至 38.3%,接近原来的三倍,同时每局输出 token 减少至约六分之一。文章指出,这一提升完全来源于 harness 的配置变动,而非模型权重或额外训练,强调了工程框架对 LLM 代理能力的重要影响。

💡 主要观点

- 每步结束后私有推理状态被清除导致重复思考。 ARC Harness 在每次动作结束后丢掉模型的私有推理,使模型无法记住之前验证的规则或当前计划,必须重新从头推理,这严重拖慢了效率和得分。

启用 retained reasoning 可保留跨轮推理上下文。 通过在 Responses API 中传入 previous_response_id,模型在后续工具调用和多轮交互中能够继续使用之前的私有推理,无需每回合重新理解游戏状态。
开启 compaction 通过压缩历史状态降低 token 开销。 compaction 将仍有用的历史状态和推理压入一个不透明条目带入下一段上下文,保留关键信息(已确认规则、走过弯路、当前计划)而无需完整保存所有细节,从而大幅减少输出 token。
两个设置共同使得分提升约三倍,token 降至约六分之一。 在 ARC-AGI-3 公开集上,开启 retained reasoning 与 compaction 后 GPT-5.6 Sol 得分从 13.3% 跃升至 38.3%,输出 token 降至原来的约六分之一,说明 harness 配置对模型实际表现的影响远超模型本身。

💬 文章金句

- 只给负责调用模型的运行框架打开两个设置,ARC-AGI-3 公开集成绩就从 13.3% 跑到 38.3%,接近原来的 3 倍;输出 token 同时降到了原来的约六分之一。

  • 两个设置一起打开后,GPT-5.6 Sol 每次行动前少了大量重复思考,策略也不再频繁断线。

📊 文章信息

AI 初评:87

来源:AINLP

作者:AINLP

分类:人工智能

语言:中文

阅读时间:7 分钟

字数:1508

标签: 大语言模型, 模型推理, 上下文压缩, 响应式 API, ARC-AGI-3

阅读完整文章

查看原文 → 發佈: 2026-07-30 15:56:00 收錄: 2026-07-30 22:00:36

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。