本研究探讨了 LLM 是否可以通过填充 token 延长输出轨迹来提升潜在算术性能,结果发现 Claude Opus 4.5 有适度提升,而其他模型效果有限。
📝 详细摘要
本文对大语言模型中的“潜在侧任务能力”进行了实证研究,测试了通过使用短语重复作为填充物来提供更长的输出轨迹,是否能让模型在没有显式推理的情况下更有效地解决算术问题。作者使用包含 1,000 个算术问题的数据集,评估了 Claude Opus 4.5、Sonnet 4、GPT-5.2 和 GPT-4.1。结果表明,Claude Opus 4.5 受益于更长的轨迹,在 240 行填充物的辅助下,其 50% 准确率的阈值从大约 5 步问题提升到了 6 步问题。然而,这种效应并非在所有模型中都通用,在上下文窗口约 5% 时达到饱和,且研究发现可预测的短语重复比模糊的类推理文本更能促进潜在计算。
💡 主要观点
- 更长的输出轨迹可以增强特定模型中的潜在算术性能。 Claude Opus 4.5 在 240 行填充 token 的前置下,在解决多步算术问题时表现出可衡量的提升,有效地提高了其问题解决阈值。
💬 文章金句
- 在 240 行无关输出后,这将其 50% 准确率的阈值从约 5 步问题提升到了约 6 步问题。
- 然而,除了 Opus 4.5 之外,我们没有观察到强有力的证据表明当前一代模型普遍能从更长轨迹带来的更广泛并行计算中获益良多。
- 潜在侧任务能力在上下文窗口约 5% 时达到饱和。
📊 文章信息
AI 评分:88
来源:LessWrong
作者:Bruce W. Lee
分类:人工智能
语言:英文
阅读时间:5 分钟
字数:1085
标签: LLM, 潜在推理, AI 控制, Claude Opus, 算术基准测试