GPT-5.6 Sol 在 Agents' Last Exam 测试中以 53.6 分创下新高,大幅领先 Claude Fable 5,且成本仅为其四分之一。
📝 详细摘要
此推文提供了 GPT-5.6 Sol 的具体基准测试成绩。在 Agents' Last Exam 中,Sol 获得 53.6 分,比 Claude Fable 5 高出 13.1 分。在中等推理强度下,领先 11.4 分,预估成本仅为后者的四分之一。更小型的 Terra 和 Luna 模型也在约十六分之一的成本下超越了 Fable 5。推文附有测试成绩截图。
📊 文章信息
AI 初评:84
来源:AI Will(@FinanceYF5)
作者:AI Will
分类:人工智能
语言:中文
阅读时间:1 分钟
字数:198
标签: OpenAI, GPT-5.6, 基准测试, Claude, 成本效率