← 回總覽

GPT-5.6 Sol 基准测试:大幅领先 Claude Fable 5,成本仅四分之一

📅 2026-07-10 12:21 AI Will 人工智能 1 分鐘 627 字 評分: 84
OpenAI GPT-5.6 基准测试 Claude 成本效率
📌 一句话摘要 GPT-5.6 Sol 在 Agents' Last Exam 测试中以 53.6 分创下新高,大幅领先 Claude Fable 5,且成本仅为其四分之一。 📝 详细摘要 此推文提供了 GPT-5.6 Sol 的具体基准测试成绩。在 Agents' Last Exam 中,Sol 获得 53.6 分,比 Claude Fable 5 高出 13.1 分。在中等推理强度下,领先 11.4 分,预估成本仅为后者的四分之一。更小型的 Terra 和 Luna 模型也在约十六分之一的成本下超越了 Fable 5。推文附有测试成绩截图。 📊 文章信息 AI 初评:84 来源:AI

📌 一句话摘要

GPT-5.6 Sol 在 Agents' Last Exam 测试中以 53.6 分创下新高,大幅领先 Claude Fable 5,且成本仅为其四分之一。

📝 详细摘要

此推文提供了 GPT-5.6 Sol 的具体基准测试成绩。在 Agents' Last Exam 中,Sol 获得 53.6 分,比 Claude Fable 5 高出 13.1 分。在中等推理强度下,领先 11.4 分,预估成本仅为后者的四分之一。更小型的 Terra 和 Luna 模型也在约十六分之一的成本下超越了 Fable 5。推文附有测试成绩截图。

📊 文章信息

AI 初评:84

来源:AI Will(@FinanceYF5)

作者:AI Will

分类:人工智能

语言:中文

阅读时间:1 分钟

字数:198

标签: OpenAI, GPT-5.6, 基准测试, Claude, 成本效率

阅读推文

查看原文 → 發佈: 2026-07-10 12:21:50 收錄: 2026-07-10 20:00:23

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。