← 回總覽

The Batch: 964 | Claude 亮相另一款 Opus

📅 2026-08-04 12:45 DeeplearningAI 人工智能 3 分鐘 3573 字 評分: 87
人工智能 大语言模型 Claude Anthropic 模型评测
📌 一句话摘要 Anthropic 发布了视觉-语言模型 Claude Opus 5,在多项基准测试中表现优于 Claude Fable 5 且成本更低,适合日常使用。 📝 详细摘要 文章详细介绍了 Anthropic 最新发布的 Claude Opus 5 模型,包括其输入/输出规格(最高支持 100 万 token 输入、128k 输出、52.8 token/秒)、知识截止时间(2026 年 5 月)、功能特性(五档推理等级、工具使用、提示缓存、快速模式、无数据保留)、定价(Claude Max 与 Claude Pro 订阅者默认使用、API 按 token 计费)以及未披露的参数量

Title: The Batch: 964 | Claude 亮相另一款 Opus | BestBlogs.dev

URL Source: https://www.bestblogs.dev/article/f3456d8e5e?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item

Published Time: 2026-08-04 12:45:00

Markdown Content: 在推出 Claude Fable 5 之后,Anthropic 曾经的旗舰 Opus 系列除了作为公司高端模型的备选方案之外,未来并不不明朗。如今,它回来了,成为一款适合日常使用、能力很强的主力模型。

!Image 1 **●**最新消息:Anthropic 发布了 Claude Opus 5,这是一款视觉-语言模型,运行成本更低,在许多任务上的表现也优于 Claude Fable 5。

✴ 输入/输出:输入支持文本和图片(最大 100 万 token),输出为文本(最大 128,000 token,52.8 token/秒)

✴ 知识截止时间:2026 年 5 月

✴ 特性:五档推理等级(low、medium、high、xhigh、max;默认 high)、工具使用、从 512 token 起支持提示缓存、约为标准速度 2.5 倍的快速模式、无数据保留

✴ 性能:在 Artificial Analysis 的 Intelligence Index 中排名第一(61 分);在 ARC-AGI-3 上也轻松领先(该测试衡量智能体在陌生交互环境中学习的效率)

✴ 可用性/价格:Claude Max 订阅者默认模型(每月 100-200 美元),也是 Claude Pro 订阅者可用的最强模型(每月 20 美元);API 价格为每 100 万输入/缓存输入/输出 token $5/ $0.50/ $25;快速模式仅限 Claude API,价格为每 100 万输入/缓存输入/输出 token $10/ $1/ $50

✴ 未披露:参数量、架构、训练数据和训练方法 **●**运作方式:Anthropic 仅披露了关于 Claude Opus 5 构建方式的少量信息,主要涉及训练和模型控制的部分。

✴ Anthropic 使用公共和专有数据训练了该模型,包括从公共网站收集的材料以及其他模型生成的数据,然后根据公司在一部宪章中定义的人类价值观对其进行了微调。公司有意将网络安全任务排除在训练之外。

✴ Anthropic 表示,该模型在没有被明确要求时,也更善于将任务委派给子智能体,并且更擅长自我检查。开发者应当避免沿用为早期模型编写的验证相关指令,因为这类指令会让 Claude Opus 5 过度验证。

✴ 被标记为网络安全风险的交互会回退到 Claude Opus 4.8,但这种情况比 Claude Fable 5 更少。一个探针会在每次请求时读取模型的内部激活,并将任何被标记的内容交给第二个模型,由其判断输入和输出。检查内容包括模型读取的一切,例如记忆、文件、搜索结果和连接的工具,其中任何一项都可能触发回退。Anthropic 表示,像扫描源代码漏洞这类日常防御性工作,Claude Opus 5 是允许的;但表面上属于进攻性的请求,例如生成漏洞利用或渗透攻击,则会触发回退。有关生物学、化学和生命科学的问题不会像 Claude Fable 5 那样回退,因为 Anthropic 认为 Claude Opus 5 在这些领域的危险性更低。 性能测试:Claude Opus 5 在许多基准测试中领先,而且单次任务成本低于 Claude Fable 5,但高于大多数其他模型。该模型优势最明显的一项测试,是在陌生环境中的学习能力测试。

✴ 在 Artificial Analysis 的 Intelligence Index 中,这一包含 9 项经济实用型任务评估的综合指标里,Claude Opus 5 以 max 推理设置取得 61 分,略高于启用回退并使用 max 推理的 Claude Fable 5(60 分)、OpenAI 的 GPT-5.6 Sol 以 max 推理设置的成绩(59 分)以及其他所有模型。成本上的差距比能力更明显:Claude Opus 5 平均每项任务 2.03 美元,介于 Claude Fable 5 的每项任务 2.75 美元和 GPT 5.6 Sol 的每项任务 1.54 美元之间。Claude Opus 5 的xhigh 推理设置,在 Artificial Analysis 的 Coding Agent Index 上与 GPT-5.6 Sol 在 max 推理设置上并列第一(67 分)。Claude Opus 5 优于 Claude Fable 5(以及所有其他模型)的其他单项测试还包括 GPTval-AA v2、AA-Briefcase(两者都衡量智能体式知识工作)以及 MMMU-Pro(多模态推理)。

✴ 在 ARC-AGI-3 上,该测试把 AI 智能体放进它们从未玩过的游戏中,并评估它们学习规则的效率,Claude Opus 5 以 high 推理设置取得了 30.2% 的成绩(运行成本 2.07 万美元),几乎是次优模型 OpenAI 的 GPT-5.6 Sol 在max 推理设置上的成绩(7.8%,运行成本 2.51 万美元)的四倍。

✴ Claude Opus 5 以 max 推理设置在 Terminal-Bench 3.0 上名列前茅,该测试衡量模型是否能完成业务工作流,完成了 43.5% 的任务。它在 Zapier 的 AutomationBench 上也表现领先;这是 Terminal-Bench 的继任测试,用于衡量智能体如何解决计算机自动化任务,成功率为 26.2%。

✴ 在 CursorBench 3.2 上,这是 Cursor 在其测试框架内对编程能力的评估,Claude Opus 5(70%,每项任务 8.23 美元)仅次于以 max 推理设置运行的 Claude Fable 5(70.5%,每项任务 17.32 美元)。 新闻背后:7 月 22 日,美国白宫科学顾问迈克尔·克拉齐奥斯表示,Moonshot AI 是通过蒸馏 Claude Fable 5 打造了 Kimi K3——这款开源权重模型在 Artificial Analysis 的 Intelligence Index 中排名第四。美国财政部长斯科特·贝森特威胁将实施制裁。但专家指出,Claude Fable 5 公开可用的时间只有短短几周,根本不足以完成数据蒸馏、模型训练和发布。Laude Institute 的研究员 Braden Hancock 这么说。 **●重要原因**:Claude Opus 5 解决了长期 Claude 用户对 Fable 5 的许多担忧:例如,它对良性科学问题经常回退和拒答、无法包含在大多数订阅方案中、价格高昂,以及苛刻的 30 天数据保留政策。虽然在某些情况下 Claude Fable 5 仍然值得溢价:例如,Claude Opus 5 更容易产生幻觉,事实回忆能力也更弱。而且目前的基准测试可能还没有完全捕捉两者之间的差异。但对大多数开发者的使用场景来说,这都是一次受欢迎的更新。 **●我们在想**:尽管新的 Opus 模型比 Fable 或 Mythos 更便宜,但仍然相当昂贵。虽然其他实验室都在追求更快的速度和更低的成本,Anthropic 却朝相反方向前进:打造更大、更慢、知识更丰富但也更昂贵的模型。该公司押注在网络安全、软件工程和文档生成等领域,客户会愿意支付溢价——在需要更快推理时,他们甚至可能愿意支付双倍费用。

!Image 2

点击下方阅读原文查看更多有趣内容哦~

!Image 3

查看原文 → 發佈: 2026-08-04 12:45:00 收錄: 2026-08-04 22:00:08

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。