Title: Anthropic 一口气打出两张牌:Sonnet 5 发布,Fable 5 回归,但新闸门也来了 | BestBlogs.dev
URL Source: https://www.bestblogs.dev/article/9722e4ce?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item
Published Time: 2026-07-01 15:37:00
Markdown Content: 81
Anthropic launches Claude Sonnet 5 and restores global access to Fable 5; Sonnet 5 focuses on Agent scenarios with improved cost-effectiveness, while Fable 5 adds a safety classifier that may impact normal tasks. A AINLP
Yesterday 3455 words (about 14 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
原创 NLPer 2026-07-01 15:37 江苏
Sonnet 5 发布,Fable 5 回归,但新闸门也来了
今天,Anthropic 一边发布 Claude Sonnet 5,一边把 Fable 5 重新带回全球访问通道;Mythos 5 的出口管制也已经解除,目前先恢复给一组美国机构。
Anthropic 把 Sonnet 5 放在 Agent 场景里介绍:规划、浏览器和终端工具、自主运行、编程,以及日常知识工作,都是这次主打的方向。
几个入口也已经到位。Sonnet 5 面向所有 Claude 套餐开放,并成为 Free 和 Pro 的默认模型;Max、Team、Enterprise 用户可以使用;Claude Code 和 Claude Platform 也同步接入,API 里可以直接调用claude-sonnet-5。
价格会影响它能不能成为日常模型。到 2026 年 8 月 31 日前,Sonnet 5 的发布期价格是输入 10/百万 token;之后恢复到输入 15/百万 token。Claude Platform 文档还列出了 1M tokens 上下文窗口、128k 最大输出和 2026 年 1 月可靠知识截止。
Fable 5 和 Mythos 5 的消息也在同一天出现。Fable 5 回到全球访问通道,Mythos 5 先从一组美国机构恢复;Sonnet 5 进入默认模型、开发工具和 API,负责承担更便宜、更常用的 Agent 任务。
Sonnet 这次追的是 Agent 能力
Anthropic 把 Sonnet 5 和 Sonnet 4.6、Opus 4.8 放在一起对比。它给出的定位很直接:Sonnet 5 在推理、工具使用、编程和知识工作这些 Agent 能力上,相比 Sonnet 4.6 有明显提升;不少项目接近 Opus 4.8,但价格更低。
Claude Sonnet 5 与 Sonnet 4.6、Opus 4.8 的多项评测对比
过去一年,Claude Code、Claude for Chrome、Skills 等更新都在把模型推向更长的工具链:模型要能计划任务、使用浏览器、操作终端、理解代码库、处理文件、读失败日志,再把结果交付出来。Sonnet 5 接上的正是这条线。
它的分工也就很清楚了:日常仓库任务、资料检索、代码修改、长文档处理,可以先交给 Sonnet 5;高难架构判断、关键代码审查、复杂推理,再把 Opus 4.8 放到更靠后的位置。
Fable 5 重新上线,但加了一层新闸门
6 月 12 日,美国政府对 Claude Fable 5 和 Claude Mythos 5 施加出口管制,要求 Anthropic 限制外国公民访问。由于当时没有办法实时可靠验证用户国籍,Anthropic 暂停了所有用户对这两个模型的访问。
到 6 月 30 日,Fable 5 和 Mythos 5 的出口管制解除。Fable 5 从 7 月 1 日开始面向全球用户恢复,在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上可用。Pro、Max、Team 和部分 Enterprise 计划中,Fable 5 到 7 月 7 日前最多可占每周使用额度的 50%,之后通过 usage credits 使用。AWS、Google Cloud 和 Microsoft Foundry 的访问会尽快恢复。
Mythos 5 的恢复节奏更谨慎。Anthropic 说,在美国政府 6 月 26 日批准后,已经为一组美国机构恢复了 Mythos 5 访问,并继续和政府协调,逐步扩大到 Glasswing 项目里的更多国内和国际伙伴。
Fable 5 重新上线时,多了一套新的安全分类器。Anthropic 说,Amazon 研究人员此前发现了一种绕过 Fable 5 安全措施的方法,能够让模型识别一些软件漏洞。Anthropic 后来和政府合作训练了改进版分类器,专门拦截这类行为。按照它的说法,Amazon 报告中描述的具体技术现在会在超过 99% 的情况下被拦截。
Anthropic 用安全分类器识别正常请求、模糊请求和潜在危险请求,并为 Fable 5 放大安全余量。
这套分类器也有代价。Anthropic 明确说,短期内,一些日常任务,比如 coding 和 debugging,也可能被误判并回退到 Opus 4.8。它会在接下来几周继续调细分类器,减少误伤,更好地区分滥用和正常请求。
Fable 5 重新部署后,Anthropic 还开始处理另一个问题:行业里到底该怎么衡量 jailbreak 的严重程度。公司正在和 Amazon、Microsoft、Google 以及其他 Glasswing 伙伴起草一个共识框架,讨论模型开发者应该如何响应。这个框架会看几个因素:jailbreak 带来的能力提升有多大、影响范围有多宽、是否容易武器化、是否容易被发现。
Anthropic 对 jailbreak 与安全分类器关系的示意图,区分 minor jailbreak、narrow harmful jailbreak 和 universal jailbreak。
同时,Anthropic 也会扩大和美国政府在模型测试与防护上的合作,包括给政府提供模型和安全措施的预发布评估访问、共享 jailbreak 和滥用信息,以及投入资源做联合研究。
Fable 5 能重新访问了,但门口多了一道更敏感的检查。普通用户能重新访问,部分高风险或容易被误伤的任务会回退到 Opus 4.8,行业和政府也会围绕 jailbreak 评估建立新的共识框架。
评测结果:重点看成本性能曲线
这次公告里最有参考价值的是两张成本性能曲线。
第一张是 BrowseComp。这个评测主要看 Agentic Search,也就是模型在复杂搜索任务中的表现。Anthropic 把 Sonnet 5、Sonnet 4.6 和 Opus 4.8 放在不同 effort level 下比较,Sonnet 5 的曲线覆盖了更宽的成本性能区间。公告还在 changelog 里补充了一点:最初版本的 BrowseComp 图表方法较简单,后来更新为系统卡里使用的方法,包括 10M token budget、compaction 和 programmatic tool calling。
图 3:BrowseComp 成本性能曲线,Anthropic 后续更新过该图表的方法口径。
第二张是 OSWorld-Verified。这个评测更接近“模型操作电脑完成任务”的场景。对于 Claude Code 或浏览器/终端工具使用来说,这类评测比纯文本问答更能反映模型是否适合长程任务。
OSWorld-Verified 成本性能曲线,用来观察 Sonnet 5 在 computer use 场景下的成本和效果。
放到开发场景里,结论会更直接:日常编码、代码审查、资料检索、自动化脚本和知识工作,可以更多交给 Sonnet 5;特别复杂或风险更高的任务,再切到 Opus 4.8。
Claude Code 和 API 怎么用
Claude Sonnet 5 已经进入 Claude Code,这一点比普通聊天入口更重要。
Coding agent 的成本通常发生在“循环”里:读代码、生成方案、修改文件、跑命令、看报错、继续修。一个模型如果只在单轮代码生成里表现好,不一定能在真实仓库任务里省钱;体验好不好,要看它能不能稳定完成多轮工具调用,并把失败状态收回来继续推进。
Sonnet 5 的价格卡在这个位置上。发布期 10,适合高频使用;常规 15,也明显低于 Opus 4.8 的 25。对团队来说,可以把 Sonnet 5 放在默认开发流里跑,把 Opus 留给更复杂、更需要强推理的节点。
| 使用场景 | 更适合先用谁 | | --- | --- | | 日常代码解释、局部修改、脚本生成 | Sonnet 5 | | Claude Code 里的常规仓库任务 | Sonnet 5 | | 长文档检索、资料整理、报告初稿 | Sonnet 5 | | 多工具、多步骤、成本敏感的 Agent 工作流 | Sonnet 5 起步,必要时切 Opus | | 高风险架构判断、复杂推理、关键代码审查 | Opus 4.8 更稳妥 |
对开发团队来说,模型只有足够便宜、足够稳,才会被放进默认流程。Sonnet 5 要争的就是这个位置。
安全评估
Anthropic 在公告里把安全评估放得比较靠前。按照它的说法,Sonnet 5 在自动行为审计里整体不良行为率低于 Sonnet 4.6,幻觉和谄媚也低于 Sonnet 4.6;但和 Opus 4.8、Claude Mythos Preview 相比,Sonnet 5 在某些 misaligned behavior 指标上仍然更高。
Sonnet 5 在自动行为审计中的不良行为率低于 Sonnet 4.6,但高于 Opus 4.8 和 Mythos Preview。
网络安全能力也有一个细节。Anthropic 说 Sonnet 5 没有专门针对网络安全任务训练,在 Firefox 147 漏洞 exploit 评估中,Sonnet 5 和 Sonnet 4.6 都没有成功开发出完整可用 exploit;Sonnet 5 的部分成功率略高于 Sonnet 4.6,但仍明弱于 Opus 4.8 和 Mythos 5。