80
This article covers the release and performance positioning of Claude Sonnet 5, combining benchmark tests, security analysis, and community debates to explore its cost-effectiveness and use cases as a high-frequency execution model. 5 51CTO技术栈
Yesterday 3487 words (about 14 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
原创 大石 2026-07-01 12:30 美国
今天凌晨,Anthropic终于把Claude Sonnet 5端上来了!
编辑 | 大石
今天凌晨,Anthropic终于把Claude Sonnet 5端上来了!
官方给它的定位是“Near-Opus thinking, at Sonnet speed"。
接近 Claude Opus 4.8的思考能力,同时保留Sonnet系列的速度。!Image 4
Anthropic称其为迄今为止 最具主导性的模型。
•接近Opus 4.8级表现,但成本更低
• 推理、工具使用、编程和知识工作有显著提升
• 免费和专业用户的默认模式
• 现已提供 Claude 代码和 API 版本
•折扣 定价:2美元/M输入,10美元/M输出,折扣日期至8月31 日
•标准定价:3美元/M输入,15美元/M输出
• 整体比Sonnet 4.6更安全,幻觉和谄媚率更低
• 网络安全措施默认启用,但Anthropic表示,Opus在严肃的网络工作中依然更为强大
目前,Claude Sonnet 5已经出现在 Perplexity的模型列表中,成为用户的默认模型。
全面逼近Opus 4.8,性价比之王来了?
先看官方数据。
Sonnet 5在SWE-bench Pro得分63.2%,稍逊Opus 4.8的69.2%,超过GPT-5.5的58.6%
在Terminal-Bench 2.1是80.4%,仅仅比Opus 4.8是少2.3%;
在Humanity’s Last Exam差距更小,仅仅相差0.5%,甚至可以忽略不计。
虽然差距还在。但 Claude Sonnet 5已经跨过普通中档模型。
大量开发任务并不需要模型拿第一,只需要它用更低成本把事情推进到可检查状态。修bug、补测试、读旧代码、小范围重构,都属于这一类。
Claude Opus 4.8适合留给高风险判断和难题。Claude Sonnet 5更适合放在高频执行位置。
Anthropic官方基准测试图:Claude Sonnet 5整体接近Claude Opus 4.8,但多数项目仍低于Claude Opus 4.8。
Claude Sonnet 5补充了执行能力
> Claudeai:Built to run, not just respond(模型不能只会聊天,还得能真正把任务跑下去。)
参数层面,1M上下文窗口、128K最大输出、5档effort控制都指向同一件事:让模型接更长的任务链。
Sonnet 4.6里adaptive thinking还是可选,到了Sonnet 5变成默认能力。
在两个模型对比中,coding和agentic strength也被标成接近Claude Opus质量。
就作品质量而言,Opus赢了。在模型速度和成本方面,Sonnet 5获胜。
effort:它更像“干活模型”了
把通过率和每个任务成本连着看。
Claude Sonnet 5从low到max的曲线覆盖范围更宽,在一些投入水平下可以接近Claude Opus 4.8,同时成本低于图中同档Claude Opus 4.8。
实际使用时,小修小补可以放在低 effort,迁移、调试、跨文件改动再拉高。任务能分档,账单也不用一开始就冲到最贵模式。
Anthropic原文图:不同effort水平下,Claude Sonnet 5在Agentic search任务里的性能和成本曲线。
Cursor火速接入,开发者场景先跑起来了
Sonnet 5发布之后,Cursor立刻宣布Claude Sonnet 5上线。
Claude Sonnet 5已在Cursor上线,CursorBench从Claude Sonnet 4.6的49%提升到57%。
CursorBench 3.1里,Sonnet 5默认档拿到57%,Sonnet 4.6 high是49%。Sonnet 5的位置接近Opus 4.8 high,但平均任务成本更低。
落到日常工作里,开发工具会是它最早被反复调用的入口之一。
读项目结构、产出修改计划;修 bug时补复现测试;处理依赖升级和接口迁移。它干的是那些一天里反复出现、每次都要消耗注意力的活。
安全性拉满,开发者不能只看跑分
除了跑分,System Card里的安全测试也得看。
Agent模型一旦能读代码、跑浏览器、调用终端,风险就从回答错误变成操作错误。网页、README、issue、日志、代码注释里都可能藏着间接提示注入。
模型如果照着恶意指令走,就可能泄露信息、改错文件、执行不该执行的操作。
System Card里,Anthropic专门做了Shade间接提示注入测试。
在coding environments里,Sonnet 5带thinking时,无防护攻击成功率是0.31%;加上safeguards之后降到0.09%。
同一情境下,Opus 4.8带thinking无防护是7.03%。是Sonnet 5的数倍!
Claude Sonnet 5 System Card:Shade间接提示注入在编码环境中的攻击成功率,越低越好。
System Card还给了Firefox 147 exploit development测试。
Anthropic表示,Claude Sonnet 5在这个漏洞利用测试上比Claude Sonnet 4.6略有提升,但仍明显低于Claude Opus 4.8和Claude Mythos 5;
在开启默认安全缓解后,Claude Sonnet 5在Firefox 147上得分为0。
对开发者更重要的是安全性表现。Claude Sonnet 5如果要进Claude Code、Cursor和浏览器类Agent,提示注入、工具权限、滥用防护会直接影响它能不能被放心交到工作流里。
网友不买账?是虚假账单还是模型问题
不过,Claude Sonnet 5发布后,争议也来得很快。
最直接的不满,集中在一句话上: Sonnet这一档,原本就应该更快、更便宜、更能干。
但这次不少用户看完CursorBench和成本图后,第一反应并不是惊喜,而是困惑。
有网友直接吐槽,Anthropic在Claude Sonnet 5上“搞砸了”。原因很简单:代币效率太差,价格甚至比Claude Opus 4.8还贵。
这里说的不是标准API单价,而是放到具体任务里算出来的成本。
官网页面显示,它的标准价是输入3美元/百万token、输出15美元/百万token。
发布期还有优惠价,输入2美元、输出10美元。
相比Opus 4.8的输入5美元、输出25美元,乍看 Sonnet 5确实便宜一档。
但问题在于,Sonnet 5 Max比Opus 4.8 Max只便宜了0.72美元,得分还更低,消耗token却更多。
这就触到了开发者最敏感的地方。
如果一个Sonnet模型只是“比Opus略便宜一点”,那它为什么还叫Sonnet?
过去大家接受Sonnet,是因为它承担的是高频任务:速度快、价格低、够稳定。
你可以把一堆日常开发任务交给它,不用每次都心疼账单。
可如果Claude Sonnet 5在Max档下接近Claude Opus 4.8的成本,却没有拿到Claude Opus 4.8的效果,那开发者自然会问一句: 我为什么不直接用Claude Opus 4.8?
这也是这次争议最核心的地方。
Claude Sonnet 5不是没用,它的问题是定位被价格拖住了。
低effort和默认档下,它依然适合做Claude Code里的执行模型,用来跑常规任务、修bug、补测试、处理迁移。
但一旦开到Max,把它当成“便宜版Claude Opus 4.8”来用,性价比就会变得很尴尬。
所以这次Claude Sonnet 5真正要证明的,不是它能不能在某些榜单上接近Claude Opus 4.8。
它要证明的是: 在开发者每天反复调用的那些任务里,它能不能稳定地省时间、省token、省钱。
别把它当成 Claude Opus 4.8的廉价替身
拿 Claude Sonnet 5硬刚Claude Opus 4.8,尤其是开高effort、跑高成本bench,它可能并不划算。
真实开发里,模型不只有“最强”和“没用”两个位置。
Claude Sonnet 5更适合放在Claude Code的执行层。
它负责快速跑流程、改代码、补测试、交结果。
人负责设边界、看风险、决定合不合并。
社区里已经有人给出一种用法,先把模型切到 Claude Sonnet 5,再把effort设到Ultracode,复杂任务交给Claude Code Dynamic Workflows,让它启动更完整的动态流程。
> /model set to Claude Sonnet 5 /effort Ultracode 复杂任务启动Dynamic Workflows
这套用法是让 Claude Sonnet 5先走流程,把能自动化的部分跑完,再把结果交给开发者审。
如果 Fable 5回来,Claude Sonnet 5可能会更强大
Claude Sonnet 5 来了。
几乎所有基准测试都比Opus 4.8还差,这是不是意味着它没用?
绝对不是。用它配合Claude Code Dynamic Workflows!
Fable 5回归后,分工可以更清楚。
Fable 5做复杂推理、架构判断、方案取舍。Claude Sonnet 5做实现、测试、diff整理。
一个负责把方向想清楚,一个负责把任务跑出来。开发者卡在中间,给边界、收结果、做最后的技术判断。
或许它真正的价值,还要等待开发者们探索!