← 回總覽

Claude 性价比之王 Sonnet 5 来了!Claude Code 终于补上最缺的“执行者”

📅 2026-07-01 12:30 51CTO技术栈 人工智能 7 分鐘 7955 字 評分: 80
Claude Sonnet 5 AI 模型 模型评测与基准 AI 编程 AI 安全
📌 一句话摘要 本文报道 Claude Sonnet 5 的发布与性能定位,结合基准测试、安全性分析和社区争议,探讨其作为高频执行模型的性价比与适用场景。 📝 详细摘要 文章完整报道了 Anthropic 发布 Claude Sonnet 5 的消息,官方定位为“接近 Opus 4.8 的思考能力,同时保留 Sonnet 系列的速度”。文章引用 SWE-bench、Terminal-Bench、Humanity's Last Exam 等基准测试数据,展示其在多数指标上接近 Opus 4.8 但仍有差距。重点分析了 Sonnet 5 的 1M 上下文窗口、128K 最大输出、5 档 eff

80

This article covers the release and performance positioning of Claude Sonnet 5, combining benchmark tests, security analysis, and community debates to explore its cost-effectiveness and use cases as a high-frequency execution model. 5 51CTO技术栈

Yesterday 3487 words (about 14 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

原创 大石 2026-07-01 12:30 美国

!Image 1

今天凌晨,Anthropic终于把Claude Sonnet 5端上来了!

!Image 2

!Image 3

编辑 | 大石

今天凌晨,Anthropic终于把Claude Sonnet 5端上来了!

官方给它的定位是“Near-Opus thinking, at Sonnet speed"。

接近 Claude Opus 4.8的思考能力,同时保留Sonnet系列的速度。!Image 4

Anthropic称其为迄今为止 最具主导性的模型。

•接近Opus 4.8级表现,但成本更低

• 推理、工具使用、编程和知识工作有显著提升

• 免费和专业用户的默认模式

• 现已提供 Claude 代码和 API 版本

•折扣 定价:2美元/M输入,10美元/M输出,折扣日期至8月31 日

•标准定价:3美元/M输入,15美元/M输出

• 整体比Sonnet 4.6更安全,幻觉和谄媚率更低

• 网络安全措施默认启用,但Anthropic表示,Opus在严肃的网络工作中依然更为强大

目前,Claude Sonnet 5已经出现在 Perplexity的模型列表中,成为用户的默认模型。

全面逼近Opus 4.8,性价比之王来了?

先看官方数据。

Sonnet 5在SWE-bench Pro得分63.2%,稍逊Opus 4.8的69.2%,超过GPT-5.5的58.6%

在Terminal-Bench 2.1是80.4%,仅仅比Opus 4.8是少2.3%;

在Humanity’s Last Exam差距更小,仅仅相差0.5%,甚至可以忽略不计。

虽然差距还在。但 Claude Sonnet 5已经跨过普通中档模型。

大量开发任务并不需要模型拿第一,只需要它用更低成本把事情推进到可检查状态。修bug、补测试、读旧代码、小范围重构,都属于这一类。

Claude Opus 4.8适合留给高风险判断和难题。Claude Sonnet 5更适合放在高频执行位置。

!Image 5

Anthropic官方基准测试图:Claude Sonnet 5整体接近Claude Opus 4.8,但多数项目仍低于Claude Opus 4.8。

Claude Sonnet 5补充了执行能力

> Claudeai:Built to run, not just respond(模型不能只会聊天,还得能真正把任务跑下去。)

参数层面,1M上下文窗口、128K最大输出、5档effort控制都指向同一件事:让模型接更长的任务链。

Sonnet 4.6里adaptive thinking还是可选,到了Sonnet 5变成默认能力。

在两个模型对比中,coding和agentic strength也被标成接近Claude Opus质量。

就作品质量而言,Opus赢了。在模型速度和成本方面,Sonnet 5获胜。

effort:它更像“干活模型”了

把通过率和每个任务成本连着看。

Claude Sonnet 5从low到max的曲线覆盖范围更宽,在一些投入水平下可以接近Claude Opus 4.8,同时成本低于图中同档Claude Opus 4.8。

实际使用时,小修小补可以放在低 effort,迁移、调试、跨文件改动再拉高。任务能分档,账单也不用一开始就冲到最贵模式。

!Image 6

Anthropic原文图:不同effort水平下,Claude Sonnet 5在Agentic search任务里的性能和成本曲线。

Cursor火速接入,开发者场景先跑起来了

Sonnet 5发布之后,Cursor立刻宣布Claude Sonnet 5上线。

!Image 7

Claude Sonnet 5已在Cursor上线,CursorBench从Claude Sonnet 4.6的49%提升到57%。

CursorBench 3.1里,Sonnet 5默认档拿到57%,Sonnet 4.6 high是49%。Sonnet 5的位置接近Opus 4.8 high,但平均任务成本更低。

落到日常工作里,开发工具会是它最早被反复调用的入口之一。

读项目结构、产出修改计划;修 bug时补复现测试;处理依赖升级和接口迁移。它干的是那些一天里反复出现、每次都要消耗注意力的活。

安全性拉满,开发者不能只看跑分

除了跑分,System Card里的安全测试也得看。

Agent模型一旦能读代码、跑浏览器、调用终端,风险就从回答错误变成操作错误。网页、README、issue、日志、代码注释里都可能藏着间接提示注入。

模型如果照着恶意指令走,就可能泄露信息、改错文件、执行不该执行的操作。

System Card里,Anthropic专门做了Shade间接提示注入测试。

在coding environments里,Sonnet 5带thinking时,无防护攻击成功率是0.31%;加上safeguards之后降到0.09%。

同一情境下,Opus 4.8带thinking无防护是7.03%。是Sonnet 5的数倍!

!Image 8

Claude Sonnet 5 System Card:Shade间接提示注入在编码环境中的攻击成功率,越低越好。

System Card还给了Firefox 147 exploit development测试。

Anthropic表示,Claude Sonnet 5在这个漏洞利用测试上比Claude Sonnet 4.6略有提升,但仍明显低于Claude Opus 4.8和Claude Mythos 5;

在开启默认安全缓解后,Claude Sonnet 5在Firefox 147上得分为0。

!Image 9

对开发者更重要的是安全性表现。Claude Sonnet 5如果要进Claude Code、Cursor和浏览器类Agent,提示注入、工具权限、滥用防护会直接影响它能不能被放心交到工作流里。

网友不买账?是虚假账单还是模型问题

不过,Claude Sonnet 5发布后,争议也来得很快。

最直接的不满,集中在一句话上: Sonnet这一档,原本就应该更快、更便宜、更能干。

但这次不少用户看完CursorBench和成本图后,第一反应并不是惊喜,而是困惑。

有网友直接吐槽,Anthropic在Claude Sonnet 5上“搞砸了”。原因很简单:代币效率太差,价格甚至比Claude Opus 4.8还贵。

!Image 10

!Image 11

这里说的不是标准API单价,而是放到具体任务里算出来的成本。

官网页面显示,它的标准价是输入3美元/百万token、输出15美元/百万token。

发布期还有优惠价,输入2美元、输出10美元。

相比Opus 4.8的输入5美元、输出25美元,乍看 Sonnet 5确实便宜一档。

但问题在于,Sonnet 5 Max比Opus 4.8 Max只便宜了0.72美元,得分还更低,消耗token却更多。

这就触到了开发者最敏感的地方。

如果一个Sonnet模型只是“比Opus略便宜一点”,那它为什么还叫Sonnet?

过去大家接受Sonnet,是因为它承担的是高频任务:速度快、价格低、够稳定。

你可以把一堆日常开发任务交给它,不用每次都心疼账单。

可如果Claude Sonnet 5在Max档下接近Claude Opus 4.8的成本,却没有拿到Claude Opus 4.8的效果,那开发者自然会问一句: 我为什么不直接用Claude Opus 4.8?

!Image 12

这也是这次争议最核心的地方。

Claude Sonnet 5不是没用,它的问题是定位被价格拖住了。

低effort和默认档下,它依然适合做Claude Code里的执行模型,用来跑常规任务、修bug、补测试、处理迁移。

但一旦开到Max,把它当成“便宜版Claude Opus 4.8”来用,性价比就会变得很尴尬。

所以这次Claude Sonnet 5真正要证明的,不是它能不能在某些榜单上接近Claude Opus 4.8。

它要证明的是: 在开发者每天反复调用的那些任务里,它能不能稳定地省时间、省token、省钱。

别把它当成 Claude Opus 4.8的廉价替身

拿 Claude Sonnet 5硬刚Claude Opus 4.8,尤其是开高effort、跑高成本bench,它可能并不划算。

真实开发里,模型不只有“最强”和“没用”两个位置。

Claude Sonnet 5更适合放在Claude Code的执行层。

它负责快速跑流程、改代码、补测试、交结果。

人负责设边界、看风险、决定合不合并。

社区里已经有人给出一种用法,先把模型切到 Claude Sonnet 5,再把effort设到Ultracode,复杂任务交给Claude Code Dynamic Workflows,让它启动更完整的动态流程。

> /model set to Claude Sonnet 5 /effort Ultracode 复杂任务启动Dynamic Workflows

这套用法是让 Claude Sonnet 5先走流程,把能自动化的部分跑完,再把结果交给开发者审。

如果 Fable 5回来,Claude Sonnet 5可能会更强大

Claude Sonnet 5 来了。

几乎所有基准测试都比Opus 4.8还差,这是不是意味着它没用?

绝对不是。用它配合Claude Code Dynamic Workflows!

Fable 5回归后,分工可以更清楚。

Fable 5做复杂推理、架构判断、方案取舍。Claude Sonnet 5做实现、测试、diff整理。

一个负责把方向想清楚,一个负责把任务跑出来。开发者卡在中间,给边界、收结果、做最后的技术判断。

或许它真正的价值,还要等待开发者们探索!

查看原文 → 發佈: 2026-07-01 12:30:00 收錄: 2026-07-02 00:00:17

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。