Claude Sonnet 5测评:Opus级能力,中端价位

·
review claude sonnet anthropic

先说结论

Claude Sonnet 5于2026年6月30日上线。一句话总结:这是第一个让人觉得”没必要加钱上Opus”的Sonnet。

不是客套话。跑完一轮基准测试和实际任务后,Sonnet 5在Agent场景下的完成率跟Opus 4.8已经非常接近,某些任务甚至打平。但价格只有Opus的40%。

如果你还在用Sonnet 4.6,升级的理由很充分。如果你在纠结要不要为Opus付费,Sonnet 5可能直接帮你省下这笔钱。

Sonnet 5到底强在哪

从”能用”到”能干完”

之前的Sonnet模型有个典型问题:复杂任务做到一半就停了。比如你让它重构一个跨5个文件的模块,它改完前3个就开始”总结”了,剩下的需要你再催一遍。

Sonnet 5基本解决了这个问题。Anthropic的早期测试伙伴反馈很一致——“以前Sonnet做到一半会停,现在能跑完整个流程。”

一个具体的例子:有工程师让Sonnet 5排查一个Bug,它自己写了复现测试、实现了修复、然后把修复stash掉确认Bug确实会回来、最后再恢复修复提交。全程一次pass,没有人工介入。

这种”自主验证”的行为在Sonnet 4.6上几乎看不到。

编程能力的跨级提升

直接看数据。以下对比来自Anthropic官方发布:

评测项Sonnet 4.6Sonnet 5Opus 4.8
SWE-bench Verified65.3%72.1%75.6%
Terminal-bench43.2%55.7%59.1%
人类最终考试(有工具)46.8%58.3%66.1%
OSWorld-Verified78.5%88.2%91.4%
BrowseComp39.0%55.8%60.5%

几个值得注意的点:

  • SWE-bench Verified从65.3%跳到72.1%,接近Opus 4.8的75.6%。这个差距已经很小了。
  • BrowseComp(Agent搜索评测)提升最大,从39%到55.8%,几乎翻了1.5倍。
  • OSWorld-Verified(计算机操作)达到88.2%,说明Sonnet 5在浏览器自动化和桌面操作方面已经很成熟。

Agent能力:真正的卖点

Sonnet 5的核心定位是”最具Agent能力的Sonnet”。这不是营销话术,从架构上看确实有实质变化。

模型现在能更好地:

  • 制定多步骤计划并按顺序执行
  • 选择正确的工具(浏览器、终端、API)并在失败时切换策略
  • 在长任务中保持上下文一致性,不会中途”忘记”目标
  • 主动检查自己的输出,而不是等用户指出问题

Anthropic给出了不同effort级别下的成本-性能曲线。简单说:

  • 中等effort下,Sonnet 5的性价比远超Sonnet 4.6和Opus 4.8
  • 高effort下,Sonnet 5在部分任务上能追平Opus 4.8
  • 你可以通过API的effort参数灵活调节,简单任务用低effort省钱,复杂任务拉高effort保质量

这意味着一个模型就能覆盖从日常问答到复杂Agent执行的全部场景,不用在多个模型间来回切换。

定价:限时优惠值得抓

价格限时价(至2026.8.31)标准价Opus 4.8
输入(每百万token)$2$3$5
输出(每百万token)$10$15$25

几个关键细节:

  1. 限时价到8月31日,相当于标准价打了67折。如果你打算迁移,现在开始测试是好时机。
  2. Sonnet 5使用了新的tokenizer,同样的文本会多消耗约1.0-1.35倍token。限时价的设定就是为了让这个过渡基本平价。
  3. 结合prompt caching(最高省90%)和batch processing(省50%),实际成本可以进一步压缩。

跟Opus 4.8比,Sonnet 5的标准价是它的60%(输入)和60%(输出)。考虑到性能差距已经缩小到个位数百分点,大部分场景下Sonnet 5的ROI更高。

安全性:比上一代更好

这部分不是套话,有具体数据支撑:

  • 幻觉率低于Sonnet 4.6
  • 逢迎率(sycophancy)低于Sonnet 4.6 — 不会为了讨好你而编造信息
  • Agent安全性提升 — 更好地拒绝恶意请求,更强的prompt injection抵抗
  • 整体行为对齐测试得分优于Sonnet 4.6,但略逊于Opus 4.8

一个值得关注的点:Sonnet 5默认启用了网络安全防护(cyber safeguards),跟Opus 4.7和4.8一样。这意味着它不会帮你写漏洞利用代码。如果你有合法的安全测试需求,需要通过Anthropic的Cyber Verification Program申请豁免,或者直接用Opus 4.8。

谁应该升级

立刻升级

  • 在用Sonnet 4.6做Agent/自动化的团队:Sonnet 5在多步骤任务完成率上的提升是决定性的。
  • 在用Claude Code做日常开发的个人开发者:Sonnet 5已经是Free和Pro计划的默认模型,你可能已经在用了。
  • 在考虑Opus但对价格犹豫的人:先试试Sonnet 5 + 高effort,很可能已经够用。

可以观望

  • 已经在用Opus 4.8且对效果满意的团队:Opus在推理深度和复杂任务上仍有优势,没必要降级。
  • 对网络安全测试有强需求的:Sonnet 5的cyber safeguards限制比较严格,Opus 4.8更合适。

不需要动

  • 纯聊天/轻量任务用户:Sonnet 4.6甚至Haiku对你来说已经足够。

在哪里用

Sonnet 5的可用范围很广:

  • Claude.ai — 网页端、iOS、Android,Free和Pro用户的默认模型
  • Claude Code — 命令行开发工具
  • API — 使用模型名 claude-sonnet-5
  • 云平台 — AWS(Amazon Bedrock)、Google Cloud(Vertex AI)、Microsoft Foundry

和竞品怎么比

2026年中的AI模型战场非常拥挤。把Sonnet 5放进大盘里看:

模型定位输入价格/1M输出价格/1MAgent能力
Claude Sonnet 5中高端全能$2-3$10-15
Claude Opus 4.8旗舰推理$5$25最强
GPT-5.5旗舰编程$5$30
DeepSeek V4 Pro性价比推理$0.44$0.87
GLM-5.2双语编程$0.93$3

Sonnet 5的位置很清晰:它不是最便宜的,也不是最强的,但在”足够强”和”价格合理”之间找到了一个很好的平衡点。 对于需要可靠Agent能力、不想为顶级模型付全价的团队来说,Sonnet 5是2026年中期最合理的选择之一。

写在最后

Anthropic的模型发布节奏越来越快——Sonnet 3.5、3.6、3.7、4、4.5、4.6、现在是5。版本号的跳跃说明这不是小迭代。

Sonnet 5的核心叙事是**“Agent能力下放”**。以前需要Opus级别模型才能完成的多步骤自主任务,现在Sonnet价位就能做到。这对整个AI应用开发行业的成本结构会产生实质影响。

限时价到8月31日。如果你在做任何形式的AI Agent开发,建议现在就开始测试迁移。