Claude Sonnet 5测评:Opus级能力,中端价位
先说结论
Claude Sonnet 5于2026年6月30日上线。一句话总结:这是第一个让人觉得”没必要加钱上Opus”的Sonnet。
不是客套话。跑完一轮基准测试和实际任务后,Sonnet 5在Agent场景下的完成率跟Opus 4.8已经非常接近,某些任务甚至打平。但价格只有Opus的40%。
如果你还在用Sonnet 4.6,升级的理由很充分。如果你在纠结要不要为Opus付费,Sonnet 5可能直接帮你省下这笔钱。
Sonnet 5到底强在哪
从”能用”到”能干完”
之前的Sonnet模型有个典型问题:复杂任务做到一半就停了。比如你让它重构一个跨5个文件的模块,它改完前3个就开始”总结”了,剩下的需要你再催一遍。
Sonnet 5基本解决了这个问题。Anthropic的早期测试伙伴反馈很一致——“以前Sonnet做到一半会停,现在能跑完整个流程。”
一个具体的例子:有工程师让Sonnet 5排查一个Bug,它自己写了复现测试、实现了修复、然后把修复stash掉确认Bug确实会回来、最后再恢复修复提交。全程一次pass,没有人工介入。
这种”自主验证”的行为在Sonnet 4.6上几乎看不到。
编程能力的跨级提升
直接看数据。以下对比来自Anthropic官方发布:
| 评测项 | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Verified | 65.3% | 72.1% | 75.6% |
| Terminal-bench | 43.2% | 55.7% | 59.1% |
| 人类最终考试(有工具) | 46.8% | 58.3% | 66.1% |
| OSWorld-Verified | 78.5% | 88.2% | 91.4% |
| BrowseComp | 39.0% | 55.8% | 60.5% |
几个值得注意的点:
- SWE-bench Verified从65.3%跳到72.1%,接近Opus 4.8的75.6%。这个差距已经很小了。
- BrowseComp(Agent搜索评测)提升最大,从39%到55.8%,几乎翻了1.5倍。
- OSWorld-Verified(计算机操作)达到88.2%,说明Sonnet 5在浏览器自动化和桌面操作方面已经很成熟。
Agent能力:真正的卖点
Sonnet 5的核心定位是”最具Agent能力的Sonnet”。这不是营销话术,从架构上看确实有实质变化。
模型现在能更好地:
- 制定多步骤计划并按顺序执行
- 选择正确的工具(浏览器、终端、API)并在失败时切换策略
- 在长任务中保持上下文一致性,不会中途”忘记”目标
- 主动检查自己的输出,而不是等用户指出问题
Anthropic给出了不同effort级别下的成本-性能曲线。简单说:
- 中等effort下,Sonnet 5的性价比远超Sonnet 4.6和Opus 4.8
- 高effort下,Sonnet 5在部分任务上能追平Opus 4.8
- 你可以通过API的
effort参数灵活调节,简单任务用低effort省钱,复杂任务拉高effort保质量
这意味着一个模型就能覆盖从日常问答到复杂Agent执行的全部场景,不用在多个模型间来回切换。
定价:限时优惠值得抓
| 价格 | 限时价(至2026.8.31) | 标准价 | Opus 4.8 |
|---|---|---|---|
| 输入(每百万token) | $2 | $3 | $5 |
| 输出(每百万token) | $10 | $15 | $25 |
几个关键细节:
- 限时价到8月31日,相当于标准价打了67折。如果你打算迁移,现在开始测试是好时机。
- Sonnet 5使用了新的tokenizer,同样的文本会多消耗约1.0-1.35倍token。限时价的设定就是为了让这个过渡基本平价。
- 结合prompt caching(最高省90%)和batch processing(省50%),实际成本可以进一步压缩。
跟Opus 4.8比,Sonnet 5的标准价是它的60%(输入)和60%(输出)。考虑到性能差距已经缩小到个位数百分点,大部分场景下Sonnet 5的ROI更高。
安全性:比上一代更好
这部分不是套话,有具体数据支撑:
- 幻觉率低于Sonnet 4.6
- 逢迎率(sycophancy)低于Sonnet 4.6 — 不会为了讨好你而编造信息
- Agent安全性提升 — 更好地拒绝恶意请求,更强的prompt injection抵抗
- 整体行为对齐测试得分优于Sonnet 4.6,但略逊于Opus 4.8
一个值得关注的点:Sonnet 5默认启用了网络安全防护(cyber safeguards),跟Opus 4.7和4.8一样。这意味着它不会帮你写漏洞利用代码。如果你有合法的安全测试需求,需要通过Anthropic的Cyber Verification Program申请豁免,或者直接用Opus 4.8。
谁应该升级
立刻升级
- 在用Sonnet 4.6做Agent/自动化的团队:Sonnet 5在多步骤任务完成率上的提升是决定性的。
- 在用Claude Code做日常开发的个人开发者:Sonnet 5已经是Free和Pro计划的默认模型,你可能已经在用了。
- 在考虑Opus但对价格犹豫的人:先试试Sonnet 5 + 高effort,很可能已经够用。
可以观望
- 已经在用Opus 4.8且对效果满意的团队:Opus在推理深度和复杂任务上仍有优势,没必要降级。
- 对网络安全测试有强需求的:Sonnet 5的cyber safeguards限制比较严格,Opus 4.8更合适。
不需要动
- 纯聊天/轻量任务用户:Sonnet 4.6甚至Haiku对你来说已经足够。
在哪里用
Sonnet 5的可用范围很广:
- Claude.ai — 网页端、iOS、Android,Free和Pro用户的默认模型
- Claude Code — 命令行开发工具
- API — 使用模型名
claude-sonnet-5 - 云平台 — AWS(Amazon Bedrock)、Google Cloud(Vertex AI)、Microsoft Foundry
和竞品怎么比
2026年中的AI模型战场非常拥挤。把Sonnet 5放进大盘里看:
| 模型 | 定位 | 输入价格/1M | 输出价格/1M | Agent能力 |
|---|---|---|---|---|
| Claude Sonnet 5 | 中高端全能 | $2-3 | $10-15 | 强 |
| Claude Opus 4.8 | 旗舰推理 | $5 | $25 | 最强 |
| GPT-5.5 | 旗舰编程 | $5 | $30 | 强 |
| DeepSeek V4 Pro | 性价比推理 | $0.44 | $0.87 | 中 |
| GLM-5.2 | 双语编程 | $0.93 | $3 | 中 |
Sonnet 5的位置很清晰:它不是最便宜的,也不是最强的,但在”足够强”和”价格合理”之间找到了一个很好的平衡点。 对于需要可靠Agent能力、不想为顶级模型付全价的团队来说,Sonnet 5是2026年中期最合理的选择之一。
写在最后
Anthropic的模型发布节奏越来越快——Sonnet 3.5、3.6、3.7、4、4.5、4.6、现在是5。版本号的跳跃说明这不是小迭代。
Sonnet 5的核心叙事是**“Agent能力下放”**。以前需要Opus级别模型才能完成的多步骤自主任务,现在Sonnet价位就能做到。这对整个AI应用开发行业的成本结构会产生实质影响。
限时价到8月31日。如果你在做任何形式的AI Agent开发,建议现在就开始测试迁移。