Claude Sonnet 5 評測:Opus 戰力,中階價格
懶人包
Claude Sonnet 5 在 2026 年 6 月 30 日上線。一句話總結:這是第一款讓你認真考慮「我還需要 Opus 嗎?」的 Sonnet。
跑完基準測試和實際任務後,Sonnet 5 的 Agent 任務完成率已經逼近 Opus 4.8——某些場景甚至打平。價格只有 Opus 的四成。
還在用 Sonnet 4.6?直接升級,不用想。一直在猶豫要不要花錢買 Opus?Sonnet 5 很可能幫你省下這筆開銷。
到底改了什麼
從「能開始」變成「能做完」
之前的 Sonnet 有個老毛病:複雜任務做到一半就放棄。叫它重構一個橫跨 5 個檔案的模組,它改完 3 個就開始「總結」,然後坐等你下一個 prompt。
Sonnet 5 基本上修掉了這個問題。早期測試夥伴的回饋一致——以前會卡住的任務,現在能跑到底。
舉個實際例子:一位工程師要求 Sonnet 5 調查一個 bug。它在沒有額外提示的情況下,自己寫了重現測試、實作修復、把修復 stash 掉確認 bug 重現、再恢復修復並 commit。一次搞定,全程零人工介入。
這種自我驗證的行為,在 Sonnet 4.6 上幾乎不存在。
程式設計效能直接跳一個檔次
以下是 Anthropic 官方公佈的數字:
| Benchmark | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Verified | 65.3% | 72.1% | 75.6% |
| Terminal-bench | 43.2% | 55.7% | 59.1% |
| Humanity’s Last Exam (tools) | 46.8% | 58.3% | 66.1% |
| OSWorld-Verified | 78.5% | 88.2% | 91.4% |
| BrowseComp | 39.0% | 55.8% | 60.5% |
重點整理:
- SWE-bench Verified 從 65.3% 跳到 72.1%,距離 Opus 4.8 的 75.6% 只剩個位數差距。
- BrowseComp(Agent 搜尋)進步最大 — 從 39% 衝到 55.8%,接近 1.5 倍的提升。
- OSWorld-Verified 來到 88.2%,代表 Sonnet 5 在瀏覽器自動化和桌面任務上已經相當成熟。
Agent 能力:真正的賣點
Sonnet 5 被定位為「史上最強 Agent 能力的 Sonnet」。這不是行銷話術——背後有實質的架構改進。
這個模型現在能處理:
- 多步驟規劃搭配循序執行
- 正確選擇工具(瀏覽器、終端機、API),失敗時有備用策略
- 在長任務中維持上下文一致性,不會「忘記」目標
- 主動驗證輸出結果,不用你額外交代
Anthropic 有針對不同 effort 等級的 CP 值圖表,重點是:
- 中等 effort 下,Sonnet 5 的性價比遠勝 Sonnet 4.6 和 Opus 4.8
- 高 effort 下,Sonnet 5 在部分任務上追平 Opus 4.8
- 你可以透過 API 的
effort參數控制——簡單任務用低 effort 省錢,複雜工作再調高
也就是說,一個模型就能涵蓋從日常問答到複雜 Agent 執行的所有場景,不用在模型之間切來切去。
價格:上市時間點很重要
| 推廣價(至 8 月 31 日) | 標準價 | Opus 4.8 | |
|---|---|---|---|
| 輸入(每 1M tokens) | $2 | $3 | $5 |
| 輸出(每 1M tokens) | $10 | $15 | $25 |
幾個重要細節:
- 推廣價在 8 月 31 日到期 — 大約是標準價的 67%。想遷移的話,現在就該開始測試。
- Sonnet 5 用了新的 tokenizer,同樣的文字會消耗約 1.0-1.35 倍的 token。推廣價的設計就是讓這個過渡期的成本大致打平。
- 搭配 prompt caching(最高省 90%)和批次處理(省 50%),實際成本可以大幅下降。
跟 Opus 4.8 相比,Sonnet 5 的標準價在輸入和輸出都只有 60%。考慮到效能差距已經縮小到個位數百分比,大多數工作負載選 Sonnet 5 的投報率更高。
安全性:有數據支持的進步
這不是套話——有實際數據:
- 幻覺率低於 Sonnet 4.6
- 諂媚度低於 Sonnet 4.6 — 不會為了討好你而編造答案
- Agent 安全性提升 — 更能拒絕惡意請求、抵抗 prompt injection
- 整體對齊分數優於 Sonnet 4.6,但仍略遜於 Opus 4.8
值得注意的是:Sonnet 5 預設啟用了網路安全防護,跟 Opus 4.7、4.8 一樣。它不會幫你寫漏洞利用程式碼。如果你有合法的資安測試需求,需要申請 Anthropic 的 Cyber Verification Program,或改用 Opus 4.8。
誰該升級
立刻升級
- 使用 Sonnet 4.6 跑 Agent/自動化的團隊:多步驟任務完成率的提升非常明顯。
- 用 Claude Code 的個人開發者:Sonnet 5 已經是 Free 和 Pro 方案的預設模型——你可能已經在用了。
- 考慮 Opus 但嫌貴的人:先試試高 effort 的 Sonnet 5,很可能就夠用了。
觀望即可
- 已經在用 Opus 4.8 且滿意的團隊:Opus 在推理深度和最高難度任務上仍然領先。沒有降級的理由。
- 資安測試工作流程:Sonnet 5 的安全限制比較嚴格。Opus 4.8 更合適。
不用動
- 日常聊天/輕量任務使用者:Sonnet 4.6 甚至 Haiku 就夠了。
哪裡可以用
Sonnet 5 已經廣泛上線:
- Claude.ai — 網頁、iOS、Android。Free 和 Pro 使用者的預設模型
- Claude Code — CLI 開發工具
- API — 模型名稱:
claude-sonnet-5 - 雲端平台 — AWS(Amazon Bedrock)、Google Cloud(Vertex AI)、Microsoft Foundry
跟競爭對手比起來如何
2026 年中的 AI 模型市場非常擁擠。Sonnet 5 的定位如下:
| Model | 定位 | Input $/1M | Output $/1M | Agent 能力 |
|---|---|---|---|---|
| Claude Sonnet 5 | 中高階全能型 | $2-3 | $10-15 | 強 |
| Claude Opus 4.8 | 旗艦推理型 | $5 | $25 | 最強 |
| GPT-5.5 | 旗艦程式設計型 | $5 | $30 | 強 |
| DeepSeek V4 Pro | 平價推理型 | $0.44 | $0.87 | 中等 |
| GLM-5.2 | 雙語程式設計型 | $0.93 | $3 | 中等 |
Sonnet 5 的定位很清晰:不是最便宜的,也不是最強的,但在「夠用」和「付得起」之間取得了最佳平衡。 如果團隊需要穩定的 Agent 能力又不想付旗艦價格,Sonnet 5 是 2026 年中最務實的選擇之一。
結論
Anthropic 的發布節奏持續加速 — Sonnet 3.5、3.6、3.7、4、4.5、4.6,現在到 5。版本號直接跳級,說明這不是小幅迭代。
Sonnet 5 的核心敘事是**「把 Agent 級能力下放」**。以前需要 Opus 等級模型才能搞定的多步驟自主任務,現在 Sonnet 價位就能做到。這對 AI 應用開發的成本結構有實質影響。
推廣價到 8 月 31 日截止。如果你正在開發任何形式的 AI Agent,現在就開始測試遷移吧。