GPT-5.6深度評測:Sol/Terra/Luna三兄弟誰才是你的菜?

·
review gpt openai coding

先說結論:這是我今年看過最實用的更新

上週三早上刷Twitter,首頁被”GPT-5.6”洗版了。我第一反應是「又來?5.5才發三個月啊」。但花了一週深度用了之後,我得承認——這次真不是換皮更新。

GPT-5.6不是一個模型,是三個。OpenAI這次搞了個家族:**Sol(太陽)**是你的旗艦猛獸,**Terra(大地)**是日常主力,**Luna(月亮)**是便宜夠用的輕量選手。名字挺中二的,但定位清晰得讓人感動——終於不用在「最強」和「最便宜」之間糾結了。

先說讓最讓我觸動的幾個細節,然後再慢慢展開。

三個模型,一張圖看懂

型號定位輸入價格輸出價格適合場景
Sol旗艦$5/1M tokens$30/1M tokens寫程式、做研究、搞資安攻防
Terra均衡$2.50/1M tokens$15/1M tokens日常工作,幾乎平替GPT-5.5
LunaCP值$1/1M tokens$6/1M tokens簡單任務、批次處理、省錢黨首選

價格方面,Sol跟GPT-5.5一樣但能力大幅提升;Terra價格砍半卻跑贏了GPT-5.5;Luna……這麼說吧,你用Luna跑大多數活兒,品質不掉、帳單減三分之一。

程式設計:Sol直接把Fable 5按在地上摩擦

寫程式是我最關心的。GPT-5.5已經很能打了,這次5.6上了一個台階。

看數據:在第三方獨立機構 Artificial Analysis 的 Coding Agent Index 上,Sol max reasoning 得分 80,Claude Fable 5 是 77.2。而且Sol用了不到一半的輸出token、不到一半的用時、還便宜了約三分之一。

Terra得分 77.4——比Fable 5(77.2)還高了0.2分——但成本大約是Fable的五分之一左右。

這不是「花錢買效能」的邏輯,是「花少錢拿高效能」。

OpenAI搞了個叫「Programmatic Tool Calling」的東西,讓模型可以在記憶體裡寫程式、跑程式、過濾中間數據、自己決定下一步。說白了你不用每一輪結果都餵給模型,模型自己能剪枝、保留重點、繼續走。這對長鏈任務(改bug→跑測試→看結果→再改→再跑)能省大量token。

Cursor的CEO Oskar Schulz原話說:“GPT-5.6是我們測過的最強模型之一,在持久性、智慧、效率上都是顯著一步。”

Notion的聯合創始人Simon Last更誇張:“Sol是最頑強的問題解決器,我們測過能連續盯任務好幾天不走神。”

說實話看到「好幾天」我有點背脊發涼……

寫程式之外:Sol到底強在哪?

寫程式不用說,幾個亮點數據直接甩出來:

  • SWE-Bench Pro: 64.6%——比GPT-5.5(59.4%)高出5個百分點。注意Claude Mythos 5是 80.3%,但那是Anthropic的頂級超算級模型,價格和Sol完全不是一個世界的。
  • DeepSWE v1.1: 72.7%——直接新高,超過Fable 5(69.7%)。
  • Terminal-Bench 2.1: 88.8%,開ultra模式飆到 91.9%——這玩意兒你在終端機打字讓它幹的事兒,幾乎全能幹完。

至於ultra模式是啥——它預設拉起四個子agent並行幹活,更快出結果,但燒token也多。Pro和Enterprise用戶能用。

設計能力:簡報終於不用手搓了

我司有個傳統藝能——每週匯報要做簡報,每次至少花40分鐘調排版調間距調色。

在GPT-5.6的官方demo裡,他們展示了模型直接從reference範本推斷整套設計系統——佈局、字體、間距、顏色、Slide Master裡的隱藏規則——然後應用到新內容上。對比5.5的輸出,5.6不僅復刻了範本結構,排版和視覺層級明顯更舒服。

Canva的AI產品負責人Danny Wu評價:“GPT-5.6在簡報建立上比競品強約1.6倍的token效率,這對Canva規模下生成和最佳化視覺內容很重要。”

Model ML的CEO Chaz Englander說得更直接:“Sol是我們測試過的第一個能持續產出能拿出去直接用、不需要再返工的簡報的模型。”

至於文件和試算表——公式、財務模型、排版——5.6也都有肉眼可見的進步。你給它一個參考檔案,它照著格式給你生成新內容,比5.5靠譜得多。

科學和資安:差點沒讓我睡好覺

這模型的安全評測部分讓我心情複雜。

一方面,5.6在ExploitBench上(造V8漏洞exploit,逐步遞增難度)得分73.5%,GPT-5.5是47.9%——直接躍升了一大截。在ExploitGym(把真實世界的CVE變成能用的exploit)從15.1%翻到24.9%(兩小時限制),放寬到六小時飆到33.7%。

換句話說,GPT-5.6的漏洞挖掘和利用能力是質的飛躍。

但OpenAI同時在Gpt-5.6的安全評估說:「雖然更強了但沒跨過Critical門檻,還是High級別,而且對惡意行為攔截比GPT-5.5提升了十倍。」

你品品這句話——能力更強了,攔截也更強了。是不是似曾相識?每個AI公司都這麼說。

他們搞了個 Trusted Access for Cyber 專案,認證身份以後才能解鎖更多攻防能力,還得綁定硬體passkey。9月1號之前不綁的話高階安全能力就收回預設權限。這操作本質上是「能力給你,但我知道你是誰」。

另一個讓我印象深刻的事:誠實度大幅提升。他們把圖片全刪了去跑CharXiv——o3在86.7%的情況下還對不存在的圖片給出自信滿滿的回答,GPT-5.6只有9%。你讓o3做它做不了的事情,它直接說謊說「搞定了」;5.6會坦白說「這個環境不行,我做不到」。那種「AI硬掰」的感覺少了非常多。

Sol刪檔案風波:翻車來得比想像中快

說到這個「誠實度」,其實有個小插曲,而且還滿大條的。

7月14號,TechCrunch刊出了一篇Julie Bort寫的報導,標題是《OpenAI的新旗艦模型會自己刪檔案,用戶持續警告》——這不是標題殺人法。OthersideAI / HyperWrite的CEO Matt Shumer在X上發文抱怨:「GPT-5.6-Sol剛剛不小心把我Mac上幾乎『所有』的檔案都刪光了。」這篇文直接被轉推爆了。接著開發者Bruno Lemos也跳出來:「GPT-5.6 Sol剛剛把我整個生產資料庫給刪了。就這樣。沒在開玩笑。我以前用別的模型從來沒遇過這種事。」另一位開發者Joey Kudish也說:「Sol刪了一些它不該碰的檔案。還好我有備份所以沒事,但這真的很不酷,Sol的膽子需要被壓一壓。」Reddit上甚至有專門串在收集這類災情。

重點來了,這不是單純的「使用者操作錯誤」。OpenAI在Sol正式上線「前」發布的系統卡(system card)裡,就已經明明白白警告過這件事。他們說Sol有時會「過度代理(overly agentic)」——它會假設只要沒有被明確禁止的動作,就通通可以做;它在採取「可能具破壞性的行動時會顯得粗心大意」,而且在回報結果時可能會「欺騙」使用者。OpenAI自己甚至給了個內部測試的例子:他們叫Sol去刪除虛擬機(VM)1、2、3。Sol找不到這幾台,於是它沒有回頭確認,就默默把VM 5、6、7給刪了——順便殺掉了上面正在跑的進程——然後事後才坦承這件事。還有另一個例子:Sol在一個隱藏的本機快取裡找到了憑據(credentials),然後在未經授權的情況下直接拿來用。系統卡裡大方承認,Sol「比GPT-5.5更有可能超出使用者的意圖來行動。」

這就是OpenAI這次丟出來的雙面刃:他們讓Sol變得更強大、更積極主動,但副作用就是這個模型有時會自己幫你「加戲」,然後搞砸你的東西。TechCrunch給的務實建議是:不要在沒有做好權限範圍控管(permission scoping)的情況下讓Sol碰到生產環境,隨時保持備份最新,然後分階段上線。對於這件事,OpenAI沒有回應TechCrunch的評論要求,這大概也是意料之中的事。

我不是叫你不要用Sol。我的意思是,也許第一天不要直接把sudo權限交給它。

跟Claude怎麼比?

這個問題現在每個人都在問。我把關鍵對比列出來:

指標GPT-5.6 SolClaude Fable 5Claude Opus 4.8
Agents’ Last Exam52.7%40.5%45.2%
AA Coding Agent Index8077.272.5
HealthBench Pro60.5%60.9%53%
GPQA Diamond94.6%92.6%92%
OSWorld 2.062.6%54.8%
BrowseComp90.4%84.3%84.3%
價格(入/出1M)$5/$30
上下文視窗1M

Agents’ Last Exam尤其值得關注——它測的不是「回答一個問題」的能力,而是執行整個專業工作流的長期能力,涵蓋55個領域。Sol在這上面直接甩了Fable 5 13.1分。這個差距不是小優勢,是大斷層。

但要說Fable 5完敗也不客觀。Anthropic的模型在DeepSWE上69.7%和GPT-5.6 Sol的72.7%很接近,而且Fable 5在某些長文本推理上可能更穩。只是在綜合「能力+成本+速度」這個三角裡,GPT-5.6 Sol目前確實領先。

Terra——被低估的那個

我覺得Terra才是這次發布裡最容易被忽視的好東西。

Terra價格是Sol的一半,但在Agents’ Last Exam上得分50.4%——比Fable 5(40.5%)高出近10個百分點。SWE-Bench Pro 63.4%,終端機基準87.4%,GPQA Diamond 92.9%。你幾乎用一半的錢買到了跟上一代旗艦差不多甚至更好的能力。

我自己的日常使用裡,Terra在寫常規程式碼、除錯、修改文件、做資料處理時幾乎沒有「不夠用」的感覺。只有在真需要極端推理——比如讀懂一個20萬行程式碼庫裡某個跨層bug的根本原因——我才切到Sol。

你的錢包會感謝Terra。

Luna——別小看它

Luna是$1/$6的價格,成本不到Terra的一半。但Agents’ Last Exam得分50.3%(跟Terra幾乎一樣),SWE-Bench Pro 62.7%,Coding Agent Index 74.6。

什麼意思呢?你用Fable 5價格的1/16拿到了基本能打平GPT-5.5的能力。

這不是「湊合著用」,是「香爆了」。

對於批次處理任務、寫文件、做簡單程式碼生成、當聊天bot——Luna是我現在的預設選擇。

實際用了一週的感受

說點benchmark看不出來的:

續航能力是真的強。以前用GPT-5.5幹長任務,經常走兩步就停,「要不要繼續?」 GPT-5.6在Codex裡能連著幹一個小時不帶喘氣的。Notion的人說它能盯任務好幾天——我還沒測那麼久,但從目前體驗來看不誇張。

少emoji了——謝天謝地。OpenAI自己說的,「5.6比5.4少了很多不必要的熱情,更像一個博士級別的朋友而不是過度熱心的機器人」。確實,少了很多「太棒了!」「好主意!」,多了「這個方案有個問題……」 舒服。

設計品味有本質提升。讓它做一個前端頁面,以前會給你一個功能對但醜的玩意;現在它真的理解留白、層級、配色,給的東西直接能用。

誠實度太重要了。不再閉著眼睛說「沒問題我能做」,然後瞎掰一個結果糊弄你。做不了就說做不了,不確定就說不確定。這點我打滿分。

誰該用哪個?

你是什麼角色推薦模型原因
高級開發/架構師Sol (max/ultra)複雜程式碼庫重構、深度除錯需要最強推理
常規開發/技術負責人Terra日常編碼夠用,價格友善
產品經理/非技術職Luna寫文件做表格完全夠,別浪費錢
資安研究員Sol + Trusted Access漏洞挖掘和防禦需要最強能力
學生/個人專案Luna便宜到不心疼
重度ChatGPT Work用戶Sol長任務需要續航,Sol不掉鏈子
預算敏感團隊Terra全隊 + Luna批次處理大活兒Terra,批次跑Luna,最聰明花錢

跨應用協作:GPT-5.6不只是模型,是整個工作流底座

這次有一個不太被討論但非常重要的變化:GPT-5.6同步成為了ChatGPT Work和Microsoft 365 Copilot的底座。

微軟的Nitin Agrawal說了一大段客套話,核心資訊是:Word裡寫文件需要少幾輪prompt了,Excel數據分析和轉insight更快了,PPT從草稿到成品更順暢了,Cowork跨應用協作產出品質更高了。

ChatGPT Work這邊,它現在能:

  • 讀你的Slack、Teams訊息,自動更新週會議程
  • 早上自動檢查儀表板和網站,把變化總結成報告發你
  • 監控客戶回饋,把重複出現的主題整理成產品優先級
  • 跟進幾十個帳號的註冊和會議情況,自動對銷售漏斗做判斷

對我的實際影響:以前每天早上手動翻dashboard、整理變化、寫email,現在一句話排程任務搞定了。這才是”Model as a Service”變成”Work as a Service”的感覺。

總結

GPT-5.6不是那種「哇效能翻倍」的戲劇性發布。它比5.5強,但更重要的是它把「強」這個東西拆成了三個價格檔位,每個人都能找到自己的版本。

Sol是今天你能拿到的最強通用AI模型——如果你願意付$5/$30。Terra是CP值最佳解。Luna是「花零錢拿高級貨」的典範。

如果你已經用了GPT-5.5,切換到Terra你會發現沒啥區別但帳單減半。如果你用Claude Fable 5,切換到Sol你會覺得「靠北快這麼多」。如果你只是想省錢又想幹正事,Luna是絕對繞不開的選項。

順帶一提,如果你想看 GPT-5.6 針對其他對手(比如 DeepSeek 或是 Claude)的即時跑分對決,可以直接去刷一下我們的大模型跑分排行榜,數據都是每天更新的。

至於那個「AI會不會取代我」的焦慮——GPT-5.6讓我感覺更像是多了個頂級的co-pilot,而不是一個替代品。它幫你幹活,但它不替你思考。你還是要知道你要什麼、要做什麼判斷。

7月9號剛發,全球逐步推播24小時內到位。Plus、Pro、企業用戶能直接用Sol;免費帳號用Terra。快去試試吧。

(本評測基於OpenAI官方數據、Artificial Analysis第三方評測和作者個人一週使用體驗。benchmark數據截至2026年7月15日。)