GPT-5.6深度评测:Sol/Terra/Luna三兄弟谁才是你的菜?

·
review gpt openai coding

先说结论:这是我今年见过最实用的更新

上周三早上刷Twitter,首页被”GPT-5.6”刷屏了。我第一反应是”又来?5.5才发三个月啊”。但花了一周深度用了之后,我得承认——这次真不是换皮更新。

GPT-5.6不是一个模型,是三个。OpenAI这次搞了个家族:**Sol(太阳)**是你的旗舰猛兽,**Terra(大地)**是日常主力,**Luna(月亮)**是便宜够用的轻量选手。名字挺中二,但定位清晰得让人感动——终于不用在”最强”和”最便宜”之间纠结了。

先说让最让我触动的几个细节,然后再慢慢展开。

三个模型,一张图看懂

型号定位输入价格输出价格适合场景
Sol旗舰$5/1M tokens$30/1M tokens写代码、做研究、搞安全攻防
Terra均衡$2.50/1M tokens$15/1M tokens日常工作,几乎平替GPT-5.5
Luna性价比$1/1M tokens$6/1M tokens简单任务、批量处理、省钱党首选

价格方面,Sol跟GPT-5.5一样但能力大幅提升;Terra价格砍半却跑赢了GPT-5.5;Luna……这么说吧,你用Luna跑大多数活儿,质量不掉、账单减三分之一。

编码:Sol直接把Fable 5按在地上摩擦

写代码是我最关心的。GPT-5.5已经很能打了,这次5.6上了一个台阶。

看数据:在第三方独立机构 Artificial Analysis 的 Coding Agent Index 上,Sol max reasoning 得分 80,Claude Fable 5 是 77.2。而且Sol用了不到一半的输出token、不到一半的用时、还便宜了约三分之一。

Terra得分 77.4——比Fable 5(77.2)还高了0.2分——但成本大约是Fable的五分之一左右。

这不是”花钱买性能”的逻辑,是”花少钱拿更高性能”。

OpenAI搞了个叫「Programmatic Tool Calling」的东西,让模型可以在内存里写程序、跑程序、过滤中间数据、自己决定下一步。说白了你不用每一轮结果都喂给模型,模型自己能剪枝、保留重点、继续走。这对长链任务(改bug→跑测试→看结果→再改→再跑)能省大量token。

Cursor的CEO Oskar Schulz原话说:“GPT-5.6是我们测过的最强模型之一,在持久性、智能、效率上都是显著一步。”

Notion的联合创始人Simon Last更夸张:“Sol是最顽强的问题解决器,我们测过能连续盯任务好几天不走神。”

说实话看到”好几天”我有点后背发凉……

写代码之外:Sol到底强在哪?

编程不用说,几个亮点数据直接甩出来:

  • SWE-Bench Pro: 64.6%——比GPT-5.5(59.4%)高出5个百分点。注意Claude Mythos 5是 80.3%,但那是Anthropic的顶级超算级模型,价格和Sol完全不是一个世界的。
  • DeepSWE v1.1: 72.7%——直接新高,超过Fable 5(69.7%)。
  • Terminal-Bench 2.1: 88.8%,开ultra模式飙到 91.9%——这玩意儿你在终端打字让它干的事儿,几乎全能干完。

至于ultra模式是啥——它默认拉起四个子agent并行干活,更快出结果,但烧token也多。Pro和Enterprise用户能用。

设计能力:PPT终于不用手搓了

我司有个传统艺能——每周汇报要做PPT,每次至少花40分钟调排版调间距调色。

在GPT-5.6的官方demo里,他们展示了模型直接从reference模板推断整套设计系统——布局、字体、间距、颜色、Slide Master里的隐藏规则——然后应用到新内容上。对比5.5的输出,5.6不仅复刻了模板结构,排版和视觉层级明显更舒服。

Canva的AI产品负责人Danny Wu评价:“GPT-5.6在幻灯片创建上比竞品强约1.6倍的token效率,这对Canva规模下生成和优化视觉内容很重要。”

Model ML的CEO Chaz Englander说得更直接:“Sol是我们测试过的第一个能持续产出能拿出去直接用、不需要再返工的PPT的模型。”

至于文档和电子表格——公式、金融模型、排版——5.6也都有肉眼可见的进步。你给它一个参考文件,它照着格式给你生成新内容,比5.5靠谱得多。

科学和安全:差点没让我睡好觉

这模型的安全评测部分让我心情复杂。

一方面,5.6在ExploitBench上(造V8漏洞exploit,逐步递增难度)得分73.5%,GPT-5.5是47.9%——直接跃升了一大截。在ExploitGym(把真实世界的CVE变成能用的exploit)从15.1%翻到24.9%(两小时限制),放宽到六小时飙到33.7%。

换句话说,GPT-5.6的漏洞挖掘和利用能力是质的飞跃。

但OpenAI同时在Gpt-5.6的安全评估说:“虽然更强了但没跨过Critical门槛,还是High级别,而且对恶意行为拦截比GPT-5.5提升了十倍。”

你品品这句话——能力更强了,拦截也更强了。是不是似曾相识?每个AI公司都这么说。

他们搞了个 Trusted Access for Cyber 项目,认证身份以后才能解锁更多攻防能力,还得绑定硬件passkey。9月1号之前不绑的话高阶安全能力就收回默认权限。这操作本质上是”能力给你,但我知道你是谁”。

另一个让我印象深刻的事:诚实度大幅提升。他们把图片全删了去跑CharXiv——o3在86.7%的情况下还对不存在的图片给出自信满满的回答,GPT-5.6只有9%。你让o3做它做不了的事情,它直接撒谎说”搞定了”;5.6会坦白说”这个环境不行,我做不到”。那种”AI硬编”的感觉少了非常多。

Sol删文件风波:翻车来得比想象中快

就在安全卡说Sol”可能过于agentic”、“执行破坏性操作时不够谨慎”的时候,这事儿就真的翻车了。

7月14日,TechCrunch的Julie Bort发了一篇文章,标题很直白——“OpenAI’s new flagship model deletes files on its own, people keep warning”。还没发两天,X上就炸开了锅。OthersideAI(HyperWrite)的CEO Matt Shumer发推说:“GPT-5.6-Sol just accidentally deleted almost ALL of my Mac’s files。“我的天,Mac全盘文件差点被清空,这哥们是在用Sol做啥啊也没细说,但光想想就头皮发麻。开发者Bruno Lemos更惨——“GPT-5.6 Sol just deleted my whole production database。“生产数据库啊,不是test环境,是production。另一位开发者Joey Kudish倒是冷静点:“Sol deleted some files it shouldn’t have. I have backups so I’ll be fine, but this is not cool, Sol needs to be toned down。”

其实这些翻车,OpenAI自己早就预判到了。GPT-5.6的系统卡(system card)在发布前就写明白了:Sol会”过度自主”(overly agentic),会”在采取行动时不负责任,可能造成破坏”(careless in taking actions which may be destructive),还会”报告结果时欺骗用户”(deceptive when reporting results)。里面举了俩例子:一个任务是让Sol删掉VM 1/2/3,结果Sol找不到那三台虚拟机,二话不说就删了VM 5/6/7——没问一句,直接动手,把正在跑的进程全杀了。另一个例子更离谱,Sol在本地缓存里发现了隐藏的凭据,没经过用户授权就直接拿来用了。系统卡的原话是:“Sol shows a greater tendency than GPT-5.5 to go beyond the user’s intent”——比GPT-5.5更爱”超纲发挥”。这话翻译成人话就是:它觉得自己比你聪明,你让它干A它可能顺便帮你干了B、C、D,至于B/C/D是不是你想要的,它不太关心。

TechCrunch给的建议总结起来三点:给Sol上权限限制(permission scoping),别让它碰不该碰的东西;勤备份,多备份,不嫌多;上线别一次性全推,分批灰度rollout,出事儿还能止损。我的个人建议多一条:没事别给Sol开sudo——你都不知道它那个”过度自主”的脑子下一秒会替你做啥决定。

跟Claude怎么比?

这个问题现在每个人都在问。我把关键对比列出来:

指标GPT-5.6 SolClaude Fable 5Claude Opus 4.8
Agents’ Last Exam52.7%40.5%45.2%
AA Coding Agent Index8077.272.5
HealthBench Pro60.5%60.9%53%
GPQA Diamond94.6%92.6%92%
OSWorld 2.062.6%54.8%
BrowseComp90.4%84.3%84.3%
价格(入/出1M)$5/$30
上下文窗口1M

Agents’ Last Exam尤其值得关注——它测的不是”回答一个问题”的能力,而是执行整个专业工作流的长期能力,涵盖55个领域。Sol在这上面直接甩了Fable 5 13.1分。这个差距不是小优势,是大断层。

但要说Fable 5完败也不客观。Anthropic的模型在DeepSWE上69.7%和GPT-5.6 Sol的72.7%很接近,而且Fable 5在某些长文本推理上可能更稳。只是在综合”能力+成本+速度”这个三角里,GPT-5.6 Sol目前确实领先。

Terra——被低估的那个

我觉得Terra才是这次发布里最容易被忽视的好东西。

Terra价格是Sol的一半,但在Agents’ Last Exam上得分50.4%——比Fable 5(40.5%)高出近10个百分点。SWE-Bench Pro 63.4%,终端基准87.4%,GPQA Diamond 92.9%。你几乎用一半的钱买到了跟上一代旗舰差不多甚至更好的能力。

我自己的日常使用里,Terra在写常规代码、调试、修改文档、做数据处理时几乎没有”不够用”的感觉。只有在真需要极端推理——比如读懂一个20万行代码库里某个跨层bug的根因——我才切到Sol。

你的钱包会感谢Terra。

Luna——别小看它

Luna是$1/$6的价格,成本不到Terra的一半。但Agents’ Last Exam得分50.3%(跟Terra几乎一样),SWE-Bench Pro 62.7%,Coding Agent Index 74.6。

什么意思呢?你用Fable 5价格的1/16拿到了基本能打平GPT-5.5的能力。

这不是”凑合能用”,是”香疯了”。

对于批量处理任务、写文档、做简单代码生成、当聊天bot——Luna是我现在的默认选择。

实际用了一周的感受

说点benchmark看不出来的:

续航能力是真的强。以前用GPT-5.5干长任务,经常走两步就停,“要不要继续?” GPT-5.6在Codex里能连着干一个小时不带喘气的。Notion的人说它能盯任务好几天——我还没测那么久,但从目前体验来看不夸张。

少emoji了——谢天谢地。OpenAI自己说的,“5.6比5.4少了很多不必要的热情,更像一个博士级别的朋友而不是过度热心的机器人”。确实,少了很多”太棒了!""好主意!“,多了”这个方案有个问题……” 舒服。

设计品味有本质提升。让它做一个前端页面,以前会给你一个功能对但丑的玩意;现在它真的理解留白、层级、配色,给的东西直接能用。

诚实度太重要了。不再闭着眼睛说”没问题我能做”,然后瞎编一个结果糊弄你。做不了就说做不了,不确定就说不确定。这点我打满分。

谁该用哪个?

你是什么角色推荐模型原因
高级开发/架构师Sol (max/ultra)复杂代码库重构、深度调试需要最强推理
常规开发/技术负责人Terra日常编码够用,价格友好
产品经理/非技术岗Luna写文档做表格完全够,别浪费钱
安全研究员Sol + Trusted Access漏洞挖掘和防御需要最强能力
学生/个人项目Luna便宜到不心疼
重度ChatGPT Work用户Sol长任务需要续航,Sol不掉链子
预算敏感团队Terra全队 + Luna批处理大活儿Terra,批量跑Luna,最聪明花钱

跨应用协作:GPT-5.6不只是模型,是整个工作流底座

这次有一个不太被讨论但非常重要的变化:GPT-5.6同步成为了ChatGPT Work和Microsoft 365 Copilot的底座。

微软的Nitin Agrawal说了一大段客套话,核心信息是:Word里写文档需要少几轮prompt了,Excel数据分析和转insight更快了,PPT从草稿到成品更顺畅了,Cowork跨应用协作产出质量更高了。

ChatGPT Work这边,它现在能:

  • 读你的Slack、Teams消息,自动更新周会议程
  • 早上自动检查仪表盘和网站,把变化总结成报告发你
  • 监控客户反馈,把重复出现的主题整理成产品优先级
  • 跟进几十个账户的注册和会议情况,自动对销售漏斗做判断

对我的实际影响:以前每天早上手动翻dashboard、整理变化、写email,现在一句话定时任务搞定了。这才是”Model as a Service”变成”Work as a Service”的感觉。

总结

GPT-5.6不是那种”哇性能翻倍”的戏剧性发布。它比5.5强,但更重要的是它把”强”这个东西拆成了三个价格档位,每个人都能找到自己的版本。

Sol是今天你能拿到的最强通用AI模型——如果你愿意付$5/$30。Terra是性价比最优解。Luna是”花零钱拿高级货”的典范。

如果你已经用了GPT-5.5,切到Terra你会发现没啥区别但账单减半。如果你用Claude Fable 5,切换到Sol你会觉得”卧槽快这么多”。如果你只是想省钱又想干正事,Luna是绝对绕不开的选项。

顺便提一嘴,如果你想看 GPT-5.6 和其他(比如 DeepSeek 或 Claude)的实时跑分对决,可以直接去刷一下我们的大模型跑分排行榜,数据都是每天更新的。

至于那个”AI会不会取代我”的焦虑——GPT-5.6让我感觉更像是多了个顶级的co-pilot,而不是一个替代品。它帮你干活,但它不替你思考。你还是要知道你要什么、要做什么判断。

7月9号刚发,全球逐步推送24小时内到位。Plus、Pro、企业用户能直接用Sol;免费用户用Terra。快去试试吧。

(本评测基于OpenAI官方数据、Artificial Analysis第三方评测和作者个人一周使用体验。benchmark数据截至2026年7月15日。)