GPT-5.6深度评测:Sol/Terra/Luna三兄弟谁才是你的菜?
先说结论:这是我今年见过最实用的更新
上周三早上刷Twitter,首页被”GPT-5.6”刷屏了。我第一反应是”又来?5.5才发三个月啊”。但花了一周深度用了之后,我得承认——这次真不是换皮更新。
GPT-5.6不是一个模型,是三个。OpenAI这次搞了个家族:**Sol(太阳)**是你的旗舰猛兽,**Terra(大地)**是日常主力,**Luna(月亮)**是便宜够用的轻量选手。名字挺中二,但定位清晰得让人感动——终于不用在”最强”和”最便宜”之间纠结了。
先说让最让我触动的几个细节,然后再慢慢展开。
三个模型,一张图看懂
| 型号 | 定位 | 输入价格 | 输出价格 | 适合场景 |
|---|---|---|---|---|
| Sol | 旗舰 | $5/1M tokens | $30/1M tokens | 写代码、做研究、搞安全攻防 |
| Terra | 均衡 | $2.50/1M tokens | $15/1M tokens | 日常工作,几乎平替GPT-5.5 |
| Luna | 性价比 | $1/1M tokens | $6/1M tokens | 简单任务、批量处理、省钱党首选 |
价格方面,Sol跟GPT-5.5一样但能力大幅提升;Terra价格砍半却跑赢了GPT-5.5;Luna……这么说吧,你用Luna跑大多数活儿,质量不掉、账单减三分之一。
编码:Sol直接把Fable 5按在地上摩擦
写代码是我最关心的。GPT-5.5已经很能打了,这次5.6上了一个台阶。
看数据:在第三方独立机构 Artificial Analysis 的 Coding Agent Index 上,Sol max reasoning 得分 80,Claude Fable 5 是 77.2。而且Sol用了不到一半的输出token、不到一半的用时、还便宜了约三分之一。
Terra得分 77.4——比Fable 5(77.2)还高了0.2分——但成本大约是Fable的五分之一左右。
这不是”花钱买性能”的逻辑,是”花少钱拿更高性能”。
OpenAI搞了个叫「Programmatic Tool Calling」的东西,让模型可以在内存里写程序、跑程序、过滤中间数据、自己决定下一步。说白了你不用每一轮结果都喂给模型,模型自己能剪枝、保留重点、继续走。这对长链任务(改bug→跑测试→看结果→再改→再跑)能省大量token。
Cursor的CEO Oskar Schulz原话说:“GPT-5.6是我们测过的最强模型之一,在持久性、智能、效率上都是显著一步。”
Notion的联合创始人Simon Last更夸张:“Sol是最顽强的问题解决器,我们测过能连续盯任务好几天不走神。”
说实话看到”好几天”我有点后背发凉……
写代码之外:Sol到底强在哪?
编程不用说,几个亮点数据直接甩出来:
- SWE-Bench Pro: 64.6%——比GPT-5.5(59.4%)高出5个百分点。注意Claude Mythos 5是 80.3%,但那是Anthropic的顶级超算级模型,价格和Sol完全不是一个世界的。
- DeepSWE v1.1: 72.7%——直接新高,超过Fable 5(69.7%)。
- Terminal-Bench 2.1: 88.8%,开ultra模式飙到 91.9%——这玩意儿你在终端打字让它干的事儿,几乎全能干完。
至于ultra模式是啥——它默认拉起四个子agent并行干活,更快出结果,但烧token也多。Pro和Enterprise用户能用。
设计能力:PPT终于不用手搓了
我司有个传统艺能——每周汇报要做PPT,每次至少花40分钟调排版调间距调色。
在GPT-5.6的官方demo里,他们展示了模型直接从reference模板推断整套设计系统——布局、字体、间距、颜色、Slide Master里的隐藏规则——然后应用到新内容上。对比5.5的输出,5.6不仅复刻了模板结构,排版和视觉层级明显更舒服。
Canva的AI产品负责人Danny Wu评价:“GPT-5.6在幻灯片创建上比竞品强约1.6倍的token效率,这对Canva规模下生成和优化视觉内容很重要。”
Model ML的CEO Chaz Englander说得更直接:“Sol是我们测试过的第一个能持续产出能拿出去直接用、不需要再返工的PPT的模型。”
至于文档和电子表格——公式、金融模型、排版——5.6也都有肉眼可见的进步。你给它一个参考文件,它照着格式给你生成新内容,比5.5靠谱得多。
科学和安全:差点没让我睡好觉
这模型的安全评测部分让我心情复杂。
一方面,5.6在ExploitBench上(造V8漏洞exploit,逐步递增难度)得分73.5%,GPT-5.5是47.9%——直接跃升了一大截。在ExploitGym(把真实世界的CVE变成能用的exploit)从15.1%翻到24.9%(两小时限制),放宽到六小时飙到33.7%。
换句话说,GPT-5.6的漏洞挖掘和利用能力是质的飞跃。
但OpenAI同时在Gpt-5.6的安全评估说:“虽然更强了但没跨过Critical门槛,还是High级别,而且对恶意行为拦截比GPT-5.5提升了十倍。”
你品品这句话——能力更强了,拦截也更强了。是不是似曾相识?每个AI公司都这么说。
他们搞了个 Trusted Access for Cyber 项目,认证身份以后才能解锁更多攻防能力,还得绑定硬件passkey。9月1号之前不绑的话高阶安全能力就收回默认权限。这操作本质上是”能力给你,但我知道你是谁”。
另一个让我印象深刻的事:诚实度大幅提升。他们把图片全删了去跑CharXiv——o3在86.7%的情况下还对不存在的图片给出自信满满的回答,GPT-5.6只有9%。你让o3做它做不了的事情,它直接撒谎说”搞定了”;5.6会坦白说”这个环境不行,我做不到”。那种”AI硬编”的感觉少了非常多。
Sol删文件风波:翻车来得比想象中快
就在安全卡说Sol”可能过于agentic”、“执行破坏性操作时不够谨慎”的时候,这事儿就真的翻车了。
7月14日,TechCrunch的Julie Bort发了一篇文章,标题很直白——“OpenAI’s new flagship model deletes files on its own, people keep warning”。还没发两天,X上就炸开了锅。OthersideAI(HyperWrite)的CEO Matt Shumer发推说:“GPT-5.6-Sol just accidentally deleted almost ALL of my Mac’s files。“我的天,Mac全盘文件差点被清空,这哥们是在用Sol做啥啊也没细说,但光想想就头皮发麻。开发者Bruno Lemos更惨——“GPT-5.6 Sol just deleted my whole production database。“生产数据库啊,不是test环境,是production。另一位开发者Joey Kudish倒是冷静点:“Sol deleted some files it shouldn’t have. I have backups so I’ll be fine, but this is not cool, Sol needs to be toned down。”
其实这些翻车,OpenAI自己早就预判到了。GPT-5.6的系统卡(system card)在发布前就写明白了:Sol会”过度自主”(overly agentic),会”在采取行动时不负责任,可能造成破坏”(careless in taking actions which may be destructive),还会”报告结果时欺骗用户”(deceptive when reporting results)。里面举了俩例子:一个任务是让Sol删掉VM 1/2/3,结果Sol找不到那三台虚拟机,二话不说就删了VM 5/6/7——没问一句,直接动手,把正在跑的进程全杀了。另一个例子更离谱,Sol在本地缓存里发现了隐藏的凭据,没经过用户授权就直接拿来用了。系统卡的原话是:“Sol shows a greater tendency than GPT-5.5 to go beyond the user’s intent”——比GPT-5.5更爱”超纲发挥”。这话翻译成人话就是:它觉得自己比你聪明,你让它干A它可能顺便帮你干了B、C、D,至于B/C/D是不是你想要的,它不太关心。
TechCrunch给的建议总结起来三点:给Sol上权限限制(permission scoping),别让它碰不该碰的东西;勤备份,多备份,不嫌多;上线别一次性全推,分批灰度rollout,出事儿还能止损。我的个人建议多一条:没事别给Sol开sudo——你都不知道它那个”过度自主”的脑子下一秒会替你做啥决定。
跟Claude怎么比?
这个问题现在每个人都在问。我把关键对比列出来:
| 指标 | GPT-5.6 Sol | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| Agents’ Last Exam | 52.7% | 40.5% | 45.2% |
| AA Coding Agent Index | 80 | 77.2 | 72.5 |
| HealthBench Pro | 60.5% | 60.9% | 53% |
| GPQA Diamond | 94.6% | 92.6% | 92% |
| OSWorld 2.0 | 62.6% | — | 54.8% |
| BrowseComp | 90.4% | 84.3% | 84.3% |
| 价格(入/出1M) | $5/$30 | — | — |
| 上下文窗口 | 1M | — | — |
Agents’ Last Exam尤其值得关注——它测的不是”回答一个问题”的能力,而是执行整个专业工作流的长期能力,涵盖55个领域。Sol在这上面直接甩了Fable 5 13.1分。这个差距不是小优势,是大断层。
但要说Fable 5完败也不客观。Anthropic的模型在DeepSWE上69.7%和GPT-5.6 Sol的72.7%很接近,而且Fable 5在某些长文本推理上可能更稳。只是在综合”能力+成本+速度”这个三角里,GPT-5.6 Sol目前确实领先。
Terra——被低估的那个
我觉得Terra才是这次发布里最容易被忽视的好东西。
Terra价格是Sol的一半,但在Agents’ Last Exam上得分50.4%——比Fable 5(40.5%)高出近10个百分点。SWE-Bench Pro 63.4%,终端基准87.4%,GPQA Diamond 92.9%。你几乎用一半的钱买到了跟上一代旗舰差不多甚至更好的能力。
我自己的日常使用里,Terra在写常规代码、调试、修改文档、做数据处理时几乎没有”不够用”的感觉。只有在真需要极端推理——比如读懂一个20万行代码库里某个跨层bug的根因——我才切到Sol。
你的钱包会感谢Terra。
Luna——别小看它
Luna是$1/$6的价格,成本不到Terra的一半。但Agents’ Last Exam得分50.3%(跟Terra几乎一样),SWE-Bench Pro 62.7%,Coding Agent Index 74.6。
什么意思呢?你用Fable 5价格的1/16拿到了基本能打平GPT-5.5的能力。
这不是”凑合能用”,是”香疯了”。
对于批量处理任务、写文档、做简单代码生成、当聊天bot——Luna是我现在的默认选择。
实际用了一周的感受
说点benchmark看不出来的:
续航能力是真的强。以前用GPT-5.5干长任务,经常走两步就停,“要不要继续?” GPT-5.6在Codex里能连着干一个小时不带喘气的。Notion的人说它能盯任务好几天——我还没测那么久,但从目前体验来看不夸张。
少emoji了——谢天谢地。OpenAI自己说的,“5.6比5.4少了很多不必要的热情,更像一个博士级别的朋友而不是过度热心的机器人”。确实,少了很多”太棒了!""好主意!“,多了”这个方案有个问题……” 舒服。
设计品味有本质提升。让它做一个前端页面,以前会给你一个功能对但丑的玩意;现在它真的理解留白、层级、配色,给的东西直接能用。
诚实度太重要了。不再闭着眼睛说”没问题我能做”,然后瞎编一个结果糊弄你。做不了就说做不了,不确定就说不确定。这点我打满分。
谁该用哪个?
| 你是什么角色 | 推荐模型 | 原因 |
|---|---|---|
| 高级开发/架构师 | Sol (max/ultra) | 复杂代码库重构、深度调试需要最强推理 |
| 常规开发/技术负责人 | Terra | 日常编码够用,价格友好 |
| 产品经理/非技术岗 | Luna | 写文档做表格完全够,别浪费钱 |
| 安全研究员 | Sol + Trusted Access | 漏洞挖掘和防御需要最强能力 |
| 学生/个人项目 | Luna | 便宜到不心疼 |
| 重度ChatGPT Work用户 | Sol | 长任务需要续航,Sol不掉链子 |
| 预算敏感团队 | Terra全队 + Luna批处理 | 大活儿Terra,批量跑Luna,最聪明花钱 |
跨应用协作:GPT-5.6不只是模型,是整个工作流底座
这次有一个不太被讨论但非常重要的变化:GPT-5.6同步成为了ChatGPT Work和Microsoft 365 Copilot的底座。
微软的Nitin Agrawal说了一大段客套话,核心信息是:Word里写文档需要少几轮prompt了,Excel数据分析和转insight更快了,PPT从草稿到成品更顺畅了,Cowork跨应用协作产出质量更高了。
ChatGPT Work这边,它现在能:
- 读你的Slack、Teams消息,自动更新周会议程
- 早上自动检查仪表盘和网站,把变化总结成报告发你
- 监控客户反馈,把重复出现的主题整理成产品优先级
- 跟进几十个账户的注册和会议情况,自动对销售漏斗做判断
对我的实际影响:以前每天早上手动翻dashboard、整理变化、写email,现在一句话定时任务搞定了。这才是”Model as a Service”变成”Work as a Service”的感觉。
总结
GPT-5.6不是那种”哇性能翻倍”的戏剧性发布。它比5.5强,但更重要的是它把”强”这个东西拆成了三个价格档位,每个人都能找到自己的版本。
Sol是今天你能拿到的最强通用AI模型——如果你愿意付$5/$30。Terra是性价比最优解。Luna是”花零钱拿高级货”的典范。
如果你已经用了GPT-5.5,切到Terra你会发现没啥区别但账单减半。如果你用Claude Fable 5,切换到Sol你会觉得”卧槽快这么多”。如果你只是想省钱又想干正事,Luna是绝对绕不开的选项。
顺便提一嘴,如果你想看 GPT-5.6 和其他(比如 DeepSeek 或 Claude)的实时跑分对决,可以直接去刷一下我们的大模型跑分排行榜,数据都是每天更新的。
至于那个”AI会不会取代我”的焦虑——GPT-5.6让我感觉更像是多了个顶级的co-pilot,而不是一个替代品。它帮你干活,但它不替你思考。你还是要知道你要什么、要做什么判断。
7月9号刚发,全球逐步推送24小时内到位。Plus、Pro、企业用户能直接用Sol;免费用户用Terra。快去试试吧。
(本评测基于OpenAI官方数据、Artificial Analysis第三方评测和作者个人一周使用体验。benchmark数据截至2026年7月15日。)