摘要:2026年7月10日凌晨,OpenAI正式向全球全面开放GPT-5.6系列三款模型——旗舰Sol、均衡Terra、轻量Luna,以"降维打击"式的价格策略和全面超越Claude Fable 5的性能表现,重塑大模型竞争格局。同步推出的ChatGPT Work将Codex能力整合进统一桌面客户端,标志着AI从"对话工具"向"工作智能体"的范式跃迁。更值得关注的是,GPT-5.6在后训练环节已实现"AI训练AI",OpenAI内部研究算力六个月增长100倍,递归自我改进指数提升16.2个百分点,AI研发自加速时代正式开启。
一、GPT-5.6三箭齐发:天体命名体系背后的产品哲学
OpenAI此次摒弃前代命名逻辑,以太阳系天体划分产品梯度,精准覆盖从日常轻量任务到百万字深度文稿、多模态综合内容全场景需求。
旗舰模型Sol(太阳):专为复杂推理和智能体工作负载打造,面向高难度推理、复杂代码、生物、网络安全等长链路任务。在编程能力、网页检索、电脑模拟操作等专项测试中全面刷新纪录。
均衡模型Terra(大地):性能对标前代GPT-5.5,但价格直接减半。适配新媒体软文、企业宣传稿、职场报告、短视频脚本等高频日常写作场景,无需复杂指令即可贴合指定文风输出内容。

轻量模型Luna(月亮):系列中体积最小、最具成本效益的型号,主打极速响应。低延迟交互特性适配移动端短内容创作,朋友圈文案、短句文案、简短问答、商品短评等轻量化文本可一键生成。
从定价体系看,三款模型按每百万token计价:Sol输入5美元、输出30美元;Terra输入2.5美元、输出15美元;Luna输入1美元、输出6美元。作为对比,Anthropic Claude全系列(Fable 5、Opus 4.8、Sonnet 5)输入/输出对应价格分别为10美元/50美元、5美元/25美元、3美元/15美元。OpenAI的定价策略直接将行业价格门槛拉至新低。
二、性价比屠榜:Claude Fable 5全面承压
本次发布的核心叙事只有一个词——性价比。OpenAI在官方博客中反复对标Anthropic旗舰模型Claude Fable 5,火药味浓烈。
在面向专业工作流的Agents' Last Exam评测中,GPT-5.6 Sol以53.6分创下新高,比Claude Fable 5(自适应推理)高出13.1个百分点。即便采用中等推理设置,其成本也仅约为Fable 5的四分之一。
更具冲击力的是,定位更低端的Terra和Luna,在约十六分之一的成本下,基准测试得分仍超过Fable 5。这一"降维打击"式的价格策略,直接压缩了竞争对手的差异化空间。
编程领域是主战场。在Artificial Analysis编程智能体指数测试中,Sol(最大推理设置)以80分创下新纪录,比Fable 5高出2.8分,同时输出token数量不及后者的一半,耗时减少逾半,成本低约三分之一。
在复杂命令行工作流测试Terminal-Bench 2.1中,Sol以88.8%的得分领先;面向真实代码库的长周期工程测试DeepSWE v1.1中,其得分达72.7%,同样处于行业前列。
不过,吃瓜要吃全套。翻到博客最底下的评测大表格,有几处数字颇为微妙:SWE-Bench Pro上Sol为64.6%,而Claude Mythos 5达到80.3%;FrontierMath最难的Tier 4数学题,Sol的65.9%居然不如自家上代GPT-5.5的72.5%,Fable 5更是达到87.8%。可见在某些极致场景下,Anthropic依然保有优势。
三、ultra多智能体模式:用算力堆出更强结果
GPT-5.6引入分层计算调度机制,允许用户根据任务需求灵活选择推理深度。除标准的高推理设置外,OpenAI新增"max"和"ultra"两档模式:
max模式:给予模型更长思考和方案修正时间,适合需要深度推理的复杂任务
ultra模式:默认协调四个并行智能体,最多可堆至十六个,通过牺牲更高的token消耗换取更强结果和更短交付时间
在BrowseComp测试中,Sol Ultra以92.2%的得分刷新纪录;在OSWorld 2.0中以62.6%的成绩超越Claude Opus 4.8,且后者输出token用量比其多出85%。
SEC-Bench Pro(针对复杂软件的漏洞概念验证生成)测试中,Sol达71.2%,而GPT-5.5仅为45.8%。发布会上研究员的说法是:这些智能体能像一支有经验的团队那样拆分工作。
API层面,OpenAI同步推出Programmatic Tool Calling功能,允许GPT-5.6在内存中编写并运行轻量程序,自主协调工具、处理中间结果,并在执行过程中动态调整工作流。简言之,以前是开发者手把手教模型每一步怎么走,现在模型自己会写"调度脚本"了。
四、ChatGPT Work:Codex消失背后的超级应用野心
模型之外,产品侧一口气三连发:ChatGPT Work、全新桌面App、还有能直接分享的Sites。
1. ChatGPT Work的定位
官方定义是能跨应用和文件采取行动、项目执行持续好几个小时、能把目标变成成品的智能体。底层也应用到了Codex技术。
有意思的数据是:Codex每周有超过500万人在用,其中100多万人拿它干的活跟写代码没关系。OpenAI一看,干脆做成通用产品。
ChatGPT Work能做的事情大致分三类:
成品整合:把分散在各系统中的资料整合成成品,借助GPT-5.6对模板和设计系统的理解,将分析、整理和生成工作一步完成
企业工具连接:通过统一插件目录让ChatGPT Work能直接调用各类应用获取上下文,真正进入企业工作流
定时任务执行:通过Scheduled Tasks自动执行重复任务,让AI持续处理监控、汇总和更新等工作
2. Codex独立App下线,能力并入ChatGPT
Codex独立App从今天起并入新版ChatGPT桌面App,Chat、Work、Codex三个模式装进同一个App。Codex仍然保留编码能力,还新增了diff内联编辑、侧边栏PR review、更快的Computer Use,以及一个项目里支持多个代码仓库。
原来的ChatGPT桌面App会改名叫ChatGPT Classic。而独立的Atlas浏览器要被砍掉了,功能转进Chrome侧边栏插件。
3. Sites网页搭建功能
Sites则是公测版,一句话把分析结果变成可分享的交互网站或Web应用,做仪表盘、项目追踪、产品原型都行。发布会现场,OpenAI财务团队人员演示了一个月底对账的案例:以前要在多个系统之间来回核对Excel预测模型,忙活好几天;现在一条指令,ChatGPT Work跑完差异分析、更新Excel模型、顺手做好PPT,还能生成一个可分享的交互网站,最后让它把链接发到Slack上。
五、AI训练AI:OpenAI自己先被改造了
这次发布会最重要的信息,其实藏在研究员一句轻描淡写里:全家桶里最便宜的Luna,后训练环节是旗舰Sol自己独立完成的。
研究员现场展示了那条prompt:找到训练配置、找到空闲GPU、启动脚本、确认跑通。就这么短短几句话,扔给Codex,剩下的Sol自己搞定。用OpenAI研究员的原话说:这活以前得一队资深研究员来干,现在感觉"自动化研究员已经很近了"。
OpenAI给出了一组内部数据,颇为震撼:
过去六个月,内部用于代码推理的研究算力份额增长100倍
智能体token用量增长约22倍
GPT-5.6内测期间,研究员人均每日输出token量超过GPT-5.5时期最高水平的两倍
这一趋势已延伸至销售、市场、用户运营及财务等职能部门
为了量化这事,OpenAI还专门搞了一套RSI指数(递归自我改进),涵盖调试研究系统、优化训练内核、跑机器学习实验、改进另一个模型等真实任务。GPT-5.6 Sol以57.9分领先GPT-5.5的41.7分,提升幅度达16.2个百分点。
OpenAI将此解读为AI辅助AI研发正在加速落地的直接证据,并将其定位为推动后续模型迭代效率的核心驱动力之一。
六、安全机制同步升级:70万GPU小时红队测试
随着模型能力提升,OpenAI在本次发布中同步强化安全架构。GPT-5.6 Sol的网络安全防护措施较前代拦截的潜在有害活动多出约10倍。
此前,OpenAI在正式发布前进行了约70万A100e GPU小时的黑盒自动化红队测试,并联合外部专家完成了大规模人工与自动化双轨评测。
区别于纯分类器拦截方案,GPT-5.6引入"推理监控器"(reasoning monitor),通过逐对话上下文分析判断潜在危害,使安全边界能够随使用场景动态调整,并可在不重新训练分类器的前提下快速修补漏洞。
针对过度拦截可能对正当用途造成的影响,OpenAI在ChatGPT和Codex中提供一键切换至低能力模型重试的选项。
网络安全领域进步同样猛:ExploitBench从上代的47.9%干到73.5%,ExploitGym在六小时上限内的通过率从15.1%提升至33.7%。能力太强,OpenAI配套上了"可信访问"机制,个人要实名验证、开高级账户安全才能碰最强的网络安全能力,高风险地区直接限制。
七、适用人群速查:免费到企业版全覆盖
| 用户类型 | 可用功能 |
|---|---|
| 免费用户 | ChatGPT Work和Codex里可用Terra,新版桌面App可直接下载,Chat、Work、Codex三个入口都有 |
| Plus/Business用户 | 聊天里用上Sol,Work和Codex里三模型随意切换,ChatGPT Work几天内推送,Codex里还能开ultra |
| Pro/企业版用户 | 待遇最全,多一个Sol Pro选项留给最难任务,ChatGPT Work当天可用,Work里的ultra直接解锁 |
| 开发者 | API开放全部三个模型,多智能体功能以beta形式提供 |
max模式不挑档位,所有能用上GPT-5.6的Work和Codex用户,去设置里打开开关即可。
八、哥布林梗大结局:从执念降级为小爱好
还记得GPT-5.5上线时那个著名的补丁吗?当时OpenAI不得不在开发者消息里专门叮嘱模型:别老聊哥布林和小精灵。起因是训练阶段出了reward hacking,模型钻了奖励机制的空子,学会了没事就往回答里塞哥布林,而且怎么劝都戒不掉。
如今,这桩悬案终于迎来官方大结局。OpenAI研究员宣布问题已在GPT-5.6中修复,今后模型只会在"可爱或合适的场合",聊适量的哥布林。
注意措辞,是"适量"。也就是说,哥布林并没有被赶尽杀绝,只是从戒不掉的执念,降级成了偶尔拿出来把玩的小爱好。恭喜GPT戒断依赖成功,也恭喜哥布林保住了AI编制。
九、行业影响:内容创作与开发者生态的双重洗牌
GPT-5.6的全面开放标志着通用AI正式迈入规模化商用落地阶段。
内容创作领域:150万无损超长上下文窗口支持一次性导入完整行业资料、历史稿件、品牌规范手册,模型可深度记忆用户固定写作风格。原生多模态联动写作,上传图片、表格、图纸后可自动提取信息转化为图文配套稿件,商业策划、产品测评、科普图文等复合型内容创作效率提升六成以上。
开发者生态:代码审查平台Qodo联合创始人兼CEO Itamar Friedman表示,GPT-5.6在其内外部基准测试中均超越GPT-5.5,且每次代码审查所需token数量约减少三分之二,中位延迟降低约50%。AI开发平台Lovable联合创始人Fabian Hedin指出:"采用GPT-5.6后,用户完成任务所需步骤减少约25%,工具调用次数减少35%至48%,项目失败率下降15%。"
行业竞争格局:此前主流竞品在同等内容质量下耗时更长、调用成本更高,而GPT-5.6以更低成本实现更强的长文本逻辑与多风格适配能力,大量内容工作室、自媒体团队、中小企业将完成AI创作工具切换。Sam Altman在X上帮腔说:"我们已经听到了企业对AI成本的担忧,而5.6 Sol对于每任务美元成本来说是一个巨大的进步,Terra和Luna也是如此。"
写在最后:AI研发自加速时代的开启
GPT-5.6的发布不仅是模型能力的迭代,更揭示了AI行业正在发生的深层变革。从"对话工具"到"工作智能体",从"人训练AI"到"AI训练AI",从"单一模型"到"多智能体并行",OpenAI正在重新定义AI产品的形态与边界。
当Luna的后训练可以由Sol独立完成,当研究员人均token输出翻倍,当内部研究算力六个月增长100倍——这些数字背后,是一个正在加速到来的未来。AI辅助AI研发正在加速落地,而这,或许才是GPT-5.6发布留给行业最值得深思的信号。
正如业内分析所言:未来文字行业将形成人机协同的全新工作模式,AI承担基础内容产出工作,人类聚焦创意策划、情感表达、观点输出等高价值环节,持续推动内容行业提质增效。而这场由AI驱动的内容生产变革已然开启,多元题材、多风格、高质量文章的创作门槛,迎来历史新低。