摘要:2026 年 7 月 9 日,OpenAI 正式全量发布 GPT-5.6 系列模型。这次没有沿用以往的 Mini/Standard/Ultra 分级,而是拆成了 Sol、Terra、Luna 三档。同步上线的还有 ChatGPT Work
智能体和 Codex 并入桌面端。本文从开发者视角拆解这次更新的核心变化、实际表现和上手路径。
一、开篇:这次更新到底变了什么
如果你还在用 ChatGPT 当“高级问答工具”,那 GPT-5.6 这一波更新可能会让你重新审视这个产品的定位。
7 月 9 日,OpenAI 全面开放了 GPT-5.6 系列。最直观的变化是模型分层了——旗舰 Sol、均衡 Terra、轻量 Luna,三档定位清晰,价格也拉开了差距。但比模型本身更值得关注的是产品形态的转向:Codex 被整合进了 ChatGPT 桌面端,ChatGPT Work 作为一个能跨应用、多步骤、长时间自主执行任务的智能体同步上线。
换句话说,ChatGPT 正在从一个“回答问题”的工具,变成一个“帮你干活”的同事。这个转向对开发者和企业用户的意义,可能比跑分提升几个百分点更大。
二、核心升级点
推理能力:Max 模式 + Ultra 模式
GPT-5.6 Sol 引入了两种新的推理控制模式。Max 模式让模型在复杂问题上花更多时间进行深度推理,适合需要多步逻辑推演的场景。Ultra 模式则默认启动 4 个子 Agent 并行处理任务,最多可扩展到 16 个。在 Terminal-Bench 2.1 测试中,Sol 常规得分 88.8%,开启 Ultra 模式后提升至 91.9%。
上下文窗口:三档各有侧重
三款模型的上下文窗口配置很有意思:
- Sol:128K,聚焦推理深度而非长度
- Terra:512K,兼顾长度与性价比
- Luna:1.5M,最长上下文、最低成本
Luna 拥有最大的上下文窗口却定价最低(输入 1 美元/百万 token),这说明 OpenAI 在刻意压低长文本处理的成本门槛。
代码能力:从助手到协作者
GPT-5.6 Sol 在智能体编程测试中,完成同等任务相比竞品减少 54% 的输出 token,耗时缩短 57%。模型前端设计能力也有明显提升,可以自主渲染页面、自查视觉与功能缺陷后再交付成果。Sol 在 Agents’ Last Exam 测试中得分 53.6,领先 Claude Fable 5 约 13 分。
多模态:统一架构
GPT-5.6 系列采用统一的多模态混合专家架构,文本、图像、音频、视频共享同一特征空间。实测中模型能基于参考图生成精准的视觉复刻,也能将设计稿直接还原为可运行代码。
Agent 相关能力:调度权下沉到模型层
这次 API 层面引入了 Programmatic Tool Calling——模型可以自己编写程序去调度工具、处理临时数据、组织执行流程。过去需要开发者在应用层手写编排逻辑的工作,现在模型自己就能完成。ChatGPT Work 则进一步把这种能力产品化:给它一个目标,它能自己拆步骤、调工具、跨邮箱、日历、Slack 等多软件连续工作数小时,直接输出文档、报表甚至网页应用。
三、新旧模型对比
| 对比维度 | GPT-5.5 | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|---|
| 定位 | 通用旗舰 | 复杂推理/Agent 编码 | 日常生产力主力 | 高频轻量任务 |
| 输入价格(/M token) | 约 $5 | $5 | $2.50 | $1 |
| 输出价格(/M token) | 约 $30 | $30 | $15 | $6 |
| 上下文窗口 | — | 128K | 512K | 1.5M |
| Terminal-Bench 2.1 | — | 88.8% (Ultra 91.9%) | 82.5% | 84.3% |
数据来源:OpenAI 官方发布及第三方实测整理。Terra 性能对标 GPT-5.5 但价格减半;Luna 用不到一半的成本逼近 GPT-5.5 的峰值表现。
四、实际使用感受
适合的场景
复杂代码开发与系统复盘——Sol 在日志分析、异常定位、修复建议等环节表现突出。长文档处理与代码库分析——Terra 的 512K 上下文窗口比 Sol 更实用。高频批量任务——Luna 成本最低、吞吐最高,适合客服、数据批处理等场景。
提升明显的任务
多步骤工作流的自主执行是这次最大的变化。实测中 ChatGPT Work 能把客户研究转化为活动简报、再用简报生成营销素材,每一步都延续上下文。内部测试中,OpenAI 近 100% 的团队(包括财务和销售)已经在用 ChatGPT Work 推进工作。
仍然存在的短板
复杂推理场景下 Sol 的 token 消耗不低,免费版用户需要留意额度。语音场景的智能体化探索仍处于早期阶段。此外,Sol 在 ARC-AGI 这类抽象推理测试上的表现(13.33%)说明距离真正的通用推理还有距离。
五、普通用户/开发者怎么上手
免费用户:桌面端(Windows/Mac)可直接使用 Chat、Work 和 Codex 三个模式。ChatGPT Work 和 Codex 的基础功能免费版即可使用。
付费用户:Plus($20/月)可获得 Sol 的推理能力、更高额度和图像生成。Pro 额外提供无限消息、增强的深度研究与智能体模式。
开发者:通过 OpenAI API 可调用三款模型。提示缓存机制支持自定义缓存断点,缓存读取可享受 90% 费用折扣。
选型建议:复杂推理、代码开发选 Sol;日常办公、文档分析选 Terra;高频批量任务选 Luna。
六、客观评价
GPT-5.6 这次更新的核心价值不在跑分,而在产品形态的转向。三档分层让开发者能按任务复杂度选择“恰到好处”的模型,而不是用一把大锤砸所有钉子。Programmatic Tool Calling 和 ChatGPT Work 把智能体的调度能力从应用层下沉到了模型层,这对中小团队是实打实的利好。
但也要看到局限:Sol 的推理成本不低,复杂任务场景下 token 消耗需要精打细算;语音等非结构化场景的智能体化还在早期;抽象推理能力仍有提升空间。
总的来说,GPT-5.6 是一次扎实的工程化迭代——不是“革命”,而是把之前分散的能力(代码、多模态、Agent)整合成了一个可用的产品体系。对开发者来说,值得花时间摸清楚三款模型的边界,找到最适合自己工作流的组合。