
字节笔记本
2026年10月5日 · 约 13 分钟读完
OpenAI 发布 GPT-5.6:很强,但你暂时用不上

6 月 26 日,OpenAI 发布了新一代模型 GPT-5.6。但这场发布最值得讲的,不是模型本身,而是美国政府第一次直接出手,拦住了一个商业 AI 产品的公开发布。
这是 AI 行业一个没有先例的时刻。
一、先说产品:GPT-5.6 到底发布了什么
OpenAI 这次给 GPT-5.6 换了一套全新的命名规则。数字 5.6 代表代际,后面的 Sol / Terra / Luna 代表三个固定的能力档位,名字分别取自太阳、地球、月亮,从强到弱排列。
| 模型 | 定位 | 输入价(/百万 token) | 输出价 | 类比 |
|---|---|---|---|---|
| Sol | 旗舰,最强 | $5 | $30 | 太阳 |
| Terra | 日常,性价比 | $2.5 | $15 | 地球 |
| Luna | 经济,便宜快 | $1 | $6 | 月亮 |
这套命名的一个隐含信号是:OpenAI 开始把"代际"和"档位"拆开了。以前 GPT-4 / GPT-4o / GPT-4-mini 是三代不同模型;现在 5.6 是一代,Sol/Terra/Luna 是这一代里的三个固定档位。以后如果出 GPT-5.7,大概率也是同样的三档结构。这让定价和能力对照变得可预期了。
旗舰 Sol 新增了两个推理模式:
- max 模式:让模型花更长时间做深度推理(类似"慢思考")
- ultra 模式:调用多个子 agent 并行处理复杂任务,相当于一个 AI 自己拆分工作、分配给一组 AI 干活、最后汇总
第二个尤其值得注意。如果 ultra 模式稳定可用,意味着开发者可以把复杂的多步骤任务整个甩给模型,不用自己搭 agent 编排框架。这跟 Anthropic 在 Claude 上做的 agent 能力、Cursor 在 IDE 里做的 background agent,方向高度一致:整个行业都在抢占"AI 自己管理 AI"这个位置。
价格里藏着 OpenAI 的真实策略
Sol 的定价($5/$30)和上一代 GPT-5.5 完全一样。这说明 OpenAI 把"最强模型"的价格锚定在了 $5/$30 这个档位,不再随代际上涨。
真正有杀伤力的是 Terra:性能接近 GPT-5.5,价格砍半。对任何跑大量推理的团队来说,这是最实际的变化,同样的预算,能跑两倍的量。Luna($1/$6)则瞄准对成本极度敏感的高吞吐场景。
还有个硬件加速的彩蛋:7 月会上线 Cerebras 版本的 Sol,推理速度可达每秒 750 个 token。这个数字意味着什么?现在主流旗舰模型大概 50-100 tok/s,750 tok/s 是一个数量级的跃迁,接近"打字速度跟不上模型生成速度"。Cerebras 的晶圆级芯片此前在开源模型上已经证明能跑到 1800-3000 tok/s,这次是第一次把前沿闭源模型推到这个速度。
二、再说真正的新闻:美国政府拦下了发布
这才是 6 月 26 日真正没有先例的事。
据 Reuters 报道,应美国政府要求,OpenAI 在公开发布 GPT-5.6 之前,必须先把前沿模型交给政府审查最多 30 天。审查期内,模型只向**大约 20 家经过政府审批的"可信合作伙伴"**开放,普通开发者和 ChatGPT 用户,暂时用不上。
多家媒体(WENY、TechCrunch)进一步确认:这 20 家合作伙伴是经特朗普政府批准的,审查名义是网络安全审查。
这是 AI 行业第一次,一家商业公司发布自己的产品,需要先过政府这一关。
OpenAI 自己的态度很微妙。官方声明里,Sam Altman 一方面说"这符合我们一贯的渐进式部署策略",另一方面又明确表态:"这不是我们认为最优的流程"(this isn't quite the process that we think is optimal)。TechCrunch 更直接地报道了 OpenAI 的原话:"这种限制不应该是常态"(restrictions shouldn't be the norm)。
翻译成人话:OpenAI 在配合,但在公开抱怨。
这件事为什么没有先例
过去两年,无论 GPT-4、Claude、Gemini 怎么迭代,发布节奏都是公司自己定。政府最多事后发个报告、开个听证会。事前审批、点名合作伙伴、卡住发布,这是头一回。
它打破了一个一直存在的默契:AI 公司对自己的模型有发布权。这个默契一旦被打破,接下来每一家做前沿模型的美国公司(Anthropic、Google、Meta)都可能面对同样的流程。OpenAI 这次"配合",某种程度上是在给整个行业立规矩,而这个规矩,未必是它愿意立的。
三、安全:OpenAI 花了最大篇幅讲的部分
既然政府卡的是安全,OpenAI 这次在安全上花的笔墨前所未有。
测试规模:投入超过 70 万个 A100 等效 GPU 小时做自动化红队测试,外加外部红队评估。专门搜索"能跨场景通用的越狱攻击"(universal jailbreak)。
模型内置机制:实时分类器在生成过程中检测网络安全和生物领域的滥用,可疑输出会被暂停,交给一个更大的推理模型复审。
独立第三方评估:METR(Model Evaluation & Threat Research,独立 AI 安全机构)在 6 月 26 日同步发布了 GPT-5.6 Sol 的部署前安全评估,这件事本身就不寻常,说明 OpenAI 主动把模型交给了独立机构背书。

能力分级:网络安全"高",但没到"关键"
按 OpenAI 自己的准备度框架(preparedness framework),Sol 的网络安全能力被定级为 "高"(High),但没有达到"关键"(Critical)。
具体表现:Sol 能找到浏览器漏洞和"利用原语"(exploit primitive,构建攻击的基础组件),但在测试条件下无法自主完成完整的攻击链。
OpenAI 把这解读为积极信号:模型更擅长帮防守方找洞和修补,而不是帮攻击方搞破坏。
这里要打个问号。"ExploitBench"这个 benchmark 以及 OpenAI 引用的具体分数("用三分之一的 token 达到 Mythos 水平"),在 OpenAI 之外的多家媒体和独立数据库里都没能交叉验证到。它可能来自 OpenAI 自己的报告,建议读者把这个数字当作"厂商自述"而非"中立评测"。这也是为什么 OpenAI 急着拉 METR 出来做独立背书:光自己说不够了。
四、我的观察:三个被忽视的信号
事实讲完了。下面是我自己的判断,不一定对,供参考。
信号 1:政府审批正在变成"新基础设施"
很多人把这次"政府卡发布"当成一次性事件。我倾向于认为它是一个新机制的起点。
注意 Reuters 那个细节:政府有 30 天提前访问权。这意味着美国政府在事实上获得了对前沿 AI 模型的事前审查权,不是事后监管,是事前审批。一旦这个口子开了,后面很难收回去。OpenAI 今天"配合",是为了换"几周内扩大开放"的承诺;但下一个发布 GPT-5.7、GPT-6 的公司,会面对一个已经成型的审批流程。
对中国读者来说这有个微妙的对照:我们习惯了大平台发布产品要过监管;现在美国前沿 AI 公司也开始走这条路了。区别在于,美国这套是打着"国家安全"旗号、以"自愿配合"的形式出现的,软,但更难推翻。
信号 2:Sol Ultra 暴露了真正的战场
表面上看,这场发布是 OpenAI vs Anthropic vs Google 的模型参数大战。但我认为 Sol 的 ultra 模式(多子 agent 并行)才暴露了真正的战场。
模型层的差距正在缩小:你 88 分、我 89 分、他 90 分,用户体感区别不大。真正拉开差距的是编排层:谁能把"一个模型"变成"一支会自己分工的 AI 团队"。
- Anthropic 有 Claude 的 agent 能力,以及循环工程(Loop Engineering)这类编排实践
- Cursor 有 IDE 里的 background agent
- OpenAI 现在用 Sol Ultra 直接把编排做进了模型
这意味着 agent 编排正在从"框架"下沉到"模型"。以前你要搭 LangChain、写循环、配 evaluator;以后模型自己就会拆任务、分 agent、汇总。这对手写编排框架的开发者不是好消息。
信号 3:OpenAI 的"双面表态"是策略,不是软弱
Sam Altman 那篇声明读起来很拧巴:一边说配合政府,一边说不认同流程。很多人解读为 OpenAI 被政府压制了。
我的判断相反,这是精心计算的双面表态。
- 对政府:我配合,我是"可靠、可依赖的合作伙伴"(reliable, dependable partner),保住合规和政商关系
- 对公众和开发者:我本想开放,是政府拦的,我和你们站在一起,保住品牌和开发者好感
两头都要。而那句"benefiting all of humanity"(造福全人类)的使命宣言再次出现,是在提醒所有人:OpenAI 仍然想占据"开放 AI"的道德高地,哪怕它这次恰恰是不开放的那个。
这不是软弱,是精明。
五、对你来说,现在该关注什么
如果你是开发者或重度用户,短期内有三件事值得盯:
1. Terra 的性价比窗口。 性能接近 GPT-5.5、价格砍半,是目前最实际的红利。一旦开放,重推理的 workload 可以立刻迁移。值得现在就开始评估迁移成本。
2. Sol Ultra 的实际表现。 多 agent 编排如果真稳,会改变开发范式。但"发布会 demo"和"生产稳定"之间通常有距离,等开放后看真实评测,别急着押注。
3. 政府审批流程会不会固化。 这是长期变量。如果 GPT-5.7 还要走这套流程,说明"AI 发布需审批"已成定局;如果这次只是特例,那 OpenAI 的妥协就换到了实惠。
至于 ChatGPT 普通用户什么时候能用上 GPT-5.6,没有时间表。OpenAI 只说"几周内扩大开放",Axios 报道下周会增加更多客户。你我的位置,就是等。
写在最后
这场发布的技术内容,其实不复杂:模型更强了、有了新档位、有了多 agent 模式、有了极速推理。
真正复杂的是它背后的格局变化:一家 AI 公司发布自己的产品,第一次需要政府放行。这件事的影响,会比 GPT-5.6 本身长远得多。
Sol、Terra、Luna 这三个名字,取自太阳、地球、月亮,一个浪漫的命名。但这场发布的现实一点都不浪漫:它发生在国家安全审查、政府审批名单、和"谁配用最强 AI"的博弈里。
OpenAI 在声明最后说:"We hope you will love it."(希望你会喜欢它。)
模型大概率确实值得喜欢。问题是,喜欢之前,得先轮得到你。
事实来源:OpenAI 官方报告、Reuters、TechCrunch、VentureBeat、The Decoder、METR 独立评估报告、WENY、Senswit、GovInfoSecurity。价格与 benchmark 数据以 OpenAI 官方为准,ExploitBench 相关数据未能独立交叉验证,已在文中标注。



