ByteNoteByteNote
OpenAI 发布 GPT-5.6:很强,但你暂时用不上
字

字节笔记本

2026年10月5日 · 约 13 分钟读完

OpenAI 发布 GPT-5.6:很强,但你暂时用不上

API中转
¥120

GPT-5.6 三档结构与定价

6 月 26 日,OpenAI 发布了新一代模型 GPT-5.6。但这场发布最值得讲的,不是模型本身,而是美国政府第一次直接出手,拦住了一个商业 AI 产品的公开发布。

这是 AI 行业一个没有先例的时刻。

一、先说产品:GPT-5.6 到底发布了什么

OpenAI 这次给 GPT-5.6 换了一套全新的命名规则。数字 5.6 代表代际,后面的 Sol / Terra / Luna 代表三个固定的能力档位,名字分别取自太阳、地球、月亮,从强到弱排列。

模型定位输入价(/百万 token)输出价类比
Sol旗舰,最强$5$30太阳
Terra日常,性价比$2.5$15地球
Luna经济,便宜快$1$6月亮

这套命名的一个隐含信号是:OpenAI 开始把"代际"和"档位"拆开了。以前 GPT-4 / GPT-4o / GPT-4-mini 是三代不同模型;现在 5.6 是一代,Sol/Terra/Luna 是这一代里的三个固定档位。以后如果出 GPT-5.7,大概率也是同样的三档结构。这让定价和能力对照变得可预期了。

旗舰 Sol 新增了两个推理模式:

  • max 模式:让模型花更长时间做深度推理(类似"慢思考")
  • ultra 模式:调用多个子 agent 并行处理复杂任务,相当于一个 AI 自己拆分工作、分配给一组 AI 干活、最后汇总

第二个尤其值得注意。如果 ultra 模式稳定可用,意味着开发者可以把复杂的多步骤任务整个甩给模型,不用自己搭 agent 编排框架。这跟 Anthropic 在 Claude 上做的 agent 能力、Cursor 在 IDE 里做的 background agent,方向高度一致:整个行业都在抢占"AI 自己管理 AI"这个位置。

价格里藏着 OpenAI 的真实策略

Sol 的定价($5/$30)和上一代 GPT-5.5 完全一样。这说明 OpenAI 把"最强模型"的价格锚定在了 $5/$30 这个档位,不再随代际上涨。

真正有杀伤力的是 Terra:性能接近 GPT-5.5,价格砍半。对任何跑大量推理的团队来说,这是最实际的变化,同样的预算,能跑两倍的量。Luna($1/$6)则瞄准对成本极度敏感的高吞吐场景。

还有个硬件加速的彩蛋:7 月会上线 Cerebras 版本的 Sol,推理速度可达每秒 750 个 token。这个数字意味着什么?现在主流旗舰模型大概 50-100 tok/s,750 tok/s 是一个数量级的跃迁,接近"打字速度跟不上模型生成速度"。Cerebras 的晶圆级芯片此前在开源模型上已经证明能跑到 1800-3000 tok/s,这次是第一次把前沿闭源模型推到这个速度。

二、再说真正的新闻:美国政府拦下了发布

这才是 6 月 26 日真正没有先例的事。

据 Reuters 报道,应美国政府要求,OpenAI 在公开发布 GPT-5.6 之前,必须先把前沿模型交给政府审查最多 30 天。审查期内,模型只向**大约 20 家经过政府审批的"可信合作伙伴"**开放,普通开发者和 ChatGPT 用户,暂时用不上。

多家媒体(WENY、TechCrunch)进一步确认:这 20 家合作伙伴是经特朗普政府批准的,审查名义是网络安全审查。

这是 AI 行业第一次,一家商业公司发布自己的产品,需要先过政府这一关。

OpenAI 自己的态度很微妙。官方声明里,Sam Altman 一方面说"这符合我们一贯的渐进式部署策略",另一方面又明确表态:"这不是我们认为最优的流程"(this isn't quite the process that we think is optimal)。TechCrunch 更直接地报道了 OpenAI 的原话:"这种限制不应该是常态"(restrictions shouldn't be the norm)。

翻译成人话:OpenAI 在配合,但在公开抱怨。

这件事为什么没有先例

过去两年,无论 GPT-4、Claude、Gemini 怎么迭代,发布节奏都是公司自己定。政府最多事后发个报告、开个听证会。事前审批、点名合作伙伴、卡住发布,这是头一回。

它打破了一个一直存在的默契:AI 公司对自己的模型有发布权。这个默契一旦被打破,接下来每一家做前沿模型的美国公司(Anthropic、Google、Meta)都可能面对同样的流程。OpenAI 这次"配合",某种程度上是在给整个行业立规矩,而这个规矩,未必是它愿意立的。

三、安全:OpenAI 花了最大篇幅讲的部分

既然政府卡的是安全,OpenAI 这次在安全上花的笔墨前所未有。

测试规模:投入超过 70 万个 A100 等效 GPU 小时做自动化红队测试,外加外部红队评估。专门搜索"能跨场景通用的越狱攻击"(universal jailbreak)。

模型内置机制:实时分类器在生成过程中检测网络安全和生物领域的滥用,可疑输出会被暂停,交给一个更大的推理模型复审。

独立第三方评估:METR(Model Evaluation & Threat Research,独立 AI 安全机构)在 6 月 26 日同步发布了 GPT-5.6 Sol 的部署前安全评估,这件事本身就不寻常,说明 OpenAI 主动把模型交给了独立机构背书。

GPT-5.6 发布前审查流程与安全评估

能力分级:网络安全"高",但没到"关键"

按 OpenAI 自己的准备度框架(preparedness framework),Sol 的网络安全能力被定级为 "高"(High),但没有达到"关键"(Critical)。

具体表现:Sol 能找到浏览器漏洞和"利用原语"(exploit primitive,构建攻击的基础组件),但在测试条件下无法自主完成完整的攻击链。

OpenAI 把这解读为积极信号:模型更擅长帮防守方找洞和修补,而不是帮攻击方搞破坏。

这里要打个问号。"ExploitBench"这个 benchmark 以及 OpenAI 引用的具体分数("用三分之一的 token 达到 Mythos 水平"),在 OpenAI 之外的多家媒体和独立数据库里都没能交叉验证到。它可能来自 OpenAI 自己的报告,建议读者把这个数字当作"厂商自述"而非"中立评测"。这也是为什么 OpenAI 急着拉 METR 出来做独立背书:光自己说不够了。

四、我的观察:三个被忽视的信号

事实讲完了。下面是我自己的判断,不一定对,供参考。

信号 1:政府审批正在变成"新基础设施"

很多人把这次"政府卡发布"当成一次性事件。我倾向于认为它是一个新机制的起点。

注意 Reuters 那个细节:政府有 30 天提前访问权。这意味着美国政府在事实上获得了对前沿 AI 模型的事前审查权,不是事后监管,是事前审批。一旦这个口子开了,后面很难收回去。OpenAI 今天"配合",是为了换"几周内扩大开放"的承诺;但下一个发布 GPT-5.7、GPT-6 的公司,会面对一个已经成型的审批流程。

对中国读者来说这有个微妙的对照:我们习惯了大平台发布产品要过监管;现在美国前沿 AI 公司也开始走这条路了。区别在于,美国这套是打着"国家安全"旗号、以"自愿配合"的形式出现的,软,但更难推翻。

信号 2:Sol Ultra 暴露了真正的战场

表面上看,这场发布是 OpenAI vs Anthropic vs Google 的模型参数大战。但我认为 Sol 的 ultra 模式(多子 agent 并行)才暴露了真正的战场。

模型层的差距正在缩小:你 88 分、我 89 分、他 90 分,用户体感区别不大。真正拉开差距的是编排层:谁能把"一个模型"变成"一支会自己分工的 AI 团队"。

  • Anthropic 有 Claude 的 agent 能力,以及循环工程(Loop Engineering)这类编排实践
  • Cursor 有 IDE 里的 background agent
  • OpenAI 现在用 Sol Ultra 直接把编排做进了模型

这意味着 agent 编排正在从"框架"下沉到"模型"。以前你要搭 LangChain、写循环、配 evaluator;以后模型自己就会拆任务、分 agent、汇总。这对手写编排框架的开发者不是好消息。

信号 3:OpenAI 的"双面表态"是策略,不是软弱

Sam Altman 那篇声明读起来很拧巴:一边说配合政府,一边说不认同流程。很多人解读为 OpenAI 被政府压制了。

我的判断相反,这是精心计算的双面表态。

  • 对政府:我配合,我是"可靠、可依赖的合作伙伴"(reliable, dependable partner),保住合规和政商关系
  • 对公众和开发者:我本想开放,是政府拦的,我和你们站在一起,保住品牌和开发者好感

两头都要。而那句"benefiting all of humanity"(造福全人类)的使命宣言再次出现,是在提醒所有人:OpenAI 仍然想占据"开放 AI"的道德高地,哪怕它这次恰恰是不开放的那个。

这不是软弱,是精明。

五、对你来说,现在该关注什么

如果你是开发者或重度用户,短期内有三件事值得盯:

1. Terra 的性价比窗口。 性能接近 GPT-5.5、价格砍半,是目前最实际的红利。一旦开放,重推理的 workload 可以立刻迁移。值得现在就开始评估迁移成本。

2. Sol Ultra 的实际表现。 多 agent 编排如果真稳,会改变开发范式。但"发布会 demo"和"生产稳定"之间通常有距离,等开放后看真实评测,别急着押注。

3. 政府审批流程会不会固化。 这是长期变量。如果 GPT-5.7 还要走这套流程,说明"AI 发布需审批"已成定局;如果这次只是特例,那 OpenAI 的妥协就换到了实惠。

至于 ChatGPT 普通用户什么时候能用上 GPT-5.6,没有时间表。OpenAI 只说"几周内扩大开放",Axios 报道下周会增加更多客户。你我的位置,就是等。

写在最后

这场发布的技术内容,其实不复杂:模型更强了、有了新档位、有了多 agent 模式、有了极速推理。

真正复杂的是它背后的格局变化:一家 AI 公司发布自己的产品,第一次需要政府放行。这件事的影响,会比 GPT-5.6 本身长远得多。

Sol、Terra、Luna 这三个名字,取自太阳、地球、月亮,一个浪漫的命名。但这场发布的现实一点都不浪漫:它发生在国家安全审查、政府审批名单、和"谁配用最强 AI"的博弈里。

OpenAI 在声明最后说:"We hope you will love it."(希望你会喜欢它。)

模型大概率确实值得喜欢。问题是,喜欢之前,得先轮得到你。

事实来源:OpenAI 官方报告、Reuters、TechCrunch、VentureBeat、The Decoder、METR 独立评估报告、WENY、Senswit、GovInfoSecurity。价格与 benchmark 数据以 OpenAI 官方为准,ExploitBench 相关数据未能独立交叉验证,已在文中标注。

相关文章

分享: