
字节笔记本
2026年10月5日 · 约 6 分钟读完
Grok 4.5 只开特斯拉内测:复盘马斯克的套娃式跳票
马斯克宣布 Grok 4.5 开启面向特斯拉和 SpaceX 员工的私有内测。这款模型基于 1.5T V9 基座,补充训练加入了 Cursor 数据,原推互动达到 35497 赞、4580 转,热度依然是顶级的。
但 X 平台上一位 AI 分析人士的点评一针见血:这是「教科书级的套娃式跳票」。从 4 月到 6 月底,承诺的模型一个没发,只等来一份仅限特斯拉内部体验的测试版。
一、跳票时间线完整还原
| 时间 | 马斯克说了什么 | 实际发生了什么 |
|---|---|---|
| 4 月 18 日 | 大模型工厂将每两周升级一次 | 画饼开始 |
| 4 月中旬 | 发布 Grok 4.3 | 唯一兑现的一条 |
| 5 月初(预定) | Grok 4.4(1T 参数)发布 | 毫无音讯 |
| 5 月中旬 | 改口:1.5T V9 训练完毕,3-4 周内发布 | 超期未发 |
| 5 月 25 日 | 再确认:距离公测只有 2-3 周 | 又超期 |
| 6 月 29 日 | Grok 4.5 开启特斯拉/SpaceX 内测 | 仅限内部 |
两个月没有推出任何公开新模型,原定更早发布的 Grok 4.4 已被悄然废弃。

二、这次内测到底是什么
马斯克推文原文:
Grok 4.5, based on our 1.5T V9 foundation model, with Cursor data added in supplemental training, is now in private beta at SpaceX & Tesla. Early evals show performance close to, perhaps exceeding Opus.
翻译成要点:
- 基于 1.5 万亿参数的 V9 基座模型;
- 加入 Cursor 数据做补充训练,SpaceX 已在 6 月收购 Cursor 母公司;
- 目前只在 SpaceX 和特斯拉内部测试;
- 早期评估显示性能接近甚至超过 Opus;
- 强化学习(RL)持续改善中;
- 承诺年底前 SpaceX 每月发布一款从头训练的全新模型。
注意三个关键词:private beta、at SpaceX & Tesla、early evals。这意味着:
- 外部用户用不到,只有特斯拉和 SpaceX 员工能体验;
- 「早期评估」不可验证,「接近或超过 Opus」是马斯克自己说的;
- 「每月一款全新模型」又是一层新承诺。
三、套娃式跳票的模式
这位分析人士的点评精确到让人拍案:马斯克的发版节奏是教科书级的套娃式跳票。
承诺 A(2 周发)→ 过了 2 周
→ 改口 B(3-4 周发)→ 过了 4 周
→ 再改口 C(2-3 周发)→ 过了 4 周
→ 终于「发了」→ 只是内部测试
→ 同时画新饼 D(每月发一款)每一层跳票都包着一层新的承诺。你以为等到了结果,拆开一看,里面是下一层承诺。

四、Cursor 收购与人才流失
分析人士还指出一个尴尬的事实:SpaceX 在 6 月高价收购了 Cursor 母公司,试图用买来的团队和数据紧急填补窟窿。但问题在于:
- 核心骨干持续流失;
- 收购整合需要时间,远水难解近渴;
- 需要用 Cursor 数据来训练 Grok,恰恰说明原本的训练数据或能力储备不够。
他的原话是:「核心骨干持续流失的尴尬,显然让马斯克大模型工厂的轰鸣声,听起来远不如他画饼的声音响亮。」
五、对行业的影响
假如 Grok 4.5 真能达到 Opus 水平,影响会体现在几个维度:
| 维度 | 影响 |
|---|---|
| 编码 | Claude 在编码领域的领先被追平 |
| 价格 | xAI 若走低价路线(类似 DeepSeek),会压低整个市场的价格 |
| Cursor 集成 | Grok 加 Cursor 数据,等于深度整合的编程 Agent |
| 竞争格局 | OpenAI、Anthropic、xAI、DeepSeek 四足鼎立 |
但「假如」是关键。马斯克说的 early evals show performance close to, perhaps exceeding Opus,没有公开 benchmark,没有外部评估,只是他自己说的。在 AI 领域,「我们自己测很强」和「别人测也很强」之间隔着巨大的鸿沟。
六、诚实评估
平心而论,马斯克的模型确实在进步:从 Grok 3 到 4.3,再到声称中的 4.5,能力在上升。
但发版节奏的承诺反复跳票也是事实:每两周、3-4 周、2-3 周、内部测试,这不是「谨慎」,而是「过度承诺」。
最大的风险在于:如果「每月一款全新模型」再次跳票,xAI 的信誉会进一步受损,市场对其发布的每一句话都要重新定价。
七、给开发者的建议
| 你现在的选择 | 建议 |
|---|---|
| 等 Grok 4.5 公测 | 别等,先用现有最强模型把活干了 |
| 用 Grok 4.3 | 实时对话场景确实不错,但编码不如 Claude/GPT |
| 担心 Grok 追平 Opus | 即使追平也需要时间验证,Claude Code 仍是当前最强编码 Agent |
| 关注 Cursor 收购影响 | Grok 与 Cursor 的深度整合是未来变量,短期不影响 |
核心建议只有一条:别把工作流绑死在某个还没发布的模型上。用当前最强的模型(Claude Opus 4.8 / GPT 5.5 / DeepSeek V4)把事做成,等 Grok 4.5 公测后再重新评估。
本文基于马斯克的公开推文与 X 平台上分析人士的点评整理,原推 35497 赞、4580 转。



