ByteNoteByteNote
Grok 4.5 只开特斯拉内测:复盘马斯克的套娃式跳票
字

字节笔记本

2026年10月5日 · 约 6 分钟读完

Grok 4.5 只开特斯拉内测:复盘马斯克的套娃式跳票

API中转
¥120

马斯克宣布 Grok 4.5 开启面向特斯拉和 SpaceX 员工的私有内测。这款模型基于 1.5T V9 基座,补充训练加入了 Cursor 数据,原推互动达到 35497 赞、4580 转,热度依然是顶级的。

但 X 平台上一位 AI 分析人士的点评一针见血:这是「教科书级的套娃式跳票」。从 4 月到 6 月底,承诺的模型一个没发,只等来一份仅限特斯拉内部体验的测试版。

一、跳票时间线完整还原

时间马斯克说了什么实际发生了什么
4 月 18 日大模型工厂将每两周升级一次画饼开始
4 月中旬发布 Grok 4.3唯一兑现的一条
5 月初(预定)Grok 4.4(1T 参数)发布毫无音讯
5 月中旬改口:1.5T V9 训练完毕,3-4 周内发布超期未发
5 月 25 日再确认:距离公测只有 2-3 周又超期
6 月 29 日Grok 4.5 开启特斯拉/SpaceX 内测仅限内部

两个月没有推出任何公开新模型,原定更早发布的 Grok 4.4 已被悄然废弃。

Grok 4.5 跳票时间线

二、这次内测到底是什么

马斯克推文原文:

Grok 4.5, based on our 1.5T V9 foundation model, with Cursor data added in supplemental training, is now in private beta at SpaceX & Tesla. Early evals show performance close to, perhaps exceeding Opus.

翻译成要点:

  • 基于 1.5 万亿参数的 V9 基座模型;
  • 加入 Cursor 数据做补充训练,SpaceX 已在 6 月收购 Cursor 母公司;
  • 目前只在 SpaceX 和特斯拉内部测试;
  • 早期评估显示性能接近甚至超过 Opus;
  • 强化学习(RL)持续改善中;
  • 承诺年底前 SpaceX 每月发布一款从头训练的全新模型。

注意三个关键词:private beta、at SpaceX & Tesla、early evals。这意味着:

  1. 外部用户用不到,只有特斯拉和 SpaceX 员工能体验;
  2. 「早期评估」不可验证,「接近或超过 Opus」是马斯克自己说的;
  3. 「每月一款全新模型」又是一层新承诺。

三、套娃式跳票的模式

这位分析人士的点评精确到让人拍案:马斯克的发版节奏是教科书级的套娃式跳票。

text
承诺 A(2 周发)→ 过了 2 周
  → 改口 B(3-4 周发)→ 过了 4 周
    → 再改口 C(2-3 周发)→ 过了 4 周
      → 终于「发了」→ 只是内部测试
        → 同时画新饼 D(每月发一款)

每一层跳票都包着一层新的承诺。你以为等到了结果,拆开一看,里面是下一层承诺。

套娃式跳票模式

四、Cursor 收购与人才流失

分析人士还指出一个尴尬的事实:SpaceX 在 6 月高价收购了 Cursor 母公司,试图用买来的团队和数据紧急填补窟窿。但问题在于:

  • 核心骨干持续流失;
  • 收购整合需要时间,远水难解近渴;
  • 需要用 Cursor 数据来训练 Grok,恰恰说明原本的训练数据或能力储备不够。

他的原话是:「核心骨干持续流失的尴尬,显然让马斯克大模型工厂的轰鸣声,听起来远不如他画饼的声音响亮。」

五、对行业的影响

假如 Grok 4.5 真能达到 Opus 水平,影响会体现在几个维度:

维度影响
编码Claude 在编码领域的领先被追平
价格xAI 若走低价路线(类似 DeepSeek),会压低整个市场的价格
Cursor 集成Grok 加 Cursor 数据,等于深度整合的编程 Agent
竞争格局OpenAI、Anthropic、xAI、DeepSeek 四足鼎立

但「假如」是关键。马斯克说的 early evals show performance close to, perhaps exceeding Opus,没有公开 benchmark,没有外部评估,只是他自己说的。在 AI 领域,「我们自己测很强」和「别人测也很强」之间隔着巨大的鸿沟。

六、诚实评估

平心而论,马斯克的模型确实在进步:从 Grok 3 到 4.3,再到声称中的 4.5,能力在上升。

但发版节奏的承诺反复跳票也是事实:每两周、3-4 周、2-3 周、内部测试,这不是「谨慎」,而是「过度承诺」。

最大的风险在于:如果「每月一款全新模型」再次跳票,xAI 的信誉会进一步受损,市场对其发布的每一句话都要重新定价。

七、给开发者的建议

你现在的选择建议
等 Grok 4.5 公测别等,先用现有最强模型把活干了
用 Grok 4.3实时对话场景确实不错,但编码不如 Claude/GPT
担心 Grok 追平 Opus即使追平也需要时间验证,Claude Code 仍是当前最强编码 Agent
关注 Cursor 收购影响Grok 与 Cursor 的深度整合是未来变量,短期不影响

核心建议只有一条:别把工作流绑死在某个还没发布的模型上。用当前最强的模型(Claude Opus 4.8 / GPT 5.5 / DeepSeek V4)把事做成,等 Grok 4.5 公测后再重新评估。


本文基于马斯克的公开推文与 X 平台上分析人士的点评整理,原推 35497 赞、4580 转。

相关文章

分享: