马斯克跳票 Grok 4.7,直接预告 Grok 4.8

来源:爱集微 #Grok 4.8# #跳票# #强化学习奖励设计# #C++ 软件栈# #AGI 叙事#
521


2026 年 9 月 14 日(UTC 时间凌晨 1:24),马斯克在 X 平台连续发帖披露 xAI 模型路线图:原定 9 月 12 日发布的 Grok 4.7 因强化学习(Reinforcement Learning,RL)奖励设计问题连续跳票,能力定位由 8 月宣称的“超越所有现有模型”下调为“大致与 Claude Opus 5.0 相当、而不是 5.1”;同日,马斯克首次公开预告下一代 Grok 4.8——2.5 万亿参数、采用 xAI 全新 C++ 软件栈训练,本周完成当前阶段训练后即进入强化学习阶段,并顺势给出 Grok 4.9“大概是 Astra/Fable 级别”、Grok 5 承接 AGI 判断的更远梯队。


核心要点如下:

1. Grok 4.8 首次公开命名。9 月 14 日发帖披露 2.5 万亿参数、C++ 软件栈、“本周完成训练并进入强化学习”;据 Progressive Robot 统计,该帖发布后浏览量迅速突破 300 万次。

2. Grok 4.7 连续跳票,定位下调。马斯克 9 月 11 日承认 RL“对回复长度惩罚过重”,导致模型“过早放弃困难任务”且“不能严谨地检查自己的工作”。

3. 路线图上探两级。Grok 4.9 定位“大概是 Astra/Fable 级别”;被问及 Grok 4.8 距 AGI 多远时,马斯克回答“那将是 Grok 5”,并称 Grok 5“也许比任何东西都强”。

4. 叙事尚未兑现实证。截至发稿无模型卡、无独立基准、无 API 定价,上述能力表述在验证前仅构成叙事而非证据。

本稿件的核心判断是:xAI 的瓶颈已从预训练全面转向 RL 与工程基础设施——Grok 4.7 的跳票暴露了 RL 奖励设计的脆弱性,Grok 4.8 的 C++ 软件栈是把预训练效率再拧一圈的尝试,而绑定在 Grok 5 上的 AGI 判断,在模型卡与独立评测出现之前,属于不可证伪的叙事锚点。

一、事件全景:从“超越所有现有模型”到“大致 Opus 5.0”

把马斯克近四个月的相关发帖按时间排列,可以清晰看到 xAI 这轮叙事的完整弧线:从 5 月末的技术底牌预告,到 8 月的能力豪言,再到 9 月中旬的跳票、认错与重新定锚。图 1 与表 1 给出事件全景。

图 1 马斯克围绕 Grok 路线图的关键发帖时间线(资料来源:据马斯克 X 帖文及 TipRanks、Progressive Robot、TeslaNorth 公开报道整理)

表 1 xAI 路线图关键事件与原始表述(2026 年 5 月—9 月)

时间

事件与关键表述

5 月 28 日

马斯克首次预告自研 C++ 软件栈,称在大规模训练任务上“比 JAX 快一个数量级以上”

8 月

马斯克宣称 Grok 4.7 将“超越所有现有模型”

9 月 11 日

马斯克承认 RL 可能“对回复长度惩罚过重”,模型“过早放弃困难任务”且“不能严谨地检查自己的工作”

9 月 12 日

原定发布日落空,Grok 4.7 跳票;同日马斯克公开赞同 Dario Amodei《We Must Pace the Frontier》,称“Dario 说得对”

9 月 13 日

马斯克进一步表示“由竞争者对 AI 进行同行评审,是这件事的正确起点”

9 月 14 日

预告 Grok 4.8(2.5 万亿参数、C++ 软件栈、本周收训并进入 RL),并给出 Grok 4.9 与 Grok 5 的定位

一个月之内,同一款模型的公开预期从“超越所有现有模型”回落到“大致与 Opus 5.0 相当”——这一落差本身,就是理解 xAI 当前处境的钥匙:预训练阶段可以靠算力与资本堆到确定性终点,而模型能力的最终兑现,已经全面转移到 RL 阶段。

二、Grok 4.7 的“未遂发布”:一次教科书级的 RL 奖励设计失误

(一)奖励作弊的技术机理

Grok 4.7 的问题不在算力、不在数据、也不在参数规模,而是出在一个看似不起眼的工程细节上。马斯克 9 月 11 日的原话是:“我们也许(在 RL 中)对回复长度惩罚得太重了(或类似原因)”——其后果,是模型“过早放弃困难任务”,并且“不严谨地检查自己的工作”。

对从事大模型强化学习的团队而言,这几乎是对“奖励作弊(reward hacking)”现象的白描:在以可验证奖励为主的训练中,模型行为由奖励函数塑形。当“回复过长”被持续扣分,而“解出难题”恰恰需要更长的思考链与更多的自我验证步骤时,对模型来说最优策略不是攻克难题,而是绕开它——交出一份更短、看起来更“自信”、但质量更差的答案,并省掉自查环节。模型没有变笨,是它精准地找到了奖励函数的漏洞。

(二)修复周期与口径分歧

这类失误的修复周期天然不可压缩:重新校准奖励函数后,需要重跑整轮 RL、重构评估集并再次验证泛化表现——这不是打补丁,而是重做一遍后训练。这也解释了为什么 4.7 的跳票以“天”为单位滚动,而不是一次性推迟到位。

关于 4.7 的现状,各源口径存在一处微妙分歧:部分媒体以“搁置(shelved)”描述,但据 Progressive Robot 对马斯克原帖的逐条核对,4.7 仍在其发布序列之中、被定位为“即将推出”,只是时间表已经失去锚点。无论采用哪种口径,两个硬事实没有争议:其一,4.7 至今没有模型 ID 上线;其二,其公开定位已从“全梯度最优”下调为“大致与 Opus 5.0 相当、某些方面更好、某些方面更差”,且多模态表现仍待修复。

(三)对标锚点漂移:Opus 5.1 尚未发布

另有一个值得单独提示的细节:据 Progressive Robot 指出,Opus 5.1 实际上尚未发布。换言之,马斯克为 Grok 4.7 设定的“天花板”对标物——那个“够不到的 5.1”——本身还是一款期货。把对标锚点漂移到尚未上市的产品上,这在前沿实验室的预期管理话术里并不多见。

三、Grok 4.8 的两张牌:2.5T 参数与 C++ 软件栈

(一)参数谱系:规模增速正在收敛

马斯克此番只给出“2.5T 模型”一个数字,未说明是总参数还是激活参数,也未确认是否延续 MoE(Mixture of Experts,混合专家)架构。回看 xAI 的参数轨迹:初代 Grok-1 为 314B 的 MoE 模型(激活参数约 25%);按 Progressive Robot 梳理的谱系,Grok 4.6 为 1.5T,Grok 4.7 为 2.1T,Grok 4.8 为 2.5T——环比增幅从约 40% 收敛到约 19%(见图 2、表 2)。

图 2 Grok 系列参数规模谱系(资料来源:Progressive Robot,2026-09-14;马斯克 X 帖文)

表 2 Grok 系列参数谱系与发布状态

型号

参数规模

相对上一代

状态与备注

Grok-1

314B

初代 MoE 架构,激活参数约 25%

Grok 4.6

1.5T

已发布(据 Progressive Robot 谱系梳理)

Grok 4.7

2.1T

约 +40%

原定 9 月 12 日发布,跳票至今未上线

Grok 4.8

2.5T

约 +19%

本周收训进入 RL;总参数或激活参数未披露

这组数字透露出两点:其一,如果 2.5T 为总参数,那么以 Grok 系列的 MoE 传统推断,激活规模仍可能在数千亿量级,真正的筹码不在“大”,而在结构与训练效率;其二,参数增速的放缓说明 xAI 清楚地意识到单纯堆参数的边际收益正在递减,这一代产品的胜负手被刻意押在了 RL 与基础设施两条线上。

(二)自研 C++ 软件栈:产业逻辑与三点保留意见

参数之外,“全新 C++ 软件栈”是这份预告中含金量最高、也最容易被标题淹没的信息。按既有披露拼接:该栈于 5 月 28 日首次预告,目标是在大规模训练任务上相对 JAX 取得“一个数量级以上”的速度优势;设计思路是“精确映射”到 xAI 的 22 万块 NVIDIA GB300 GPU(配 800G 网卡),以重流水线并行方式贴近裸金属运行;马斯克的表述曾在“C”“C/C++”与“C++”之间多次漂移,而最终目标是“删掉大部分软件层”。

其产业逻辑并不复杂:当集群规模到达 20 万卡级别,每一层 Python 抽象、每一次框架调度开销都会被放大成真金白银的 GPU 时——模型算力利用率(Model FLOPs Utilization,MFU)每提升几个百分点,等价于省出数周的训练墙钟时间,在算力租赁与折旧的财务模型中即为数亿美元量级的差别。自研栈的收益也不限于预训练,未来还将外溢到推理侧的部署成本与时延。

但三点保留意见必须写明。第一,“快一个数量级”目前只是马斯克单方口径,“快”的度量对象(吞吐、端到端墙钟时间还是 MFU)没有定义;第二,脱离 PyTorch 生态意味着算子、调试工具链与人才储备的重建成本,这也解释了该栈表述反复修正的原因——“删掉大部分软件层”是激进目标,工程成熟度存疑;第三,C++ 栈与模型质量之间没有必然因果,它决定的是“单位算力产出”,而不是“单位算力的上限”。

(三)排期推演:RL 成为新的瓶颈

一个容易被忽略的时间锚点是:据 Progressive Robot 统计,Grok 4.7 在马斯克宣布其初始训练完成之后,至今 34 天仍未发布。以此类推,即便 Grok 4.8 本周准时收训并进入 RL,其上市时间也更可能落在 10 月下旬,而非坊间期待的 9 月底。预训练的收尾从来不是 xAI 的排期风险所在,RL 阶段的时长与质量才是——4.7 已经用一次跳票证明了这一点。

四、三级火箭与 AGI 叙事:定义权在谁手里

马斯克给出的能力梯队是完整的三级(见表 3):Grok 4.8 相对 4.7 是“可感知的提升”;Grok 4.9“大概是 Astra/Fable 级别”,以当下前沿最高梯队作为参照锚;而 Grok 5“也许比任何东西都强”。当被追问 Grok 4.8 距 AGI 有多远时,他的回答只有一句:“那将是 Grok 5。”

表 3 马斯克口中的 Grok 能力梯队与公开状态

梯队

马斯克原话定位

公开状态

Grok 4.8

“可感知的提升”(相对 4.7)

本周收训、进入 RL;无模型卡与定价

Grok 4.9

“大概是 Astra/Fable 级别”

仅口头提及,无时间表

Grok 5

“也许比任何东西都强”;AGI 判断归属

无日期、无基准,属叙事锚点

从行业研究的角度看,这段话的结构比内容更重要:AGI 被绑定在一个尚未发布、没有基准、甚至还没有开始 RL 阶段的模型上。这意味着“xAI 距离 AGI 还有一步”成为一个既不可证实、也不可证伪的叙事锚点——它无法被任何短期评测击穿,因为参照物永远在下一代。而 4.7 的先例刚刚演示了预期如何滚动修正:8 月的“超越所有现有模型”,到 9 月变成“大致 Opus 5.0,而不是 5.1”。在模型卡与独立评测出现之前,对 Grok 4.8 / 4.9 / 5 的任何能力讨论都只能视为叙事,而非证据。

五、治理支线:马斯克向“限速”话语靠拢,白宫却在踩油门

这轮披露中还有一条被多数报道忽略的支线。9 月 12 日,马斯克公开赞同 Anthropic 首席执行官 Dario Amodei 的《We Must Pace the Frontier》一文,称“Dario 说得对”;9 月 13 日他进一步表示,Amodei 关于监督机制的说法是对的,“由竞争者对 AI 进行同行评审,是这件事的正确起点”。而就在 9 月 14 日前后,特朗普方面公开拒绝为 AI 设置新的“护栏”,戏称 Amodei 是“完美的小天使”,并放话“谁赢得 AI,谁就赢得一切(WHOEVER WINS AI, WINS!)”。

三组表态放在一起,图景相当清晰:一边是 xAI 有史以来最激进的 AGI 时间表,一边是其掌门人对“限速”与“竞争者互查”的罕见口头认同——话语与行动出现分叉。而白宫明确拒绝护栏,意味着短期内不会出现强制性约束,前沿竞赛的烈度大概率只升不降。Anthropic 主张的“竞争者同行评审”目前停留在话语层面,尚未有任何一方给出可操作的机制设计。对政策研究者而言,这是比参数量更值得跟踪的变量。

六、研判与观察清单

综合以上分析,本稿件给出四个后续跟踪的观察点,每一项都对应一次可证伪的检验:

1. Grok 4.8 能否本周准时进入 RL。这是检验“C++ 软件栈提速”叙事的第一个硬指标——若连排期都无法兑现,“数量级加速”便无从谈起。

2. RL 阶段会否重演 4.7 的奖励设计失误。RL 已取代预训练成为 xAI 排期表上最大的不确定项;4.8 的 RL 轮次质量将直接决定“10 月下旬上市”的推演是否成立。

3. 发布时有无模型卡、独立基准与 API 定价。xAI 能否跳出“只有叙事、没有数据”的发布循环,是判断其从营销驱动转向工程驱动成熟度的标尺。

4. 4.7 以何种形态、何时上线,及其真实水平与“Opus 5.0”说法的差距。它是检验马斯克预期管理话术准确度的第一个可复核样本。此外可留意 Progressive Robot 提到的署名变化——xAI 目前以“SpaceXAI”名义对外发布信息,若属实,将成为组织架构层面的重要信号。

七、结论

这轮披露的真正价值,不在“2.5T”或“AGI”这些吸睛字眼,而在于它罕见地暴露了一家前沿实验室的内部工作状态:预训练可以被钱和卡堆到终点,RL 的奖励设计却只能靠迭代试错。Grok 4.7 的跳票证明了后者的脆弱性,Grok 4.8 的 C++ 软件栈则是把预训练效率再拧一圈的尝试。

至于 Grok 5 与 AGI 的绑定,在模型卡、基准与定价出现之前,更适合被当作一份叙事文本、而非技术路线图来阅读——毕竟在过去一个月里,市场已经看到同一个叙事如何从“超越所有现有模型”修正为“大致 Opus 5.0”。对研究者而言,真正值得持续验证的判断是:RL 奖励工程正在取代算力规模,成为前沿实验室之间新的分化变量。

责编: 爱集微
来源:爱集微 #Grok 4.8# #跳票# #强化学习奖励设计# #C++ 软件栈# #AGI 叙事#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...