Grok 4.8 本周完成训练:2.5 万亿参数配全新 C++ 软件栈,xAI 旗舰进入冲刺期

结论先行:xAI 的下一代旗舰 Grok 4.8 已经跑到训练收尾阶段,参数规模定在 2.5 万亿,并且是踩在一套全新编写的 C++ 软件栈上训出来的。9 月 14 日,xAI 首席执行官埃隆·马斯克在 X 平台给出明确节点:Grok 4.8 将在本周完成训练,随即启动强化学习阶段。这条消息真正值得琢磨的,不是”又出了一款大模型”,而是两个工程信号——参数量跳到 2.5 万亿量级,以及训练栈被整体重写。前者决定能力天花板,后者决定这个天花板能不能被稳定摸到。

一、2.5 万亿参数,站在当前第一梯队的什么位置

把 2.5 万亿放进坐标系里看更清楚。已开源的万亿级模型中,Kimi K3 以 2.8 万亿参数创下全球最大开源模型纪录;xAI 自家上一代 Grok 4.6 于 8 月中旬发布,官方口径是对标 GPT-5.6 Sol 的分数、以两折价格提供 Fable 5 级别性能。从 4.6 到 4.8,参数规模被推到 2.5 万亿,意味着这次不是小步迭代,而是把底座整体抬了一档。

参数量的意义需要说清楚:它决定的是”能装下多少知识、能撑起多长的推理链”,而不是直接等于”更聪明”。真正把参数兑现成能力,要靠训练数据质量、强化学习策略和工程栈的效率。这也是为什么 Grok 4.8 要放在”完成训练后立即进入强化学习”的语境里讨论——预训练只给了它记忆与直觉,后训练才决定它会不会严谨地解题。

二、为什么值得专门重写一套 C++ 软件栈

马斯克特意点出 Grok 4.8 是用”全新的 C++ 软件栈”训练的,这在工程上是个不小的动作。主流大模型训练栈长期以 Python 作为编排层、C++/CUDA 作为算子层,越往上走,框架开销与调度损耗越明显。当模型规模到 2.5 万亿这个量级,问题会被放大:

  • 通信开销:万亿参数必须切分到成千上万张卡上,张量并行与流水线并行的调度效率直接决定有效算力利用率。
  • 内存墙:参数、梯度、优化器状态三份显存占用,规模上去后光是状态管理就足以吃掉大量带宽。
  • 故障恢复:训练周期以周计,任何一次节点失败都需要快速检查点回滚,框架层的稳定性比峰值性能更关键。

把训练栈用 C++ 重构,本质上是在买”可控性”——用更贴近硬件的控制换取更高的利用率与更可预测的行为。代价同样明显:开发周期长、调试成本高、生态工具要重新适配。xAI 愿意付这个代价,说明他们判断 2.5 万亿这一档已经到了通用框架”不重写就跑不动”的临界点。

三、Grok 4.7 为什么跳票:回复长度惩罚的副作用

时间线上有个插曲值得记一笔。马斯克此前放话 Grok 4.7 会在 9 月 12 日发布,随后改口称可能还要再过几天。他给出的延期原因很具体:强化学习阶段的回复长度惩罚压得太重,模型会过早放弃困难任务,也学不会严谨地回查自己的工作。

这是个相当典型的后训练调参事故。为了让模型输出更简洁、成本更可控,训练中往往会对长回复施加惩罚。但惩罚一旦过重,模型学到的策略就变成”遇到难题就尽快收尾”——因为继续推理的期望收益是负的。而难题恰恰是最需要长链推理的场景。更麻烦的是第二层影响:模型不再愿意回头检查自己的中间步骤,自我验证能力被一起削弱。

这也解释了为什么官方把 Grok 4.8 的节点表述为”完成训练 + 随即启动强化学习”。预训练结束只是入场券,真正决定 4.8 会不会重蹈 4.7 覆辙的,是这一轮强化学习能不能把”坚持难题”和”保持简洁”之间的天平调对。

四、三代 Grok 关键信息对照

版本 参数规模 训练栈 状态与关键节点
Grok 4.6 未公开具体数值 既有训练栈 8 月中旬发布,对标 GPT-5.6 Sol 分数、Fable 5 级性能两折价
Grok 4.7 未公开 既有训练栈 原定 9 月 12 日发布后延期,原因指向强化学习阶段的回复长度惩罚过重
Grok 4.8 2.5 万亿 全新 C++ 软件栈 本周完成训练,随即进入强化学习阶段,发布时间待定

需要说明的是,表格中 4.6 的对比口径来自公开发布时的官方表述,4.8 的参数量与训练栈信息来自马斯克本人在 X 平台的披露,尚未有对应的技术报告佐证。

五、对开发者来说,该关注什么

第一,不要按”下周就能调用”来排期。官方只给了训练完成节点,后面还有强化学习、安全评估、灰度上线等步骤,Grok 4.7 的延期已经说明这个环节存在不确定性。

第二,2.5 万亿参数的推理成本不会便宜。参数规模上去了,服务价格与响应速度通常会同步承压,做预算规划时要留出冗余。

第三,值得观察的是”难题不放弃”这个指标。如果 4.8 真的修好了长度惩罚问题,它在长链推理、复杂代码和数学任务上的表现会比单纯的跑分提升更有说服力。

FAQ

Grok 4.8 什么时候正式发布?

官方目前只给出”本周完成训练、随即启动强化学习”的节点,没有公布确切发布日期。参照 Grok 4.7 原定 9 月 12 日发布却延期的先例,强化学习阶段仍是主要不确定因素。

2.5 万亿参数是不是越大越好?

不一定。参数量决定知识与推理链的上限,但能否兑现取决于数据质量、后训练策略与工程栈效率。Grok 4.7 的延期恰恰说明,规模之外,强化学习阶段的奖励设计同样会显著改变模型行为。

为什么要用 C++ 重写训练栈?

在万亿参数规模下,框架层的调度开销、显存状态管理与故障恢复成本会被显著放大。用 C++ 重写可以换取更高的硬件利用率和更可预测的行为,代价是开发周期和调试成本上升。

小结

Grok 4.8 的两个关键数字——2.5 万亿参数与全新 C++ 训练栈——分别指向能力野心与工程决心。真正决定它成败的是接下来的强化学习:如果 xAI 能把 4.7 身上”过早放弃难题”的问题修好,这次规模跃升才会转化为可感知的能力跃升;如果修不好,再大的参数量也只会在简单任务上显得流畅。