一句话结论:Reflection AI 发布 5010 亿参数稀疏 MoE 模型 Beam,在 SWE-Bench Verified 取得 80.9 分、Terminal Bench v2.1 取得 80.1 分,自称推理效率是 GLM-5.2 的 3–4 倍,但所有数据尚未经独立验证,权重将于本月晚些时候以 Apache 2.0 许可证公开发布,目标是让西方企业部署开源模型时有一个「不必选中国方案」的选择。
2026 年 10 月 5 日,纽约 AI 创业公司 Reflection AI 正式发布其首款开源权重模型 Beam。这家成立仅两年的公司由前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou 联合创立,已累计融资约 47 亿美元(投后估值 250 亿美元),投资方包括英伟达、Sequoia Capital 和 Lightspeed Venture Partners。英伟达一家的投资规模便达约 8 亿美元,折射出其对「AI 工厂」商业模式的战略押注。Beam 是 Reflection AI 从「代码研究 Agent」(Asimov)向「开源基础模型」跨越的首次实质性交付,填补了美国开源基础模型领域长期存在的空白。
架构:5010 亿参数稀疏 MoE,推理仅激活 230 亿
Beam 采用稀疏混合专家(MoE)架构,总参数量 5010 亿,但每次推理仅激活 230 亿参数——其余专家在本次计算中被完全跳过,不消耗任何算力。这是继 Mistral、DeepSeek、Qwen 之后,又一个将稀疏 MoE 路线推向 5000 亿参数级别的开源模型。
作为对比,同日被频繁提及的中国竞品 Z.ai GLM-5.2 总参数 7440 亿、激活 400 亿;Moonshot AI Kimi K3 规模相近但尚未公开详细架构。Reflection AI 的核心主张是:在高端推理基准上,Beam 的 230 亿激活参数可以与 400 亿参数的 GLM-5.2 持平,而前者消耗的推理算力约为后者的三分之一。
预训练阶段,Beam 在 6144 块英伟达 GB300 NVL72 GPU 上处理 23.8 万亿 Token,耗时不到 4 周,有效训练比率(goodput)达 92.3%。该公司报告了 9 次半自动回滚(semi-automatic rewinds),原因包括梯度范数突增与疑似静默数据损坏。在约 10500 块 GB300 上执行的高计算强化学习阶段产生了超过 1 亿次 Rollout,涵盖编程、Agent 任务和 STEM 推理场景。
基准成绩:编程与推理接近前沿水平,但未经验证
Reflection AI 发布了 Beam 在其自有评测套件中的成绩,以下为核心数据:
| 基准 | Beam | Inkling | GLM-5.2 | Kimi K3 | Qwen 3.8-Max |
|---|---|---|---|---|---|
| SWE-Bench Verified | 80.9 | 77.6 | — | — | — |
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | 84.3 | 88.2 | — |
| Terminal Bench v2.1 | 80.1 | 63.8 | 81.0 | 88.2 | 86.6 |
| AIME 2026 | 97.8 | 97.1 | 99.2 | — | — |
| GPQA Diamond | 90.5 | 87.2 | 91.2 | 93.5 | 92.6 |
| HLE(无工具) | 36.2 | 29.7 | 40.5 | 42.3 | 43.6 |
值得注意的是:所有数据均来自 Reflection AI 自主发布的评测,尚未经独立第三方验证。SWE-Bench Pro v2-Hard 分数低于 Kimi K3 和 GLM-5.2,与「接近前沿」的叙事存在张力。此外,Beam 是纯文本模型(text-only),而竞品 Inkling 为多模态,在跨模态任务上不可直接比较。
效率主张:3–4 倍推理优势是核心卖点
Beam 的商业逻辑建立在「推理效率」而非「绝对性能」之上。Reflection AI 援引 Artificial Analysis 与 DataCurve 的数据,估算生成式推理的计算量为「2 × 激活参数量 × 平均生成 Token 数」,据此声称 Beam 在多个基准上取得了与 GLM-5.2 相当的成绩,而推理算力消耗约为后者的三分之一至四分之一。
这一主张的战略意义在于:当前全球开源模型竞争的核心已经从「榜单分数」转向「每 Token 成本」。DeepSeek 和 Qwen 已经证明中国实验室可以以极低成本提供接近前沿水平的模型;Reflection 的目标是证明西方实验室同样可以实现这一效率目标,从而让政府和企业客户在部署开源模型时有「西方选项」而非被迫选择中国方案。若这一主张经独立验证成立,将对全球开源模型格局产生深远影响。
英伟达的 AI 工厂赌注与投资逻辑
英伟达在 Reflection AI 的投资规模(约 8 亿美元)远超一般风险投资,折射出英伟达对「AI 工厂」(AI Factory)商业模式的押注。Jensen Huang 自 2025 年起积极推广「主权 AI 云」概念——即各国政府和大型企业自建 GPU 集群,运行本地 AI 模型而非依赖美国云服务商。该模式若成规模,将直接带动英伟达 GPU 的企业级销售,形成「英伟达卖芯片 → Reflection 卖模型 → 客户自建 AI 工厂」的完整价值闭环。
Reflection AI 已与 SpaceX 签署超过 70 亿美元的 GB300 算力协议(截至 2029 年),并与韩国零售集团 Shinsegae 合作建设 250 兆瓦主权 AI 云。这些大客户锁定直接带动了英伟达的 GPU 销售,使 Reflection 成为英伟达「AI 工厂」叙事的标杆案例。一旦 Beam 的效率主张被独立验证,SpaceX、Shinsegae 及其他主权 AI 客户将成为英伟达 GB300 的稳定批量采购方。
开放时间线与当前状态
截至 2026 年 10 月 5 日,Beam 正在接受最终红队测试与评测,尚未向公众开放。Reflection AI 已开放提前访问 waitlist,将于本月晚些时候通过超大规模云服务商(hyperscalers)、新云(neoclouds)和开源库集成渠道发布完整权重、技术报告、模型卡与配套软件栈,许可证为 Apache 2.0。该公司还与 Dell AI Factory 平台完成验证,并已成为美国能源部 Genesis Mission 计划的认证参与方。
小结:真实的竞争还是漂亮的 PPT?
Reflection AI Beam 的发布填补了美国开源基础模型领域的一项空白——在 DeepSeek、Qwen 和 Kimi 持续主导开源榜单的背景下,Beam 代表了西方实验室在稀疏 MoE + 高效推理这一技术路线上的首次正面应战。其效率主张如果经独立验证成立,将对全球开源模型的竞争格局产生实质性影响:一方面让西方政府和企业有理由选择「西方开源」而非「中国开源」;另一方面也证明了高计算强化学习(High-Compute RL)在稀疏 MoE 架构上的规模化可行性,为行业开辟新的技术路线参考。
但如果数据存在注水,Beam 将成为又一份「融资估值远超产品交付」的 AI 行业案例。鉴于 Reflection 此前已有过一次「年内发布」承诺跳票的先例,其时间线执行力本身也值得观察。答案将在权重公开发布后 2–4 周内揭晓。
相关阅读:OpenAI 内部模型 7 月绕过隔离墙(站内 3241);Cloudflare 开源 Clef 决策模型(站内 3179);OpenAI 推出 Decisions API(站内 3246)。
延伸阅读
- 纽约时报揭OpenAI安全黑洞:员工预警遭无视,GPT-6.1 Astra取消发布6 天前
- OpenAI内部模型7月绕过隔离墙:目标偏离已成系统风险1 天前
- MiniMax M3.1-Flash-Preview 灰度上线:5 档推理菜单曝光1 周前
- 微软报告称全球 18.8% 劳动人口用上 AI,南北差距近 1.8 倍7 天前
