结论先说:SpaceXAI(xAI)已于 2026 年 9 月 21 日正式发布 Grok 4.7,参数从 Grok 4.6 的 1.5 万亿涨到 2.1 万亿(+40%),但 API 价格一分未涨——输入 2 美元 / 百万 token、输出 6 美元 / 百万 token,与 4.6 完全同价同速。官方定位是「编码与知识工作最强模型」,CursorBench 4.0 得分 46.3%(前代 40.4%),Terminal-Bench 4.0 从 20.3% 翻倍到 38.0%。但要清醒:它在多数基准上仍落后 Claude Fable 5.1,马斯克本人也承认「大致对标 Opus 5.0,不是 5.1」。xAI 押的不是最强,是「够用、便宜、到处都有」。
「速度翻倍、价格减半」到底指什么
官方口号容易误读,这里说清楚:Grok 4.7 相对 Grok 4.6 是「同价同速」——都是 $2/$6,速度也持平;「半价」指的是相对同级前沿竞品。把四家的定价摆在一起就很直观:
| 模型 | 输入(美元/百万 token) | 输出(美元/百万 token) | 档位 |
|---|---|---|---|
| Grok 4.7 | 2 | 6 | xhigh |
| Grok 4.6 | 2 | 6 | high |
| GPT-5.6 Sol | 4 | 20 | max |
| Claude Fable 5.1 | 10 | 50 | max |
也就是说,Fable 5.1 的输出单价是 Grok 4.7 的 8 倍多。此外还有一条加速变体:输出生成速度翻倍,价格也翻倍,面向延迟敏感的生产环境。在 CursorBench 4.0 上,Grok 4.7 完成一个任务的平均成本约 11.95 美元,官方称其在价格—性能前沿上处于领先位置。
完整成绩单:赢了前代,没赢对手
这是本次发布最值得细看的一张表。Grok 4.7 对 Grok 4.6 是全面上涨,对 GPT-5.6 Sol 是多数领先,对 Fable 5.1 则是输多赢少:
| 基准 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0(长时编程) | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1(高投入) | 71.0%* | 65.2% | 72.7% | 70.0% |
| Terminal-Bench 4.0(多小时终端) | 38.0% | 20.3% | 37.3% | 57.9% |
| AA Briefcase v1.1(多小时办公) | 1657 | 1546 | 1487 | 1678 |
| GDPval(Elo) | 1695 | 1605 | 1542(GPT-6 Astra) | 1735 |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| EEBench(电气工程) | 64.0% | 53.0% | 39.4% | 56.4% |
| HealthBench Professional(临床) | 56.7% | 48.5% | 60.5% | 62.1% |
* DeepSWE v1.1 为 high effort 设定下的成绩。
几个真实信号值得单独点出来:
- Terminal-Bench 4.0 从 20.3% 涨到 38.0%,近乎翻倍,是本次提升最猛的一项,也最能说明「在困难任务上坚持更久」这个改动生效了。
- EEBench 64.0% 和 Harvey Legal 19.6% 是断层第一,分别领先第二名 7.6 和 12.9 个百分点——这大概率是 SpaceX 工程数据的功劳。
- HealthBench Professional 56.7% 仍落后 GPT-5.6 Sol(60.5%)与 Fable 5.1(62.1%),医疗临床不是它的强项。
- Terminal-Bench 被 Fable 5.1 的 57.9% 甩开近 20 个百分点,长时终端自主作业仍是最明显的短板。
改了什么:更大的底座 + 更长的 RL + 更会自查
官方给出的模型改进有三条:
- 更大的基础模型:参数从 1.5 万亿增至 2.1 万亿,增幅 40%。
- 更长、更难的强化学习:RL 训练跑得更久,任务分布向「需要数小时才能完成」的难题倾斜,同时强化了长上下文管理与原生自检能力。
- 原生理解 Grok Bot harness:让模型直接适配自家 Agent 框架,改善对话式任务与通用知识工作;官方特别提到文档与演示文稿生成能力变强。
独家弹药:SpaceX 的工程数据
这是别家拿不到的一块。Grok 4.7 的补充训练数据包含 SpaceX 多年积累的工程资料——星链卫星遥测数据、制造记录、工程故障日志。xAI 的说法是,这些数据让模型在理解和推理硬件系统与真实物理世界问题时更有底气,而不只是背互联网上的文字。EEBench 断层第一(64.0% vs Fable 5.1 的 56.4%)可以视作这条数据护城河的第一个实证。
一次「离谱」的跳票
Grok 4.7 原定 9 月 12 日发布,最终晚了 9 天。原因不是算力也不是数据,而是强化学习阶段的训练缺陷:对回答长度的惩罚设置过重,导致模型遇到难题时过早放弃——题目太难就提前交卷。团队修好这个毛病后才正式上线。马斯克自 7 月下旬起至少五次调整发布时间(四周、几周、三到四周、9 月 1 日说十天、9 月 11 日说还有几天),期间还被曝亲自守在超算中心盯进度。
这个插曲其实比参数更有信息量:长时任务的「坚持度」是当前 Agent 训练里最难调的行为之一,惩罚太重就早退,惩罚太轻就啰嗦。Grok 4.7 的核心卖点恰恰就是这个维度。
安全栈全面重构
Grok 4.7 换了一套全新的安全防护栈,官方称是迄今在拒绝回答与抗越狱上表现最强的模型,并强调在网络安全和生物这两个双用途领域,做到了「良性任务保可用性 + 危险任务安全拒绝」两头兼顾:
- LatchBio 生物安全基准:62.4% 领先,在良性查询可用性与生物危害拒绝之间取得最佳平衡。
- HackerBench v0.3(破坏性网络行动):仅 3.3% 的风险提示被完成,同时保留合法安全工作流不被误伤。
- 部分网络安全合作方已获得受限、邀请制的访问权限,用于评估红队能力以服务防御研究。
怎么用:全渠道即时开放,无等待名单
Grok 4.7 已在以下渠道同步上线:Grok App、Cursor、Grok Build、xAI API、第三方模型路由与托管云环境,以及终端安装器。此外还覆盖 X 平台与特斯拉车机仪表盘。目前短期没有开源计划。
马斯克对后续路线的说法是:Grok 4.7 大致对标 Claude Opus 5.0(不是 5.1),多模态表现仍需打磨;Grok 4.8 是明显的一次跃升,Grok 4.9 达到 Astra / Fable 级别,Grok 5 有可能成为前沿领跑者——均未给出时间表。
该不该换:按任务类型判断
适合切到 Grok 4.7 的:高吞吐的编码 Agent 流水线(成本敏感度远高于单次质量)、电气/硬件类工程推理、法律文档类 Agent 任务(Harvey 19.6% 断层第一)、需要无等待名单即刻接入的团队、已在用 Cursor 或 Grok Build 的开发者。
建议继续观望或用别家的:长时间自主终端作业(Fable 5.1 的 57.9% 领先太多)、医疗临床场景(落后两个对手 4–5 个百分点)、需要最强通用前沿能力的任务、以及依赖多模态的场景(马斯克自己说还需改进)。
FAQ
Grok 4.7 比 Grok 4.6 强多少,值得升级吗?
值得,因为价格没变。参数增加 40%(1.5T → 2.1T),CursorBench 4.0 从 40.4% 到 46.3%,Terminal-Bench 4.0 从 20.3% 翻倍到 38.0%,GDPval Elo 从 1605 到 1695,Harvey 法律基准从 15.8% 到 19.6%。API 定价与响应速度均与 4.6 持平,属于同价位的纯增量升级,已在用 4.6 的团队没有不换的理由。
2.1 万亿参数是不是比 Claude Fable 5.1 更强?
不是。参数量不等于能力排名。Fable 5.1 在 CursorBench 4.0(51.8% vs 46.3%)、Terminal-Bench 4.0(57.9% vs 38.0%)、GDPval(1735 vs 1695 Elo)、AA Briefcase(1678 vs 1657)、HealthBench Professional(62.1% vs 56.7%)上均领先。Grok 4.7 的反超领域是 EEBench(64.0% vs 56.4%)和 Harvey 法律基准(19.6% vs 6.7%)。它的真正优势是价格——输出单价 6 美元对 Fable 5.1 的 50 美元。
SpaceX 的工程数据会带来合规或数据泄露风险吗?
目前公开信息只说明训练数据包含星链卫星遥测、制造记录与工程故障日志,SpaceX 与 xAI 同属马斯克体系内,属于第一方数据使用,公开报道未提及第三方数据授权争议。真正在意的团队应关注另两点:一是模型仍为闭源、短期无开源计划,输入数据走 API 意味着需按 xAI 的数据处理条款评估;二是官方强调的生物与网络安全拒绝机制在提升安全性的同时,也可能对合法的安全研究、生物医学查询产生误拒,上线前建议用自己的真实查询集做一轮拒绝率测试。
小结
Grok 4.7 是一次典型的 xAI 式发布:参数涨 40%、价格不动、全渠道零等待名单,把「性价比」这张牌打到极致。它在 Terminal-Bench 上的翻倍、在 EEBench 与 Harvey 法律基准上的断层第一,证明「在难题上坚持更久 + SpaceX 工程数据」这两条改动确实有效。但 CursorBench 落后 Fable 5.1 五个百分点、Terminal-Bench 落后近二十个百分点的事实也提醒我们:它买的是便宜和可得,不是最强。从 7 月的 Grok 4.5、8 月的 4.6 到 9 月的 4.7,不足三个月连发三代,这种节奏正在把大模型竞赛的评分标准从「谁最强」改写为「谁更快、更便宜、更能干活」。
信息来源:SpaceXAI 官方发布页 x.ai/news/grok-4-7、World Programming《SpaceXAI Grok 4.7 targets coding at reduced token cost》、KuCoin News 快讯、explainx.ai,以及马斯克在 X 上关于 4.7 / 4.8 / 4.9 路线的公开表述。
