谷歌发布Gemini 4 Argon:百万Token输出、13项基准领先,定价对折GPT-6 Astra

谷歌终于拿出了一款让业界真正侧目的旗舰模型。2026年9月30日,谷歌正式发布Gemini 4 Argon,将单次输出上限从上一代的64000 Token直接拉升至100万Token,同时在18项公开基准中拿下13项第一。这不仅是数字的跃升,更是产品定位的一次转向——Argon剑指软件工程、法律金融分析与网络防御三大长链路场景,而非与竞品比拼单轮问答。

一句话结论

Gemini 4 Argon是谷歌迄今为止最强大的模型,百万Token输出能力让单次完成整库迁移、完整法律文书或大型代码重构成为可能;定价仅为GPT-6 Astra的五分之一,对高频长输出场景具有颠覆性性价比,但目前仅向网络防御圈内的Fairwind计划参与者开放,普通人仍需等待。

核心升级:从64000到100万,输出天花板的跨越

Gemini 4 Argon最直观的改变是输出上限。上一代Gemini 3系列最高支持64000 Token输出,而Argon将这一数字提升至100万Token——相当于在一次API调用中生成一整部长篇小说、一份完整代码库迁移方案,或一套多章节法律尽职调查报告。谷歌表示,当模型有足够空间”一次性想透”一个问题并完整输出时,解决复杂多步任务的概率显著高于中途截断再续接。

对比竞品:GPT-6 Astra输出上限约128000 Token,Claude Opus 5.5同样在10万 Token量级。Argon的100万 Token上限在纸面上处于绝对领先地位,但实际价值取决于用例——并非每个场景都需要单次输出如此大量的内容。

基准测试:13项领先,但并非全面碾压

谷歌公布了Argon与GPT-6 Astra、Claude Opus 5.5的18项对比结果。Argon在以下场景表现尤为突出:

  • DeepSWE v1.1(软件工程):77.9%,领先Claude Opus 5.5(74.2%)和GPT-6 Astra(74.1%)
  • AutomationBench(知识工作):51.3%,领先幅度约9个百分点
  • Harvey法律智能体测试:19.6%,是GPT-6 Astra(5.4%)的近四倍
  • LVBench长视频理解:91.7%,领先GPT-6 Astra(87.5%)和Claude Opus 5.5(83.7%)
  • GraphWalks长上下文推理:84.2%,较GPT-6 Astra提升12个百分点
  • LAB-Bench 2:88.8%
  • CWE-bench v1(代码漏洞检测):68.0%

Argon并非全胜。在FrontierSWE v2(编码)中以55.0%输给GPT-6 Astra的65.5%;在Terminal-Bench 4.0中以57.4%落后于Claude Opus 5.5的66.4%;在Terminal-Bench Science 0.1中以57.6%落后GPT-6 Astra的68.1%。这意味着Argon最强的是”长链路知识工作”与”视觉理解长视频”,而非”短平快的终端操作”——后者仍是GPT-6 Astra和Claude Opus 5.5的主场。

定价:五折入场,防御优先

Argon的定价策略颇为激进。引入期价格为每百万输入Token 2美元、每百万输出Token 10美元;引入期结束后调整为每百万输入4美元、每百万输出20美元。相比之下,GPT-6 Astra据报为每百万输入10美元、输出50美元——Argon在引入期的输出定价仅为GPT-6 Astra的五分之一,而与Claude Opus 5.5的正式定价($4/$20)相当。

值得注意的是,Argon的缓存输入Token定价仅为每百万0.10美元,较标准输入价格低95%。这对需要反复引用同一大文档的开发者而言是实质性优惠。按实际工作流计算,若每次请求附带100万 Token长文档并复用50%缓存内容,成本可下降约一半。

这一价格策略被业内视为针对Anthropic和OpenAI的正面攻势。在Claude Opus 5.5和GPT-6 Astra已将每Token成本压低的背景下,Argon的低价入市意在快速扩大开发者基数,尤其在需要长输出的企业级用例中建立竞争优势。

受限发布:为什么只有网络防御圈能用

Argon的发布模式是本次最不寻常之处。谷歌并未向所有API用户开放,而是通过Fairwind计划首批向经过审核的网络安全团队提供访问,且早期用户获得的模型版本不包含部分网络专用防护栏。谷歌解释,这是因为Argon经过专项训练,能够自主发现、验证并修补软件漏洞——这种能力在全面开放前需要受控验证,防止被滥用。

内部测试显示,Argon在谷歌自有漏洞测试集上成功率达85.8%,在Wiz渗透测试基准上得分70.9%,均优于前代Gemini 3.8 Flash Cyber(71.0%和58.2%)。不过这些结果仅与谷歌内部基线对比,尚缺乏外部独立验证。

谷歌旗下安全公司Wiz已基于Argon开展漏洞扫描试点。正式开放顺序为:付费API客户与AI Ultra订阅者优先,然后逐步向开发者和企业用户扩展,具体时间表尚未公布。

Gemini 4 Argon与竞品横向对比

指标 Gemini 4 Argon GPT-6 Astra Claude Opus 5.5
最大输出Token 1,000,000 ~128,000 ~100,000
DeepSWE v1.1 77.9% 74.1% 74.2%
AutomationBench 51.3% 41.4% 42.5%
Harvey法律智能体 19.6% 5.4% 3.8%
LVBench长视频 91.7% 87.5% 83.7%
输入定价(引入期) $2/M $10/M $4/M
输出定价(引入期) $10/M $50/M $20/M
当前可用性 Fairwind计划 API/订阅 API/订阅

FAQ

Gemini 4 Argon适合哪些场景?

Argon最适合需要一次性处理大量信息并输出完整结果的长链路任务:大型代码库迁移与重构、完整法律文书或财务报告生成、多文档长视频分析,以及网络漏洞自动发现与修补。对短对话或单步问答,Argon的优势不明显,且当前获取门槛较高。法律与金融领域的知识工作者尤其值得密切关注——Harvey法律智能体测试中19.6%的得分意味着它已在该领域建立起显著优势。

百万Token输出是输入上下文还是输出上限?

这是输出上限,不是输入上下文窗口。谷歌尚未公布Argon的具体输入上下文限制。GraphWalks基准测试的范围是256K至1M Token,说明Argon在长输入理解上确实有长上下文能力,但生产环境的具体数字需等官方文档确认。开发者在做架构设计时应以官方公布的上限为准,而非基准测试范围。

普通开发者现在能用到Gemini 4 Argon吗?

暂时不能。首批仅向Fairwind计划内的网络安全团队开放,包含不完整的网络专用防护栏。付费API用户和AI Ultra订阅者将是下一批,之后才会向更广泛的开发者和企业用户开放。考虑到安全评估周期,保守估计普通开发者获取正式版访问需等待数周至数月。建议关注谷歌Gemini开发者文档以获取最新可用性更新。

相关阅读