谷歌终于拿出了一款让业界真正侧目的旗舰模型。2026年9月30日,谷歌正式发布Gemini 4 Argon,将单次输出上限从上一代的64000 Token直接拉升至100万Token,同时在18项公开基准中拿下13项第一。这不仅是数字的跃升,更是产品定位的一次转向——Argon剑指软件工程、法律金融分析与网络防御三大长链路场景,而非与竞品比拼单轮问答。
一句话结论
Gemini 4 Argon是谷歌迄今为止最强大的模型,百万Token输出能力让单次完成整库迁移、完整法律文书或大型代码重构成为可能;定价仅为GPT-6 Astra的五分之一,对高频长输出场景具有颠覆性性价比,但目前仅向网络防御圈内的Fairwind计划参与者开放,普通人仍需等待。
核心升级:从64000到100万,输出天花板的跨越
Gemini 4 Argon最直观的改变是输出上限。上一代Gemini 3系列最高支持64000 Token输出,而Argon将这一数字提升至100万Token——相当于在一次API调用中生成一整部长篇小说、一份完整代码库迁移方案,或一套多章节法律尽职调查报告。谷歌表示,当模型有足够空间”一次性想透”一个问题并完整输出时,解决复杂多步任务的概率显著高于中途截断再续接。
对比竞品:GPT-6 Astra输出上限约128000 Token,Claude Opus 5.5同样在10万 Token量级。Argon的100万 Token上限在纸面上处于绝对领先地位,但实际价值取决于用例——并非每个场景都需要单次输出如此大量的内容。
基准测试:13项领先,但并非全面碾压
谷歌公布了Argon与GPT-6 Astra、Claude Opus 5.5的18项对比结果。Argon在以下场景表现尤为突出:
- DeepSWE v1.1(软件工程):77.9%,领先Claude Opus 5.5(74.2%)和GPT-6 Astra(74.1%)
- AutomationBench(知识工作):51.3%,领先幅度约9个百分点
- Harvey法律智能体测试:19.6%,是GPT-6 Astra(5.4%)的近四倍
- LVBench长视频理解:91.7%,领先GPT-6 Astra(87.5%)和Claude Opus 5.5(83.7%)
- GraphWalks长上下文推理:84.2%,较GPT-6 Astra提升12个百分点
- LAB-Bench 2:88.8%
- CWE-bench v1(代码漏洞检测):68.0%
Argon并非全胜。在FrontierSWE v2(编码)中以55.0%输给GPT-6 Astra的65.5%;在Terminal-Bench 4.0中以57.4%落后于Claude Opus 5.5的66.4%;在Terminal-Bench Science 0.1中以57.6%落后GPT-6 Astra的68.1%。这意味着Argon最强的是”长链路知识工作”与”视觉理解长视频”,而非”短平快的终端操作”——后者仍是GPT-6 Astra和Claude Opus 5.5的主场。
定价:五折入场,防御优先
Argon的定价策略颇为激进。引入期价格为每百万输入Token 2美元、每百万输出Token 10美元;引入期结束后调整为每百万输入4美元、每百万输出20美元。相比之下,GPT-6 Astra据报为每百万输入10美元、输出50美元——Argon在引入期的输出定价仅为GPT-6 Astra的五分之一,而与Claude Opus 5.5的正式定价($4/$20)相当。
值得注意的是,Argon的缓存输入Token定价仅为每百万0.10美元,较标准输入价格低95%。这对需要反复引用同一大文档的开发者而言是实质性优惠。按实际工作流计算,若每次请求附带100万 Token长文档并复用50%缓存内容,成本可下降约一半。
这一价格策略被业内视为针对Anthropic和OpenAI的正面攻势。在Claude Opus 5.5和GPT-6 Astra已将每Token成本压低的背景下,Argon的低价入市意在快速扩大开发者基数,尤其在需要长输出的企业级用例中建立竞争优势。
受限发布:为什么只有网络防御圈能用
Argon的发布模式是本次最不寻常之处。谷歌并未向所有API用户开放,而是通过Fairwind计划首批向经过审核的网络安全团队提供访问,且早期用户获得的模型版本不包含部分网络专用防护栏。谷歌解释,这是因为Argon经过专项训练,能够自主发现、验证并修补软件漏洞——这种能力在全面开放前需要受控验证,防止被滥用。
内部测试显示,Argon在谷歌自有漏洞测试集上成功率达85.8%,在Wiz渗透测试基准上得分70.9%,均优于前代Gemini 3.8 Flash Cyber(71.0%和58.2%)。不过这些结果仅与谷歌内部基线对比,尚缺乏外部独立验证。
谷歌旗下安全公司Wiz已基于Argon开展漏洞扫描试点。正式开放顺序为:付费API客户与AI Ultra订阅者优先,然后逐步向开发者和企业用户扩展,具体时间表尚未公布。
Gemini 4 Argon与竞品横向对比
| 指标 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| 最大输出Token | 1,000,000 | ~128,000 | ~100,000 |
| DeepSWE v1.1 | 77.9% | 74.1% | 74.2% |
| AutomationBench | 51.3% | 41.4% | 42.5% |
| Harvey法律智能体 | 19.6% | 5.4% | 3.8% |
| LVBench长视频 | 91.7% | 87.5% | 83.7% |
| 输入定价(引入期) | $2/M | $10/M | $4/M |
| 输出定价(引入期) | $10/M | $50/M | $20/M |
| 当前可用性 | Fairwind计划 | API/订阅 | API/订阅 |
FAQ
Gemini 4 Argon适合哪些场景?
Argon最适合需要一次性处理大量信息并输出完整结果的长链路任务:大型代码库迁移与重构、完整法律文书或财务报告生成、多文档长视频分析,以及网络漏洞自动发现与修补。对短对话或单步问答,Argon的优势不明显,且当前获取门槛较高。法律与金融领域的知识工作者尤其值得密切关注——Harvey法律智能体测试中19.6%的得分意味着它已在该领域建立起显著优势。
百万Token输出是输入上下文还是输出上限?
这是输出上限,不是输入上下文窗口。谷歌尚未公布Argon的具体输入上下文限制。GraphWalks基准测试的范围是256K至1M Token,说明Argon在长输入理解上确实有长上下文能力,但生产环境的具体数字需等官方文档确认。开发者在做架构设计时应以官方公布的上限为准,而非基准测试范围。
普通开发者现在能用到Gemini 4 Argon吗?
暂时不能。首批仅向Fairwind计划内的网络安全团队开放,包含不完整的网络专用防护栏。付费API用户和AI Ultra订阅者将是下一批,之后才会向更广泛的开发者和企业用户开放。考虑到安全评估周期,保守估计普通开发者获取正式版访问需等待数周至数月。建议关注谷歌Gemini开发者文档以获取最新可用性更新。
相关阅读
- 谷歌Gemini Skills全面免费:Gems 11月17日停用,斜杠指令接棒
- GPT-6 Astra接宇树G1进厨房干活:一个周末让机器人记住抽屉在哪
- OpenAI首次公开点名:Kimi相关账户窃取16000次模型推理背后
延伸阅读
- 谷歌升级家庭AI助手CC:支持最多6名家庭成员协同,独立账户+Antigravity智能体驱动2 周前
- Google Gemini 3.8 Flash 发布:距上次不到三周,编程能力成重点4 周前
- DreamRSI:Google用历史做梦降低探索调用,最高降162倍2 周前
- 英伟达 129 亿美元收购 Hugging Face,开源 AI 的心脏换了个主人1 月前
