谷歌发布Gemini 4 Argon:77.9%登顶SWE-bench,输入$2/M

2026年9月30日,Google官方博客正式发布旗舰模型Gemini 4 Argon。这是继内部测试代号Carbon在10月初曝光后,Google首次以Argon命名公开其下一代前沿模型。Argon由Google DeepMind与Google Research联合开发,SVP Koray Kavukcuoglu亲自署名,定位为前沿智能的新时代,一口气在代码、金融、法律、网络安全四大领域全部刷新最优纪录。输出Token上限从64K跃升至100万,API定价仅$2/百万输入、$10/百万输出,缓存输入打95%折。

一句话结论:Gemini 4 Argon是Google有史以来最强大的前沿模型,以77.9%登顶SWE-bench、百万Token超长上下文、自主漏洞修复三大核心能力,瞄准企业级长程任务和网络安全防御,直接与GPT-6和Claude 5展开竞争。

一、Argon是什么:旗舰定位与命名逻辑

Gemini 4 Argon是Google第四代Gemini系列的旗舰版本。与前代Gemini 3.8 Flash/Pro不同,Argon专为复杂、长时序专业任务设计,核心改进在于:推理深度大幅提升,输出Token上限从Gemini 3系列的64K一口气提升至100万Token(约75万英文单词),模型可以在单次生成中完成数百页的代码迁移、技术报告撰写或法律分析;多智能体协同,Argon可以派生出多个子智能体并行工作,完成大规模代码库重构;安全优先发布,Argon目前以Fairwind Program形式先行开放给可信网络安全防御者,普通开发者需等待guardrails迭代完成后才能全面接入。

值得注意的是,Argon的内部测试代号为Carbon。10月初闪点曾曝光谷歌内部测试Gemini 4 Carbon版本,而Carbon是Argon的内部开发代号——两者实为同一模型的不同阶段:Carbon是受控内测版本,Argon是正式发布命名。

二、代码能力:77.9%登顶SWE-bench,80万行Fuchsia迁移Rust

Argon在代码领域的核心指标是DeepSWE v1.1达到77.9%,创下了该基准的历史最高纪录。DeepSWE v1.1由Google内部构建,衡量模型在真实长时序软件工程任务中的表现,覆盖代码理解、多文件推理、长距离依赖追踪等难题。

Google内部已经有数千名工程师将Argon融入日常工作流,典型应用包括日常调试、代码审查,以及大型代码库迁移。最具标志性的案例是将Fuchsia Zircon内核(超80万行代码)从C/C++迁移至Rust——这是Google史上规模最大的代码安全升级项目之一。Argon智能体在迁移过程中对迁移后的Rust代码进行多轮剖析、编译器输出研究和自动优化。

在libgav1(Google开源视频解码库)的迁移中,Argon智能体在现有Rust移植版本基础上,用32K行SIMD代码替换为安全Rust,通过多轮导向性能实验,自动生成可被编译器向量化优化的Rust代码,最终实现解码性能提升2倍、内存安全性零妥协。

三、企业知识工作:金融/法律/自动化三线压制

Argon的另一核心战场是企业知识工作,Google本次同时发布了三个领域的专业基准结果:

  • Vals Index:衡量模型在美国GDP各行业(金融、编程、法律、税务)中的经济影响力,Argon拿下全面领先。
  • Vals Finance Agent v2:多步财务研究任务,Argon位列第一。
  • Harvey Legal Agent Benchmark:法律研究与合同起草,Argon位列第一。
  • AutomationBench(Zapier基准):端到端业务流程自动化执行,Argon同样处于领先地位。

这些基准的共同特点是:任务需要跨多个应用/文档/数据源进行长程推理,并在最终输出中保证高度准确性。对应的实际场景包括:尽调报告自动生成、合规审查、跨系统财务建模、合同条款比对等。

四、网络安全:发现其他前沿模型全部漏报的医疗漏洞

Argon最独特的能力是自主漏洞发现、验证与修复。Google明确表示,将向可信防御者和内部团队解除网络安全护栏,以释放其在漏洞猎杀方面的全部前沿级能力。

安全公司Wiz已通过Scan for Good计划接入Argon,专门保护全球关键公共基础设施。在一个早期案例中,Argon独立发现了一个暴露全球医院软件敏感个人信息的严重漏洞——此前所有其他前沿模型均未能识别该风险。在CWE-bench v1(软件漏洞修复基准)上,Argon同样展现出领先的漏洞修补能力。

五、Google内部效率:300 TiB内存、量子计算加速40%

Argon已深度嵌入Google内部工作流,产生了大量可量化的工程效益:

  • 内存优化:Argon智能体团队分析Google全球数据中心的全舰队性能遥测数据,自主识别并应用内存优化方案,已释放超过300 TiB内存,预计全部落地后可节省500 TiB至1 PiB。
  • 量子算法优化:帮助量子计算研究团队优化瓶颈子线路的时空资源(量子比特×门数),在几分钟内将某一应用的表现提升40%,超越了已发表的基线水平。
  • 内部推广规模:数千名Google工程师已将Argon作为日常编程助手。

六、定价与可用性

Gemini 4 Argon的API定价为:

Token类型 价格(美元/百万Token)
输入Token $2.00
输出Token $10.00
缓存输入Token $0.10(95%折扣)

输出Token上限:100万(约单次生成15万汉字)。当前发布节奏分三阶段:第一阶段通过Fairwind Program向精选可信网络安全防御者开放(不含网络安全护栏);同步进行美国政府自愿预发布审查流程;第二阶段在guardrails完成迭代后,向开发者、企业和消费者全面开放。

七、安全框架:四维防线与行业呼吁

Google为Argon构建了完整的四维前沿安全体系:

  • 防滥用:针对网络攻击及CBRN(化学、生物、辐射、核)恶意使用进行专项训练,保留合法双用途科学研究的访问能力,并对模型内部激活状态进行监控以发现滥用意图。
  • 防提示注入:对间接提示注入攻击(通过恶意上下文劫持模型行为)具备业界最强防御能力。
  • 防错位:监控模型的思维链与行动轨迹,在检测到超出用户意图范围的行为时中止执行;训练过程中同样部署了这套监控,发现问题即上报专项响应团队。
  • 系统加固:为前沿模型构建配套安全测试环境。

Google特别呼吁业界:在模型能力快速提升的关键阶段,所有公司都应保持推理透明度,以便及时发现和诊断错位风险。

Gemini 4 Argon核心数据一览

维度 数据
发布方 Google DeepMind + Google Research
发布日期 2026年9月30日
DeepSWE v1.1 77.9%(新SOTA)
输出Token上限 100万(前代64K)
API输入定价 $2/M
API输出定价 $10/M
缓存输入折扣 95% off($0.10/M)
代码迁移规模 Fuchsia Zircon 80万行C/C++到Rust
性能提升(libgav1) 2倍(SIMD到安全Rust)
内存优化 已释放300 TiB,总计预计500 TiB-1 PiB
量子计算优化 超出基线40%,分钟级
漏洞发现案例 发现全球医疗软件严重漏洞(前沿模型均漏报)
内部使用规模 数千名Google工程师
当前状态 Fairwind Program限量开放,全面发布待guardrails迭代

FAQ:关于Gemini 4 Argon的三个核心问题

Gemini 4 Argon和之前曝光的Gemini 4 Carbon是什么关系?

Carbon是Argon的内部开发代号,仅在受控内测阶段使用;Argon是正式对外发布的命名。两者为同一模型,Carbon阶段侧重内部验证和红队测试,Argon阶段是面向特定合作方和未来全面开放的正式版本。

Gemini 4 Argon与GPT-6和Claude 5相比有什么优势?

从官方披露的基准来看,Argon在SWE-bench(77.9%)、Vals系列金融/法律基准、漏洞修复(CWE-bench)上均处于领先位置。100万Token的输出上限是目前已知的最大单次生成容量,定价($2/M输入)也处于行业低位。全面对比需要等GPT-6和Claude 5的官方基准完全披露后参照。

普通开发者什么时候能用上Gemini 4 Argon?

目前仅通过Fairwind Program向可信网络安全防御者开放(无网络安全护栏)。Google正在完成guardrails迭代并接受美国政府预发布审查,待这些流程结束后将向开发者、企业和消费者全面开放。具体时间表尚未公布。

相关阅读