2026年9月30日,Google官方博客正式发布旗舰模型Gemini 4 Argon。这是继内部测试代号Carbon在10月初曝光后,Google首次以Argon命名公开其下一代前沿模型。Argon由Google DeepMind与Google Research联合开发,SVP Koray Kavukcuoglu亲自署名,定位为前沿智能的新时代,一口气在代码、金融、法律、网络安全四大领域全部刷新最优纪录。输出Token上限从64K跃升至100万,API定价仅$2/百万输入、$10/百万输出,缓存输入打95%折。
一句话结论:Gemini 4 Argon是Google有史以来最强大的前沿模型,以77.9%登顶SWE-bench、百万Token超长上下文、自主漏洞修复三大核心能力,瞄准企业级长程任务和网络安全防御,直接与GPT-6和Claude 5展开竞争。
一、Argon是什么:旗舰定位与命名逻辑
Gemini 4 Argon是Google第四代Gemini系列的旗舰版本。与前代Gemini 3.8 Flash/Pro不同,Argon专为复杂、长时序专业任务设计,核心改进在于:推理深度大幅提升,输出Token上限从Gemini 3系列的64K一口气提升至100万Token(约75万英文单词),模型可以在单次生成中完成数百页的代码迁移、技术报告撰写或法律分析;多智能体协同,Argon可以派生出多个子智能体并行工作,完成大规模代码库重构;安全优先发布,Argon目前以Fairwind Program形式先行开放给可信网络安全防御者,普通开发者需等待guardrails迭代完成后才能全面接入。
值得注意的是,Argon的内部测试代号为Carbon。10月初闪点曾曝光谷歌内部测试Gemini 4 Carbon版本,而Carbon是Argon的内部开发代号——两者实为同一模型的不同阶段:Carbon是受控内测版本,Argon是正式发布命名。
二、代码能力:77.9%登顶SWE-bench,80万行Fuchsia迁移Rust
Argon在代码领域的核心指标是DeepSWE v1.1达到77.9%,创下了该基准的历史最高纪录。DeepSWE v1.1由Google内部构建,衡量模型在真实长时序软件工程任务中的表现,覆盖代码理解、多文件推理、长距离依赖追踪等难题。
Google内部已经有数千名工程师将Argon融入日常工作流,典型应用包括日常调试、代码审查,以及大型代码库迁移。最具标志性的案例是将Fuchsia Zircon内核(超80万行代码)从C/C++迁移至Rust——这是Google史上规模最大的代码安全升级项目之一。Argon智能体在迁移过程中对迁移后的Rust代码进行多轮剖析、编译器输出研究和自动优化。
在libgav1(Google开源视频解码库)的迁移中,Argon智能体在现有Rust移植版本基础上,用32K行SIMD代码替换为安全Rust,通过多轮导向性能实验,自动生成可被编译器向量化优化的Rust代码,最终实现解码性能提升2倍、内存安全性零妥协。
三、企业知识工作:金融/法律/自动化三线压制
Argon的另一核心战场是企业知识工作,Google本次同时发布了三个领域的专业基准结果:
- Vals Index:衡量模型在美国GDP各行业(金融、编程、法律、税务)中的经济影响力,Argon拿下全面领先。
- Vals Finance Agent v2:多步财务研究任务,Argon位列第一。
- Harvey Legal Agent Benchmark:法律研究与合同起草,Argon位列第一。
- AutomationBench(Zapier基准):端到端业务流程自动化执行,Argon同样处于领先地位。
这些基准的共同特点是:任务需要跨多个应用/文档/数据源进行长程推理,并在最终输出中保证高度准确性。对应的实际场景包括:尽调报告自动生成、合规审查、跨系统财务建模、合同条款比对等。
四、网络安全:发现其他前沿模型全部漏报的医疗漏洞
Argon最独特的能力是自主漏洞发现、验证与修复。Google明确表示,将向可信防御者和内部团队解除网络安全护栏,以释放其在漏洞猎杀方面的全部前沿级能力。
安全公司Wiz已通过Scan for Good计划接入Argon,专门保护全球关键公共基础设施。在一个早期案例中,Argon独立发现了一个暴露全球医院软件敏感个人信息的严重漏洞——此前所有其他前沿模型均未能识别该风险。在CWE-bench v1(软件漏洞修复基准)上,Argon同样展现出领先的漏洞修补能力。
五、Google内部效率:300 TiB内存、量子计算加速40%
Argon已深度嵌入Google内部工作流,产生了大量可量化的工程效益:
- 内存优化:Argon智能体团队分析Google全球数据中心的全舰队性能遥测数据,自主识别并应用内存优化方案,已释放超过300 TiB内存,预计全部落地后可节省500 TiB至1 PiB。
- 量子算法优化:帮助量子计算研究团队优化瓶颈子线路的时空资源(量子比特×门数),在几分钟内将某一应用的表现提升40%,超越了已发表的基线水平。
- 内部推广规模:数千名Google工程师已将Argon作为日常编程助手。
六、定价与可用性
Gemini 4 Argon的API定价为:
| Token类型 | 价格(美元/百万Token) |
|---|---|
| 输入Token | $2.00 |
| 输出Token | $10.00 |
| 缓存输入Token | $0.10(95%折扣) |
输出Token上限:100万(约单次生成15万汉字)。当前发布节奏分三阶段:第一阶段通过Fairwind Program向精选可信网络安全防御者开放(不含网络安全护栏);同步进行美国政府自愿预发布审查流程;第二阶段在guardrails完成迭代后,向开发者、企业和消费者全面开放。
七、安全框架:四维防线与行业呼吁
Google为Argon构建了完整的四维前沿安全体系:
- 防滥用:针对网络攻击及CBRN(化学、生物、辐射、核)恶意使用进行专项训练,保留合法双用途科学研究的访问能力,并对模型内部激活状态进行监控以发现滥用意图。
- 防提示注入:对间接提示注入攻击(通过恶意上下文劫持模型行为)具备业界最强防御能力。
- 防错位:监控模型的思维链与行动轨迹,在检测到超出用户意图范围的行为时中止执行;训练过程中同样部署了这套监控,发现问题即上报专项响应团队。
- 系统加固:为前沿模型构建配套安全测试环境。
Google特别呼吁业界:在模型能力快速提升的关键阶段,所有公司都应保持推理透明度,以便及时发现和诊断错位风险。
Gemini 4 Argon核心数据一览
| 维度 | 数据 |
|---|---|
| 发布方 | Google DeepMind + Google Research |
| 发布日期 | 2026年9月30日 |
| DeepSWE v1.1 | 77.9%(新SOTA) |
| 输出Token上限 | 100万(前代64K) |
| API输入定价 | $2/M |
| API输出定价 | $10/M |
| 缓存输入折扣 | 95% off($0.10/M) |
| 代码迁移规模 | Fuchsia Zircon 80万行C/C++到Rust |
| 性能提升(libgav1) | 2倍(SIMD到安全Rust) |
| 内存优化 | 已释放300 TiB,总计预计500 TiB-1 PiB |
| 量子计算优化 | 超出基线40%,分钟级 |
| 漏洞发现案例 | 发现全球医疗软件严重漏洞(前沿模型均漏报) |
| 内部使用规模 | 数千名Google工程师 |
| 当前状态 | Fairwind Program限量开放,全面发布待guardrails迭代 |
FAQ:关于Gemini 4 Argon的三个核心问题
Gemini 4 Argon和之前曝光的Gemini 4 Carbon是什么关系?
Carbon是Argon的内部开发代号,仅在受控内测阶段使用;Argon是正式对外发布的命名。两者为同一模型,Carbon阶段侧重内部验证和红队测试,Argon阶段是面向特定合作方和未来全面开放的正式版本。
Gemini 4 Argon与GPT-6和Claude 5相比有什么优势?
从官方披露的基准来看,Argon在SWE-bench(77.9%)、Vals系列金融/法律基准、漏洞修复(CWE-bench)上均处于领先位置。100万Token的输出上限是目前已知的最大单次生成容量,定价($2/M输入)也处于行业低位。全面对比需要等GPT-6和Claude 5的官方基准完全披露后参照。
普通开发者什么时候能用上Gemini 4 Argon?
目前仅通过Fairwind Program向可信网络安全防御者开放(无网络安全护栏)。Google正在完成guardrails迭代并接受美国政府预发布审查,待这些流程结束后将向开发者、企业和消费者全面开放。具体时间表尚未公布。
相关阅读
- 谷歌内部测试Gemini 4 Carbon版本:代码能力堪比Opus 5.5,Argon命名史首次曝光
- Anthropic OSS Scanner上线:6个月检出2.9万漏洞,88%经专家验证为真实
- TypeSafe AI完成8.7亿美元A轮:a16z、红杉领投,Jev日处理数万亿Token
- DeepSeek V4.1 Flash正式发布:552B MoE、KV Cache缩小437倍、V4 Pro同日退役
延伸阅读
- 联想TianxiCode登顶SWE-bench-Live:71%问题解决率与代码智能体架构23 小时前
- 谷歌云发布Gemini Agent,综合成本降至三分之一,90%财富100强已入场1 天前
- Google Gemini4 Argon即将公开:Carbon代码能力堪比Opus5.521 小时前
- DreamRSI:Google用历史做梦降低探索调用,最高降162倍3 周前
