Google DeepMind 发布 Gemini 4 Argon,面向可信网络防御者先行开放
Gemini 4 Argon: our next era of frontier intelligence
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将逐步面向开发者、企业和消费者推出。
官方发布给出了定价、输出 token 上限和多项基准成绩,读者可以据此比较它在编码与企业工作流中的实际位置。
2026年9月30日
|
Gemini 4 Argon 在真实世界软件工程、法律和金融等企业知识工作以及网络安全防御等复杂工作流中提供前沿性能。
您的浏览器不支持音频元素。
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 仍处于实验阶段
本文内容
- 推出 Gemini 4 Argon
- 改变我们在 Google 的工作和构建方式
- 更努力地解决您最复杂的问题
- 跨领域支持编码和企业工作流
- 在防御性网络安全领域保持领先
- 在广泛开放前加强前沿安全保障
- 即将推出
今天,我们宣布推出新的前沿模型 Gemini 4 Argon,该模型正通过我们的 Fairwind 计划向一组受信任的网络防御者推出。Argon 旨在在复杂、长周期的工作流中维持深度推理,正在从根本上改变我们在 Google 的工作和构建方式。它在真实世界软件工程、法律和金融等企业知识工作以及网络安全防御等复杂工作流中提供前沿性能。
安全地发布这一级别的前沿能力需要分阶段推进。我们正积极参与美国政府关于发布前模型访问的自愿流程,同时逐步扩大访问范围。我们将继续收集早期测试者的反馈,并在护栏方面持续迭代,以便尽快让开发者、企业和消费者使用 Argon。
Argon 将以 introductory price 推出 1 每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 的价格为输入 token 价格的 95% 折扣。
改变我们在 Google 的工作和构建方式
Gemini 4 Argon 已经在为我们的内部工作流提供支持,数千名 Google 员工强调了该模型在专业编码任务、开展更深入研究和写作质量方面的优势。它正在帮助团队更快地构建,推动工程生产力的边界,并加速突破:
- 量子算法优化: Argon 正在帮助我们的量子计算研究人员优化那些对重要应用形成瓶颈的子程序的时空资源(量子比特 × 门)。在一个例子中,它在几分钟内就比已发布的基线提升了 40%。
- 内存效率: 一组 Argon 智能体分析了全集群性能分析遥测数据,自主识别并在 Google 数据中心范围内应用内存优化,全面推出后释放了超过 300 TiB 内存,预计总节省量可达 500 TiB 至 1 PiB。
- Large Scale Codebase Migrations and Optimizations: Argon agents are working on migrating C/C++ codebases to Rust across Google—scaling from tens of thousands of lines in core libraries like re2, libgav1 up to 800K+ lines for the Fuchsia OS Zircon kernel. Given the criticality of many of these systems, such large-scale rewrites are undergoing rigorous automated and manual auditing, emulation testing, and review before rolling out to production.
对于 Google 用于解码视频的开源软件 libgav1,Argon 智能体接手了一个已有的 Rust 移植版本,并通过运行多轮性能分析引导的实验、研究编译器的输出、生成安全的 Rust 代码以便编译器自动向量化,替换了 32K 行 SIMD 代码。最终成果是一个内存安全的视频解码器,运行速度比 Rust 移植版快 2.7 倍,视频输出完全一致,使其更接近优化后的 C++。
在你最复杂的问题上更加努力
为了支持 Gemini 4 Argon 在更长、更复杂的用例中发挥能力,我们将模型的输出 token 上限从之前的 64K token 大幅提升至业界领先的 1M token。当模型有足够的空间深入思考并在单次轨迹中生成数十万个 token 时,它为推理增添了新的深度,能够一次性解决棘手问题。
赋能跨领域的编程和企业工作流
Gemini 4 Argon 在编程、推理和多模态方面的能力,以及其维持长时间、多步骤任务的能力,使其能够在一系列企业工作流中表现出色。
Google 工程师一直在日常工作中使用 Argon,从日常调试到大规模代码库迁移和算法设计。它在 DeepSWE v1.1(77.9%)上创下新的最优成绩,该基准衡量模型在真实世界长周期软件工程任务中的表现。
除编程之外,Argon 还在 Vals Index 上处于领先地位,该指数衡量金融、编程、法律和税务工作领域的经济影响,每个领域按其对美国 GDP 的贡献加权。我们在其他领域特定评估中也看到同样领先的表现,例如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与起草)。在 Zapier 的基准 AutomationBench(衡量核心业务职能的端到端执行)上,Argon 以 51.3% 的得分排名第一。
当知识工作需要进行视觉理解时,Argon 也展现出独特的优势。它能够驱动专业图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解的 LVBench 上,Argon 以 91.7% 的得分达到最优水平。
在防御性网络安全领域领先
为了更好地让网络防御者应对网络攻击的新时代,我们训练 Gemini 4 Argon 在网络安全防御方面具备高能力。Argon 能够自主发现、验证并修补关键软件漏洞。对于受信任的防御者以及 Google 内部团队,我们将发布不带网络防护限制的 Argon,以便他们能够充分利用其前沿级网络安全防御能力。
Wiz 已经通过其 Scan for Good 计划将 Argon 用于网络安全防御——该计划致力于通过发现并修复高风险暴露来免费保护关键公共基础设施。在其影响力的早期演示中,该模型发现了一个关键漏洞,该漏洞暴露了全球医院使用的医疗软件中的敏感个人信息,识别出了此前前沿模型遗漏的严重风险。
在评估模型修复安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一,延续了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现。
Gemini 4 Argon 在漏洞发现方面相较 3.8 Flash Cyber 展现出令人瞩目的飞跃。例如:
- 在 Google 内部的综合漏洞基准测试中,Argon 在横跨 20 种编程语言的复杂代码库中发现了大量暴露问题。
- 在 Wiz 内部的黑盒渗透测试基准中——该测试评估模型在无源代码情况下分析实时 Web 系统的能力——Argon 在发现攻击面、识别漏洞以及生成概念验证证据以验证漏洞方面均优于 3.8 Flash Cyber。
在广泛开放前强化前沿安全保障
在广泛推出 Gemini 4 Argon 之前,我们正在继续强化关键的前沿安全保障,主要涵盖四个领域:
防范滥用:为防止恶意行为者利用 Argon 进行网络攻击或化学、生物、放射及核(CBRN)攻击,该模型被设计为拒绝有害请求,同时依据我们的前沿安全框架保留合法的两用科学研究。我们正在为此次发布强化安全保障的稳健性,包括改进监测模型内部激活以发现滥用的技术。这些保障措施经过了内部和外部红队的稳健性测试,测试结合了手动和自动化攻击方法。
防范提示注入攻击:Argon 也是我们迄今抵御间接提示注入最具韧性的模型,此类攻击利用恶意指令或上下文劫持模型行为。这些是复杂的攻击,需要持续警惕和多层防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准测试中处于提示注入稳健性领先地位。
监测失准:为防止 Argon 越界,以超出用户意图的方式尝试完成任务,我们部署了失准缓解措施,监测 Argon 的思维链和行动,并在必要时停止执行。
我们使用类似系统监测训练运行,并向专门的事件响应团队发送警报,同时采取谨慎预防措施,避免将发现结果反馈到训练中,以免影响 Argon 的推理以规避我们的监测。我们强烈鼓励业界其他各方在能力提升的关键时刻、在应对对齐风险的同时,保持推理透明度,以便模型思维仍有助于识别和诊断失准。
加固系统:随着前沿模型能力日益增强,安全测试它们需要能够跟上系统本身的安全环境。依据我们的智能体控制路线图,我们在高风险训练或评估开始前,通过隔离和封闭来加固沙盒环境。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。
即将推出
我们构建了 Gemini 4 Argon,在编程、知识工作、网络安全防御和创意写作方面具备前沿水平的能力,旨在成为开发者、专业人士和企业在应对最棘手问题时的伙伴。我们感谢首批网络安全防御者和可信测试人员,他们的真实世界评估和反馈将帮助我们在向开发者、企业和消费者发布之前强化我们的系统,首先从付费 API 客户和 Google AI Ultra 订阅者开始。
来源:Google DeepMind:Blog(RSS) · deepmind.google