Gemini 4 Argon:我们 frontiers 智能时代的下一章

📌 One-Sentence Summary
Google 宣布 Gemini 4 Argon,一款输出上限达 100 万 token 的 frontier 模型,在 DeepSWE、Vals Index 和 CWE-bench 上的表现居首,将首先通过 Fairwind Program 提供给值得信赖的网络安全防御者。
📝 Summary
Google DeepMind 推出 Gemini 4 Argon,这是其下一代 frontier 模型,专为软件工程、企业知识工作和网络安全防御等复杂的长时程工作流程中的深度推理而打造。Argon 首先通过 Fairwind Program 提供给值得信赖的网络安全防御者,并遵循美国政府的预发布访问流程进行分阶段发布。在内部,它已经帮助优化量子子例程(比已发布基线提高 40%)、释放超过 300 TiB 的数据中心内存,并将大型 C/C++ 代码库迁移到 Rust,包括在 libgav1 中替换 32K 行 SIMD 代码,使内存安全解码器速度提升 2.7 倍。该模型将输出 token 上限提升至行业领先的 100 万 token,并在 DeepSWE v1.1(77.9%)、Vals Index、Vals Finance Agent v2、Harvey's Legal Agent Benchmark、AutomationBench(51.3%)、LVBench(91.7%)和 CWE-bench v1(68%)上实现了最先进的结果。Google 还详细介绍了四个安全保障领域:滥用防御、提示词注入鲁棒性、错位监控和系统强化。入门定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入折扣高达 95%。
💡 Main Points
Gemini 4 Argon 是一款专为长时程推理而打造的 frontier 模型,目前正在分阶段推出,首先面向值得信赖的网络安全防御者。
它通过 Fairwind Program 提供给一组值得信赖的网络安全防御者,Google 正在参与美国政府的自愿性预发布访问流程,并在更广泛的开发者、企业和消费者可用之前持续完善相关约束机制。
Argon 在 Google 内部已在编码、基础设施和研究领域展现出可衡量的影响。
它在几分钟内就超越了已发布的量子基线 40%,帮助智能体释放超过 300 TiB 的数据中心内存(据估计总节省 500 TiB 至 1 PiB),并用于大规模 C/C++ 至 Rust 的迁移工作,迁移量高达 80 万行以上,其中一个 libgav1 解码器比之前的 Rust 版本快 2.7 倍。
该模型将输出 token 上限提升至行业领先的 100 万 token(从 64K 开始),实现更深层的单次轨迹推理。
Google 认为赋予该模型生成数十万 token 的能力,使其在一次轨迹中解决复杂难题带来了新的深度水平。
Argon 在编码、经济影响和多模态基准测试中取得了最先进的结果。
它在 DeepSWE v1.1 取得 77.9%,领跑 Vals Index,在 AutomationBench(51.3%)排名第一,并在 LVBench 长视频理解(91.7%)上创下新纪录,同时在 Vals Finance Agent v2 和 Harvey's Legal Agent Benchmark 上也取得领先成绩。
Google 强调网络安全防御和前沿安全保障优先于广泛发布。
Argon 可以自主发现、验证和修补漏洞,在 CWE-bench v1(68%)并列第一,并在发布给值得信赖的防御者时不加网络安全限制;安全保障涵盖滥用防御、提示词注入鲁棒性(在 Gray Swan 的 IPI 基准测试中领先)、错位监控和沙箱强化。
💬 Key Quotes
「专为在复杂的长时程工作流程中维持深度推理而设计,Argon 从根本上改变了我们在 Google 的工作和构建方式。」
「为了支持 Gemini 4 Argon 在更长、更复杂的使用场景中的能力,我们显著扩展了该模型的输出 token 上限,达到行业领先的 100 万 token,远超之前的 64K token。」
「Argon 可以自主发现、验证和修补关键的软件漏洞。」
「通过自动化红队测试和对抗性训练,Gemini 4 Argon 在 Gray Swan 的间接提示词注入(IPI)基准测试中表现出色,领先于提示词注入鲁棒性。」
「Argon 将以入门价 2 美元/百万输入 token 和 10 美元/百万输出 token 推出,缓存输入 token 享 95% 折扣。」
📊 Article Meta
AI Screening: 93
Featured: Yes
Source: Google DeepMind News
Author: Koray Kavukcuoglu
Category: 人工智能
Language: 英文
Read Time: 6 min
Word Count: 1376
Tags:
AI 与智能应用 , 模型发布 , 大语言模型 (LLM) , AI 安全与对齐 , AI 编程
这个比较实用,已转发给同事。
赞同,实践出真知。