谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让

空逐月行业资讯📡 量子位2026-10-0252 阅读💛 265 收藏
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让

价格只有Astra一半

鹭羽 发自 凹非寺

量子位 | 公众号QbitAI

哎呦喂,谷歌终于也是蹬起来了。。。

假期第一天,谷歌携Gemini 4 Argon空降多榜单第一。

拳打Opus 5.5,脚踢GPT-6 Astra。

更夸张的还在后头,单项任务成本最低可至1.99美元,直接是Astra费用砍半。

最高百万Token输出上限,面向编程、金融和法律等复杂工作流,而且划重点,网络安全防御能力超牛掰。

这波等等党要赢麻了。

不过吧,咱普通用户现在只可远观,暂时还吃不上。

Gemini 4 Argon目前只开放给部分经过筛选的网络安全团队使用,其它订阅用户得一步步来。

倒是谷歌内部对新一代旗舰模型的态度还挺有意思的。

劈柴哥、哈萨比斯还有接班人Koray Kavukcuoglu,纷纷一键三连为其站台:谷歌is back!

DeepMind研究员Zirui Wang发帖直言:

RSI来了!我已做无可做,是时候追逐我的咖啡师梦想了:)

讲真?

轮到你了,谷歌

全体起立!咱盼星星盼月亮的Gemini 4,它终于来了。

仔细数一数,距离谷歌上一代旗舰模型发布都快一年了,哪吒都没这么难产。

这一年OpenAI、Anthropic是追着谷歌砍啊,放假前一周还连发Opus 5.5、Sonnet 5.5、GPT-6.1 Sol逼宫。

你说谷歌能不急吗,新型号Argon火速上岸。

先看跑分情况,清一色的性能领跑。

Argon在衡量长期软件工程任务的DeepSWE v1.1上拿到77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。

网络安全漏洞修复测试CWE-bench v1则拿到68%,和GPT-6 Astra并列第一。

Argon以68.90%登顶Vals Index榜首,较Gemini 3.8 Flash实现大幅提升。

尤其是RSI指数一跃第四,超越了GPT-6 Astra。

Gemini 4 Argon在另外的第三方评测中也不遑多让。

文本领域,Argon在代码编写、高难度提示词、指令遵循、长查询以及创意写作赛道优势显著,以1525分位居Text Arena第一。

在评测网页开发的Code Arena中排名第八,较Gemini 3.8 Flash High提升了21个名次,但依旧稍逊于Claude和GPT最新模型。

Artificial Analysis测评中,Argon和GPT-6 Astra旗鼓相当,高于GPT-6.1 Sol一分,提升主要来自于更少的幻觉和更强的智能体能力。

但在价格上,Argon相比Astra优势明显。

优惠期间Argon单题成本约低四成,每百万输入Token为2美元、输出Token为10美元,目前是最具性价比的模型之一。

在具体工作中,Argon也更倾向于处理复杂且长期的深度推理任务,比如软件工程、企业专业知识梳理以及网络安全防御等。

模型的百万Token输出上限,就是为这种长任务准备的,它能给模型更多连续工作的余地和充足的推理深度。

以谷歌内部使用情况为例,其中Argon在谷歌各数据中心自主识别并落地内存优化方案,待方案全面部署后,预计可释放超300 TiB内存。

另一个案例中,Argon Agent围绕视频解码器的Rust移植版本,反复实验并替换了3.2万行SIMD代码,最终版本运行速度达到原Rust移植版的2.7倍。

官方还重点强调了Argon的防御性网络安全优势。

它能够自主发现、验证并修补20多种语言的关键软件漏洞,在Wiz内部黑箱渗透测试中,模型可以在无源代码下实时分析网络系统,高效发现攻击面、识别漏洞以及生成概念验证证据。

为了防止滥用,Argon首批进入的是谷歌的Fairwind计划,面向经过审核的网络安全防御方。

对受信任的防御团队,谷歌会放开针对网络安全任务的部分限制,Argon将帮助防守方补洞,以及用来寻找攻击入口。

One More Thing

不过嘴上说说得了,Argon实际跑起来怎么样,还得打个问号。

毕竟咱普罗大众还没用上啊喂。。。

有小道消息透露,谷歌内部员工对Gemini 4并不完全看好。

一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是短板,甚至存在过度刷榜的嫌疑。

然而另一名熟悉开发工作的员工则表示,内部普遍认为Gemini 4已达到前沿水平。谷歌也回应称,说它编程表现不佳并不准确。

总之模型到底咋样,还有待观察。

所幸的是,谷歌终于回到了牌桌之上。

参考链接:
[1]

[2]

[3]

[4]

[5]

版权所有,未经授权不得以任何形式转载及使用,违者必究。
Gemini 谷歌
鹭羽
  • 何恺明团队新作:看猫片就能学会ARC挑战2026-10-01
  • Qwen一号位定了!刘大一恒接棒2026-09-23
  • 通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队2026-09-16
  • 今年外滩最特别Agent:能干活,能陪聊,还会朋友圈拉黑你2026-09-13

相关阅读

文章评论(12)

雪知秋8 小时前

点赞,必须点赞

回复
空向阳6 小时前

点赞,必须点赞

回复
南山客9 小时前

点赞,必须点赞

回复
三分糖去冰6 小时前

有没有更详细的教程,期待后续。

回复
一叶知秋8 小时前

讲解得很细致,新手也能看懂。

回复
星寻梦6 小时前

赞同,实践出真知。

回复
青柠微凉6 小时前

有没有更详细的教程,期待后续。

回复
雪知秋6 小时前

看标题就点进来了,内容果然没让人失望。

回复
墨向阳5 小时前

整理得太全面了,省了我不少时间。

回复
墨向阳3 小时前

很有价值的分享,感谢整理。

回复
一叶知秋4 小时前

赞同,实践出真知。

回复
空向阳4 小时前

思路清晰,干货满满。

回复