说到逆袭者的胜利,谷歌(Google)刚刚发布了最新模型,名为Gemini 4 Argon,它在各项AI基准测试中横扫千军,所向披靡。不过,由于该模型正在接受美国政府的测试,目前大范围推广尚遥遥无期。

谷歌的Gemini 4 Argon以77.9%的得分在DeepSWE v1.1上拔得头筹,力压Anthropic的Claude Opus 5.5和Fable 5.1,以及OpenAI的GPT-6 Astra。
今年9月早些时候,我们曾报道过一则大胆的传闻,称谷歌旗下的DeepMind可能已经实现了RSI——即利用AI系统帮助构建、编码或训练其下一个版本,从而在此过程中释放出巨大的规模经济效应。
仅仅两周左右之后,谷歌似乎正以全新的Gemini 4 Argon验证这一传闻——该模型目前在评估AI模型最常用的19项基准测试中,独占14项榜首。
Artificial Analysis对部分基准测试结果做了如下总结:
Gemini系列模型历来在智能体评估方面表现较弱,而Gemini 4 Argon在这一领域展现出全面进步。它在AutomationBench-AA上以77.5%的成绩排名第一,领先Claude Sonnet 5.5(max,71.3%)6个百分点。在Terminal Bench 4上,Gemini 4 Argon达到57%,较Gemini 3.1 Pro Preview提升了53个百分点,仅次于Claude Sonnet 5.5(max,64%)、Claude Opus 5.5(max,60%)和GPT-6 Astra(59%)。在AA-Briefcase上,它达到1494 Elo。这得益于65%的评分标准通过率——这是我们记录到的最高值——但分析质量(1576 Elo)和呈现质量(1308 Elo)相对较低。
更重要的是,Gemini 4 Argon是谷歌约7个月来首款非Flash级模型,在Artificial Analysis Intelligence Index上取得了53分,与GPT-6 Astra(max)持平,同时领先GPT-6.1 Sol1分。
Artificial Analysis补充道:
“Gemini 4 Argon每项Intelligence Index任务花费1.99美元,为GPT-6 Astra(max)的60%,但是GPT-6.1 Sol(max)的2.7倍。折扣结束后,价格将升至3.98美元(约为GPT-6 Astra(max)的1.2倍)。”
此外,在AA-Omniscience基准测试中,谷歌的Gemini 4 Argon展现出15%的幻觉率,是所有在Intelligence Index上得分超过45分的模型中最低的。相比之下,GPT-6 Astra(max)的幻觉率为51%,GPT-6.1 Sol(max)为54%。
在其他方面,该模型保持100万token的上下文窗口,目前享受50%的折扣,即每100万token输入2美元、输出10美元。
关键在于,在Vals RSI指数上,谷歌的Gemini 4 Argon目前排名第四,仅次于Anthropic的Claude Opus 5.5、Fable 5.1和Opus 5.0,领先于OpenAI的GPT-6 Astra。不过,更令人清醒的是,彭博社(Bloomberg)刚刚发布了一篇对Gemini 4 Argon评价不佳的报道,一位谷歌员工称“该模型在处理某些编码任务时表现吃力”。



