谷歌选择了一个最糟糕的时机来推出性能长期不足的Gemini 3.6 Flash,紧随其后的是中国令人惊叹的开源AI模型,比如MoonshotKimi K3,它采用新颖的架构特性实现了显著的成本节约,同时提供了前沿水平的性能。

Google-Gemini-1-e1731440889548.jpeg

谷歌的Gemini 3.6 Flash性能不如Meta Spark 1.1GLM-5.2GPT-5.6 LunaSonnet 5Grok 4.5GPT-5.6 Terra

谷歌刚刚发布了全新的Gemini 3.6 Flash,拥有100万个词元的上下文窗口,相当于1500页A4纸文本、30000行代码或1小时视频,定价为每100万个输出词元7.5美元。它还支持文本、图像、语音和视频输入。

关键的是,据谷歌称,该模型在多步骤工作流中消耗的输出词元减少了17%。这就引出了今天话题的核心。谷歌的Gemini 3.6 Flash人工分析智能指数上获得了50分,该指数衡量AI模型的智能体、通用、编码和科学推理性能。

事实上,这个分数比Meta Spark 1.1GLM-5.2GPT-5.6 LunaSonnet 5Grok 4.5GPT-5.6 Terra所获得的分数都要差!深入研究显示,谷歌的Gemini 3.6 Flash在大多数基准测试中常常被更便宜、更旧的模型所超越。例如,在SWE-Bench Pro(公开版)上,它被Grok 4.5击败,后者于2026年7月8日推出,在MLE Bench上则被Claude Sonnet 5击败。

Gemini 3.6 Flash可能是谷歌迄今为止发布的最令人失望的模型。当然,谷歌还发布了Gemini 3.5 Flash-Lite,它相当具有成本效益,能够实现每秒350个输出词元,以及Gemini 3.5 Flash Cyber,专门面向网络安全应用。


文章标签: #AI模型 #谷歌 #性能对比 #开源AI #多模态

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。