谷歌选择了一个最糟糕的时机来推出性能长期不足的Gemini 3.6 Flash,紧随其后的是中国令人惊叹的开源AI模型,比如Moonshot的Kimi K3,它采用新颖的架构特性实现了显著的成本节约,同时提供了前沿水平的性能。

谷歌的Gemini 3.6 Flash性能不如Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Sonnet 5、Grok 4.5和GPT-5.6 Terra。
谷歌刚刚发布了全新的Gemini 3.6 Flash,拥有100万个词元的上下文窗口,相当于1500页A4纸文本、30000行代码或1小时视频,定价为每100万个输出词元7.5美元。它还支持文本、图像、语音和视频输入。
关键的是,据谷歌称,该模型在多步骤工作流中消耗的输出词元减少了17%。这就引出了今天话题的核心。谷歌的Gemini 3.6 Flash在人工分析智能指数上获得了50分,该指数衡量AI模型的智能体、通用、编码和科学推理性能。
事实上,这个分数比Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Sonnet 5、Grok 4.5和GPT-5.6 Terra所获得的分数都要差!深入研究显示,谷歌的Gemini 3.6 Flash在大多数基准测试中常常被更便宜、更旧的模型所超越。例如,在SWE-Bench Pro(公开版)上,它被Grok 4.5击败,后者于2026年7月8日推出,在MLE Bench上则被Claude Sonnet 5击败。
Gemini 3.6 Flash可能是谷歌迄今为止发布的最令人失望的模型。当然,谷歌还发布了Gemini 3.5 Flash-Lite,它相当具有成本效益,能够实现每秒350个输出词元,以及Gemini 3.5 Flash Cyber,专门面向网络安全应用。



