Meta正在重回开源权重AI模型领域——这一方向由它开创,却因一度优先级错乱而基本被搁置——如今,随着刚发布的Muse Glimmer开源权重模型的亮相,它发出了响亮而掷地有声的回归之音。该模型采用了巧妙的技术,确保其能够装入单个消费级显卡,并以极快的速度响应用户查询。

Meta-Muse-Glimmer-1-scaled.jpeg

Meta利用蒸馏技术确保Muse Glimmer能在单个消费级显卡上运行,同时通过一个微型的伴生模型来提升响应速度。

Meta刚刚发布了Muse Glimmer,这是一个拥有300亿参数的开源权重AI模型,旨在与谷歌的吉玛4(Gemma 4)和阿里的千问3.6(Qwen 3.6)等模型一较高下。模型权重告诉模型应对任何特定概念赋予多大的重要性,并代表了该模型知识库的全部广度。

MetaMuse Glimmer与众不同,主要体现在两大方面。首先,要运行一个300亿参数的模型并保持全精度(fp16),仅模型权重就需占用约60GB内存。然而,Meta运用了量化技术——本质上是蒸馏,即让一个更大的模型(缪斯·火花(Muse Spark))来训练一个较小的模型,使后者获得前者的许多能力——以压缩模型,将模型权重的内存需求降至20GB。再加上键值缓存(KV Cache)所需的2至4GB,这些需求已经足够低,以至于24GB32GB的消费级显卡就能轻松运行Muse Glimmer。Meta表示,这种通过蒸馏实现的模型压缩方案在性能上几乎不会带来可察觉的影响。

其次,为了加速词元(Token)生成(即响应时间),Muse Glimmer使用了一个名为DFlash草稿模型的微型伴生模型,该模型可预测整段文本,让Muse Glimmer随后能一次性核对答案,保留正确的文本响应,同时丢弃错误的。由于核对答案远比生成答案更快,这种配置实现了推理速度的大幅提升:在RTX 5090显卡上提速3.1倍,在M5 Max上提速1.8倍,在M4 Max上提速1.5倍——以上数据由Meta披露。

当然,对于西方开源权重AI模型格局而言,MetaMuse Glimmer发布恰逢其时。根据OpenRouter的数据,中国的大语言模型近期首次突破了每周34.25万亿词元的使用量,其中深度求索(DeepSeek)V4 Flash模型周环比增长高达惊人的570%

最新的OpenRouter数据集显示,自8月3日开始的这一周,全球AI模型使用量达69万亿词元,环比增长21.48%。中国模型贡献了其中34.25万亿词元,而美国模型仅为该累计值贡献了9.17万亿词元。这已是中国模型连续第十五周领跑全球使用量。

因此,我们将密切关注下周的数据,以观察MetaMuse Glimmer是否会对中国开源权重AI模型的持续强势地位产生显著影响。


文章标签: #AI模型 #开源权重 #消费级显卡 #蒸馏技术 #词元使用量

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。