月之暗面(Moonshot)要么是对其正在逾越的边界所带来的危险浑然不觉,要么就是对此极度漠视。否则,为何它会选择加倍押注于曾在Kimi K3模型上奏效、并且很可能在Kimi K4上同样管用的隐秘策略?这么做将付出巨大的地缘政治代价,甚至可能招致特朗普(Donald Trump)政府的全面怒火。

月之暗面正试图暗中利用更大规模的英伟达(NVIDIA)算力储备,来训练其即将推出的Kimi K4模型。正如我们近期在一篇文章中所解释的,月之暗面刚刚发布了全新的开源模型Kimi K3,该模型拥有2.8万亿个参数,专为前沿水平的智能而设计。该模型是多模态的,上下文窗口约为100万词元,在性能上比许多同类模型更具竞争力,且速度更快。
此外,Kimi K3在数据中心级别的硬件上运行也相当高效,这得益于其大幅缩减的KV缓存,以及对每词元内存使用的内置优化——通过将其896个专家分布在大量GPU上来实现。事实上,微软(Microsoft)计算得出,如果将其Copilot服务从基于OpenAI和Anthropic的模型迁移到月之暗面的Kimi K3,推理成本最多可节省6亿美元。
当然,月之暗面最近也深陷中美之间持续的多维度角力之中。当时,Anthropic以及特朗普政府的一些成员指控月之暗面从其Claude: Fable模型中蒸馏出了Kimi K3模型。
美国长期以来一直怀疑,中国的工程师常常会带着装满模型的硬盘前往对美国友好的国家,通过在先进的英伟达GPU上使用强化学习技术,为其模型注入前沿能力。显然,根据特朗普政府一位官员近期提出的指控,月之暗面不仅秘密拥有一些英伟达GB300服务器,而且还能够通过泰国获取额外的GB300服务器。
请注意,Claude: Fable是在6月底被解禁的,而月之暗面在7月中旬左右就发布了Kimi K3模型。如此短的时间内,月之暗面根本不可能蒸馏出像Kimi K3这样庞大的模型,更不用说该模型独有的架构成就也并非Claude: Fable的一部分。不过,月之暗面很可能使用Claude: Fable对其模型的部分回复进行了微调。
这就引出了问题的核心。据The Information近日报道,在Kimi K3模型大获成功后,月之暗面正寻求获取更大规模的英伟达Blackwell GPU储备,用于下一代Kimi K4模型,并且似乎不惜为此挑战美国的出口管制。
这并非说该公司没有使用国产AI芯片。毕竟,月之暗面的工程师们成功地将多个八芯片服务器,跨越中国的不同数据中心连接起来,训练出了Kimi K3。但鉴于Kimi K4很可能会超越前代2.8万亿的参数规模,月之暗面急需更多的算力,并且似乎甘愿为此冒险激怒特朗普政府。
与此同时,特朗普政府正在考虑是否全面禁止来自中国的开源权重模型。对于可能不了解情况的读者来说,权重告诉一个模型应该对任何特定概念或字符串赋予多大的重要性。这些权重初始化为随机数,然后通过迭代更新进行改变,每次前向传播后,误差指标会衡量预测值与实际目标值之间的差距。开源权重模型,如Kimi K3,公开其权重,从而揭示了其整体架构;而封闭权重模型,如Anthropic的《克劳德》(Claude),则不会公开。
然而,在此问题上,AI界的重要人物——包括英伟达、微软、Meta、戴尔(Dell)、Perplexity、Palantir、Mistral AI等——现已发布联名信,呼吁特朗普政府确保开源权重AI模型生态系统能够继续蓬勃发展。



