美国开源权重模型的竞争正在升温,尽管中国在这一领域仍占据主导地位。英伟达(NVIDIA)发布了其Nemotron 3.5 Lightning人工智能模型,而就在几小时前,Meta刚刚在周一发布了Muse Glimmer模型。

英伟达的Nemotron 3.5 Lightning试图解决词元瓶颈问题,而真正的制约因素在于编排层
如前所述,英伟达刚刚发布了Nemotron 3.5 Lightning——一个拥有300亿参数(30亿活跃参数)的开源权重、专家混合(MoE)模型,旨在处理和编排持续运行、处理源源不断日常任务的常驻智能体。
为便于理解,所谓编排,是指协调多个专门化人工智能智能体高效协作,以解决单个智能体无法独立完成的复杂多步任务的过程。这种智能体级别的编排涉及多个环节,包括任务接收与分解、智能体选择、上下文与状态共享(当智能体A完成其步骤时,编排者将结果和相关数据传递给智能体B,以确保进度不会重置),以及周期性验证和错误纠正。请注意,硬件级别的编排发生在CPU内部,它通常管理内存与计算核心之间的数据流,以最小化延迟并最大化吞吐量。
架构要素
英伟达的Nemotron 3.5 Lightning包含4个关键架构要素:
混合Mamba-Transformer架构:结合了Transformer的深层上下文理解能力与Mamba(状态空间模型)的闪电般快速、硬件高效的运算速度。Transformer是用于处理输入序列并理解其组成部分之间关系的深度学习神经网络,而状态空间模型是用于建模和预测复杂动态系统随时间变化的数学框架。
多词元预测(MTP):该模型并非逐词(逐词元)预测文本,而是同时预测多个词元,从而大幅缩短生成时间。
潜在专家混合(MoE):一种路由系统,在推理阶段动态扩展可用的“专家”网络,在不造成巨大计算开销的前提下提升性能。简而言之,MoE模型包含多个神经网络,每个网络擅长执行特定任务。编排者会动态选择最适合执行特定任务的神经网络,即“专家”。
推测解码:一个更小、更快的“草稿”模型先行预测文本,主模型随即进行验证,从而极大提升吞吐量。Meta的Muse Glimmer模型正是采用同样的方法来加速词元(响应/输出)生成的。
为什么英伟达的Nemotron 3.5 Lightning收益递减
英伟达的Nemotron 3.5 Lightning在人工分析智能指数(Artificial Analysis Intelligence Index)上取得了24分的成绩,该指数是一个综合基准评分,旨在评估和追踪大语言模型(LLM)在迈向通用人工智能(AGI)过程中的整体能力,并衡量特定模型的智能体能力、编码能力、科学推理能力和通用能力。这一分数较其前代产品——Nemotron 3 Nano——有显著提升。
即便如此,英伟达声称Nemotron 3.5 Lightning生成词元的速度比“同类尺寸模型”快4倍,但这仅能将实际智能体任务加速30%。换言之,该模型的词元输出量实现了四倍增长,但在智能体任务加速方面却收益递减。这表明真正的瓶颈在于编排层和智能体外围框架——即决定什么任务在何处运行以及以何种顺序运行的软件。
尽管Nemotron 3.5 Lightning在增量效用方面确实有所突破,但它缺乏推动美国开源权重模型迈向领先地位所需的强大动力,这或许能部分解释为何英伟达已开始将Nemotron 4作为其下一个重大赌注进行宣传。


