NVIDIA的Groq 3 LPX现已全面投产,为智能体AI(Agentic AI)领域的Vera Rubin平台带来了巨大的词元生成速度提升。

NVIDIA-Groq-3-LPX-LPU-1.jpeg

NVIDIA借力Groq 3 LPX AI推理加速器,将Vera Rubin NVL72词元生成能力提升至每秒3400词元

作为Hot Chips 2026发布活动的一部分,NVIDIA今日宣布其Groq 3 LPX AI推理加速芯片已全面投产。这一声明紧随Vera CPUVera Rubin服务器进入量产之后,标志着NVIDIA AI路线图的稳健执行。

Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,提供增强的AI推理能力,能够为对响应敏感的智能体工作负载实现超快词元生成。这类系统在数百甚至数千次推理步骤中可生成海量词元,因此快速词元生成成为AI工厂的关键环节。

虽然NVIDIA的Vera Rubin NVL72是面向智能体AI的前沿解决方案,但Groq 3 LPX方案还能进一步强化其能力。

在一次演示中,NVIDIA展示了其Vera Rubin NVL72平台配合Groq 3 LPX,在运行Gemma 4 31B开源模型的Artificial Analysis测试中创下了每秒3400词元的纪录。在100,000词元的上下文窗口下,这是该模型有史以来录得的最快性能。

NVIDIA Rubin GPU负责处理大规模上下文,而LPX则加速对延迟敏感的解码工作负载。其结果是更快、更可预测的词元生成,帮助AI工厂实现响应式推理、更流畅的智能体交互,以及更高的基础设施效率。

借助Groq 3 LPX,NVIDIA还能将编码等智能体AI任务从数小时缩短至数分钟内完成,与最接近的替代平台相比,响应时间提升了4倍。这可真不是说说而已!

“推理是AI的增长引擎。NVIDIA Grace BlackwellNVL72凭借前所未有的性能和效率飞跃,彻底改变了大语言模型的推理格局。”NVIDIA创始人兼首席执行官黄仁勋(Jensen Huang)表示。

Vera Rubin以面向智能体AI时代设计的负载优化AI工厂配置,延续了这一愿景,通过LPX推动超快词元生成的前沿性能。这正在改变智能的生产方式,在AI计算需求全球加速的当下,为AI吞吐量、效率和响应能力带来又一次巨大飞跃。”

NVIDIA Groq 3 LPX方案也正被AI云服务商视为应对不断增长需求的手段,为企业与开发者提供大规模训练、推理和推演所需的先进基础设施。为此,Nebius计划在其Nebius Token Factory中采用Groq 3 LPX

“生成阶段是决定AI系统实际响应能力的推理环节,而这正是NVIDIA Groq 3 LPX要加速的目标。”Nebius首席技术官丹尼拉·什坦(Danila Shtan)表示。“作为首个通过Nebius Token Factory将其投入生产环境的AI云,我们将确保智能体循环的每一步都即时响应——通过开发者已在使用的同一API实现,无需迁移到新的技术栈。”

Groq 3 LPXVera Rubin的组合,专为智能体AI时代而生,带来了旨在最大化响应能力、吞吐量和效率的专用推理架构,助力驱动下一代的AI工厂。


文章标签: #AI推理 #智能体 #NVIDIA #算力提升 #芯片

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。