英伟达(NVIDIA)的Blackwell GB300和GB200 GPU通过持续优化,继续在各类AI工作负载中展现领先实力。英伟达并未止步于Blackwell:随着GB300和GB200在全球范围的部署获得性能与效率的双重提升,其优化仍在继续。

或许有人会认为,随着下一代AI平台在全球范围内铺开,英伟达会转而聚焦于其Rubin GPU。但情况并非如此——英伟达的Blackwell已在无数数据中心中部署。正如其前代Hopper一样,Blackwell一代仍在不断进行优化,以至于GB300在AI工作负载中仍不断刷新性能记录。
据英伟达称,对其Blackwell平台的持续优化已带来了性能和能效比的显著提升。在短短三个月内,英伟达在同一个GB200 NVL72配置上运行DeepSeek R1 0528 - 1K/1K模型时,将每兆瓦吞吐量(TPS/MW)提升了4倍。
在这四个月里,英伟达在运行了超过25万次模拟配置后,为Blackwell平台添加了38项重大优化,累计优化测试耗时达140万GPU时。其中超过90%的优化适用于其他AI模型,这充分展示了英伟达对其AI平台的持续投入,即便新一代平台已在推出之中。
另一方面,英伟达的GB300“Blackwell Ultra”平台继续在AI训练领域占据主导地位。在256块GPU上运行DeepSeek-V3 671B模型时,Megatron Core达到了每块GPU 1648 TFLOPs的创纪录性能,相比GB200的606 TFLOPs提升了3倍。
使用256块GPU对DeepSeek-v3 671B进行预训练,在GB300 NVL72上实现了每块GPU 1,648 TFLOPs的世界纪录,使得同样的训练任务能在更少的硬件上达到相同的性能。
优化成果再次得到彰显:同一套GB300 NVL72系统,相比过去六个月,性能提升了1.5倍。英伟达还与PyTorch和JAX社区深度合作,在其整个AI产品组合中落地优化。因此,在DeepSeek-V3 671B模型上使用TorchTitan(PyTorch原生训练框架),Blackwell Ultra机架的性能相比未经任何优化的基准配置提升了6倍。
JAX的提升更为显著,达到了每块GPU 1025 TFLOPs,以及每块GPU高达4082 Tokens/s的吞吐量,相比2026年1月的优化结果提升了10倍。
英伟达还在所有框架中为预训练任务建立了世界级的扩展性能,覆盖从256到1024块GPU的规模。在1024块GPU上,Megatron Core保持了高达98.5%的扩展效率,而TorchTitan和JAX也保持高达97%的效率。实现这一扩展性的核心组件是每个NVL72机架内的英伟达800 Gb/s Scale-Out网络芯片。
从训练到推理,英伟达在AI领域创下了一系列令人瞩目的记录。其他厂商需要奋起直追,而英伟达的Vera Rubin平台已在推出中,并将带来比Blackwell平台更大的性能提升。



