英伟达DLSS 5的模改爱好者们仍在不断尝试各种方法,以降低这项技术高昂的性能开销。最新的尝试是将神经渲染模型的FP8/NVFP4混合版本带到GeForce RTX 50系列GPU上。
据X用户SwurvGaming指出,这一实验性实现通过OptiScaler-DLSSNR-PreSR-Multipass项目的0.7.1版本引入。由于Blackwell的第五代Tensor Core原生加速NVFP4,将DLSS 5的部分计算从FP8迁移出去,听起来像是提升推理性能的显而易见之法。

然而,实际收益微乎其微。事实上,根据该项目的发行说明,与原始FP8实现相比,混合模型在4K分辨率下仅将完整的DLSS 5神经渲染通道耗时缩短了约1%至2%,开发者形容Blackwell上的这一改进“极其微小”。
更重要的是,这并不能转化为整体游戏性能1%至2%的提升。该数字特指神经渲染通道耗时的减少。不受支持的模型形状仍会回退到FP8。
考虑到NVFP4本身的潜力,这一结果尤为耐人寻味。英伟达解释称,与FP8相比,NVFP4降低了内存需求,同时利用Blackwell Tensor Core的原生加速。然而,要高效地将神经网络迁移到如此低的精度,需要适当的量化和优化,而非简单地转换现有模型。
开发者此后进一步优化了混合路径。0.7.2版本将NVFP4混合方案提升为Blackwell GPU的推荐选项。在一次120秒的《博德之门3》(Baldur's Gate 3)测试中,它达到了55.16渲染帧率,而FP8为54.57帧率,不过开发者明确警告,如此微小的差异尚未被证实具有可重复性。
与此同时,英伟达仍在持续优化DLSS 5本身。该公司此前向Wccftech表示,DLSS 5已经比最初在GTC 2026上的演示快了约五倍,并计划进一步改进,同时将正式支持RTX 40系列GPU。
英伟达持续提升其DLSS 5神经渲染模型的性能。DLSS 5仍是英伟达计算强度最高的DLSS模型,因此降低其开销尤为重要。不过就目前而言,这一社区实验表明,仅仅将现有的FP8模型转向NVFP4,并非某些人所期待的那种巨大的性能捷径。



