首页 > 资讯 > 英伟达 DLSS 5 混合精度 Mod 测试:RTX 50 系列显卡性能仅提升 1% 至 2%

英伟达 DLSS 5 混合精度 Mod 测试:RTX 50 系列显卡性能仅提升 1% 至 2%

IT之家 2026-09-12 10:28 4 阅读 查看原文

IT之家 9 月 12 日消息,在英伟达 DLSS 5 神经渲染 DLL 文件流出后,各路民间大神纷纷下场进行调试和优化,还有 Mod 开发者尝试通过降低模型推理成本以提升游戏性能。

根据 X 用户 SwurvGaming 分享的情报,有 Mod 开发者将 FP8 与 NVFP4 混合精度应用于 DLSS 5 神经渲染模型,并在 RTX 50 系列显卡上运行。

不过,该方案在 4K 分辨率下仅将神经渲染阶段耗时降低约 1% 至 2%,开发者称其在 Blackwell 架构上的改进“非常有限”。

由于英伟达 Blackwell 架构第五代 Tensor Core 原生支持 NVFP4,开发者尝试将部分 DLSS 5 计算从 FP8 切换至 NVFP4,以降低推理开销。

需要注意的是,1% 至 2% 的数据仅代表 DLSS 5 神经渲染阶段耗时的下降,并非整款游戏的帧率提升。

此次实验由 OptiScaler-DLSSNR-PreSR-Multipass 项目引入,相关更新出现在 0.7.1 版本。项目发布说明还指出,不支持的模型形状仍会回退至 FP8,因此混合精度方案并不能覆盖全部计算过程。

NVFP4 是英伟达面向神经网络推理推出的低精度数据格式,相比 FP8 可减少内存需求,并利用 Blackwell Tensor Core 的原生加速能力。

IT之家注:FP8 和 NVFP4 分别表示 8 位浮点格式及英伟达推出的 4 位浮点格式,后者需要配合量化和优化技术才能有效发挥作用。

项目开发者随后在 0.7.2 版本中进一步优化混合精度路径,并将 NVFP4 混合方案列为 Blackwell 显卡的推荐选项。在一次持续 120 秒的《博德之门 3》测试中,混合精度方案的渲染帧率为 55.16 FPS,FP8 方案为 54.57 FPS,提升约 1.08%。

DLSS 5 仍是英伟达目前性能开销最高的 DLSS 模型,因此降低神经渲染成本是优化重点。英伟达此前向 Wccftech 表示,DLSS 5 的运行速度已经达到 2026 年 GTC 大会首次演示时的约 5 倍,后续还将继续优化,并计划为 RTX 40 系列显卡提供官方支持。

从当前测试结果看,将现有 FP8 模型部分转换为 NVFP4 尚未带来预期中的大幅性能提升。DLSS 5 的整体性能表现仍取决于模型结构、量化方案及显卡驱动等因素,社区开发者也在继续探索更有效的优化路径。

相关阅读: