# 英伟达 DLSS 5 混合精度 Mod 测试：RTX 50 系列性能仅提升 1% 至 2%

- 来源：IT之家（RSS）
- 发布时间：2026-09-12 10:28
- AIHOT 分数：28
- AIHOT 链接：https://aihot.news/items/cmtxssi1c0405rop2t615yhn0
- 原文链接：https://www.ithome.com/1/001/524.htm

## AI 摘要

Mod 开发者将 FP8 与 NVFP4 混合精度应用于英伟达 DLSS 5 神经渲染模型，在 RTX 50 系列显卡上仅将神经渲染阶段耗时降低约 1% 至 2%，开发者称在 Blackwell 架构上改进"非常有限"。

## 正文

IT之家 9 月 12 日消息，在英伟达 DLSS 5 神经渲染 DLL 文件流出后，各路民间大神纷纷下场进行调试和优化，还有 Mod 开发者尝试通过降低模型推理成本以提升游戏性能。

根据 X 用户 SwurvGaming 分享的情报，有 Mod 开发者将 FP8 与 NVFP4 混合精度应用于 DLSS 5 神经渲染模型，并在 RTX 50 系列显卡上运行。

不过，该方案在 4K 分辨率下仅将神经渲染阶段耗时降低约 1% 至 2%，开发者称其在 Blackwell 架构上的改进“非常有限”。

由于英伟达 Blackwell 架构第五代 Tensor Core 原生支持 NVFP4，开发者尝试将部分 DLSS 5 计算从 FP8 切换至 NVFP4，以降低推理开销。

需要注意的是，1% 至 2% 的数据仅代表 DLSS 5 神经渲染阶段耗时的下降，并非整款游戏的帧率提升。

此次实验由 OptiScaler-DLSSNR-PreSR-Multipass 项目引入，相关更新出现在 0.7.1 版本。项目发布说明还指出，不支持的模型形状仍会回退至 FP8，因此混合精度方案并不能覆盖全部计算过程。

NVFP4 是英伟达面向神经网络推理推出的低精度数据格式，相比 FP8 可减少内存需求，并利用 Blackwell Tensor Core 的原生加速能力。

IT之家注：FP8 和 NVFP4 分别表示 8 位浮点格式及英伟达推出的 4 位浮点格式，后者需要配合量化和优化技术才能有效发挥作用。

项目开发者随后在 0.7.2 版本中进一步优化混合精度路径，并将 NVFP4 混合方案列为 Blackwell 显卡的推荐选项。在一次持续 120 秒的《博德之门 3》测试中，混合精度方案的渲染帧率为 55.16 FPS，FP8 方案为 54.57 FPS，提升约 1.08%。

DLSS 5 仍是英伟达目前性能开销最高的 DLSS 模型，因此降低神经渲染成本是优化重点。英伟达此前向 Wccftech 表示，DLSS 5 的运行速度已经达到 2026 年 GTC 大会首次演示时的约 5 倍，后续还将继续优化，并计划为 RTX 40 系列显卡提供官方支持。

从当前测试结果看，将现有 FP8 模型部分转换为 NVFP4 尚未带来预期中的大幅性能提升。DLSS 5 的整体性能表现仍取决于模型结构、量化方案及显卡驱动等因素，社区开发者也在继续探索更有效的优化路径。
