DLSS 5正式亮相之后,不少玩家都发现了一个棘手问题:这套新一代神经渲染管线的开销和传统DLSS完全不一样。神经渲染环节放在超分辨率之后,直接作用于显示器输出分辨率,算力开销跟着最终画面尺寸走,哪怕降低游戏内部渲染分辨率,也很难换回高帧率。
在官方还没有给出优化方案的情况下,模组社区只用不到两周,就摸索出两套独立的改造思路,重新调整渲染管线来削减DLSS5的性能损耗。除此之外,开发者还在尝试把DLSS5相关能力移植到RTX20/30/40等前代显卡上。不过这些全部属于玩家自制模组,存在画质妥协、硬件门槛,同时还有游戏反作弊风险。

DLSS 5原生架构的性能痛点
先简单理清原版DLSS5的性能短板。
原版管线顺序:游戏渲染 → DLSS超分辨率放大 → 在最终输出分辨率上执行神经渲染。
神经渲染在放大后的高分辨率画面上运算,所以哪怕你调低游戏内部渲染分辨率,这一步的算力成本几乎不会下降。之前的基准测试数据很直观:RTX5090在4K开启DLSS5,帧率直接从192帧跌到76帧;RTX5060Ti 1440p下,129帧直接降至46帧。即便开启超分辨率,性能仅恢复9%,优化收益远不如以往DLSS版本。

模组社区的改造核心目标,就是降低神经渲染阶段需要处理的像素总量,或是直接把这部分算力负载转移出去。
方案一:Neural Upstream,把神经渲染前置到超分之前
第一种方案名为Neural Upstream,属于ReShade插件,可以借助DLSS5-Autopilot工具一键部署。
- GitHub:https://github.com/matiasLombo/neural-upstream
- GitHub:https://github.com/Kizzuwatnaa/DLSS5-Autopilot
核心改动是调换渲染管线顺序。
原生顺序:渲染 → DLSS超分辨率放大 → 高分辨率画面神经渲染
魔改后顺序:渲染 → 在原始渲染分辨率做神经渲染 → DLSS超分辨率放大 → 输出画面
逻辑很简单:神经网络在尺寸更小的原始渲染帧上运算,处理像素数量大幅减少。举个例子,4K分辨率、DLSS质量模式下,原本要处理830万像素,前置之后仅需要处理约270万像素,算力开销直接下降。
社区在Reddit英伟达板块放出实测:RTX4080运行《刺客信条:影》4K,启用这套方案后,神经渲染的耗时对应的帧率从32FPS提升至13FPS,性能提升大约61%。《潜行者2》、《赛博朋克2077》、《GTA V增强版》也测出类似的性能增益。OptiScaler工具也开发了同类实验性功能,底层原理一致。
⚠️ 不可忽视的画质代价
这个方案的短板同样明显。神经网络输入的画面像素变少,能够获取的图像信息随之减少。英伟达之所以原生把神经渲染放在管线末尾,就是为了拿到最高保真度的画面。DLSS5本身就存在恐怖谷效应,前置管线之后,图像细节、光影还原会进一步下降,画质损失需要玩家自行权衡。
方案二:MGPU Bridge,双显卡分工,一张玩游戏、一张跑神经渲染
第二套方案来自开发者Marcelo Guibout,项目名称MGPU Bridge,同样基于ReShade插件实现。
- GitHub:https://github.com/maohgad-web/Neural-coprocessor
思路非常大胆:游戏画面在第一张显卡完成渲染,DLSS5神经渲染这一整套高负载环节,完全交给第二张独立GPU来运算。
DLSS5神经渲染属于画面后处理阶段,接收完整画面帧,输出处理完成的帧,理论上并不强制要求和渲染游戏的是同一块显卡。有意思的是,英伟达最早演示DLSS5原型的时候,就采用过类似架构,需要两张RTX5090,其中一张专门负责神经渲染。
社区采用两块RTX 5060 Ti 16GB做测试,《血之黎明行者》1080p测试结果:
| DLSS模式 | DLSS5关闭 | 在渲染显卡运行神经渲染 | 第二张显卡单独运行神经渲染 |
|---|---|---|---|
| DLAA | 67-70 | 44 | 67-70 |
| Quality | 98-99 | 54-55 | 91 |
| Performance | 127-131 | 59 | 106-107 |
| Ultra Performance | 172 | 69-71 | 157 |
数据能看出巨大差距:神经渲染在渲染主卡运行时,会吃掉35%60%的性能;负载转移到第二张显卡后,性能损耗仅0%17%。而且主显卡因为负载降低,温度直接下降21℃。这套方案让人联想到早年专门用来跑PhysX物理运算的独立加速卡。
⚠️ 极高的硬件限制
MGPU Bridge有硬性门槛:必须配备两张独立显卡+两台显示器,每张显卡分别连接一台显示器,神经渲染输出画面只能由执行运算的显卡输出。图像最终效果,和英伟达原生DLSS5管线也会存在差异。双显卡的硬件成本很高,很难成为普通玩家的通用方案,更多是一种有趣的技术探索。
额外尝试:DLSS Unlocked,为RTX20/30/40老卡解锁神经渲染
在性能优化之外,模组开发者ShyVortex推出DLSS Unlocked项目,整合OptiScaler_DLSSNR与DLSS Enabler,尝试在图灵、安培、Ada架构显卡(Windows与Linux平台)上启用神经渲染、多帧生成功能。
- RTX20、30系列:生成帧依靠AMD FSR3.1实现,并非英伟达原生管线
- RTX40系列:首帧使用原生DLSS-G,剩余生成帧由FSR3.1接管
重要提示:出于版权法律原因,项目本身不会提供DLSS5的DLL文件,需要使用者自行准备修补后的DLL。
⚠️ 所有模组通用重大风险提醒
这类方案全部依靠DLL注入、渲染钩子实现,存在明确的使用风险:
- 反作弊风险:带有EAC、BattlEye等反作弊的联机游戏,不要加载这类模组,极易触发账号封禁。仅适合纯单机无反作弊游戏测试。
- 文件安全风险:此前DLSS Swapper项目作者就发出过恶意软件警告,网上流传的DLL文件有可能被植入木马,务必谨慎甄别来源。
- 非官方:不属于英伟达正式功能,后续显卡驱动更新,很可能直接导致模组失效、闪退或者画面异常。



0条评论