开发者推出d4r项目,让AMD RDNA 4显卡通过转译层运行英伟达DLSS 4

RDNA 4 GPU 能够原生处理新版 DLSS 模型所需的 FP8 矩阵运算,因此无需将 FP8 转换为 FP16。

一个名为 d4r 的 GitHub 项目近日为 AMD Radeon RX 9000 系列显卡带来了英伟达 DLSS 4 与 DLSS 4.5 超分辨率支持。该项目由开发者 countervolts 发布,旨在通过软件转译层让 AMD 显卡运行英伟达的 DLSS 库。项目首个版本发布于四天前,最新 0.1.3 版本已于今日上线。

d4r 项目此前已支持 RDNA 3 架构的 RX 7000 系列显卡。最新的 0.1.2 和 0.1.3 版本将支持范围扩展至 RDNA 4 架构,对应 Radeon RX 9070 XT、RX 9070、RX 9070 GRE、RX 9060 XT 和 RX 9060 等型号。这意味着 AMD 最新一代消费级显卡用户可以通过第三方工具调用原本专属于英伟达硬件的 DLSS 超分辨率技术。

该项目的核心原理是利用 ZLUDA 兼容层,将 DLSS 库中的 CUDA 调用转译为 AMD GPU 可执行的指令,并配合自研的 RDNA 架构内核替换部分高负载计算。ZLUDA 是一个旨在让 CUDA 应用在非英伟达硬件上运行的开源兼容层,此前主要被用于在 AMD 显卡上运行部分 CUDA 加速的 AI 与计算任务。d4r 在此基础之上,针对 DLSS 的推理流程进行了专门适配。

值得注意的是,RDNA 4 GPU 能够原生处理新版 DLSS 模型所需的 FP8 矩阵运算,因此无需将 FP8 转换为 FP16。FP8 是一种低精度浮点格式,在保持模型推理质量的同时可显著降低显存占用与计算开销。英伟达在 DLSS 4 中引入了基于 FP8 的模型推理路径,而 AMD RDNA 4 架构在硬件层面加入了对 FP8 的原生支持,这为转译层省去了一步精度转换操作,理论上有利于提升运行效率。

然而,该项目仍处于早期实验阶段。开发者表示,目前仅在 RX 7700 XT(RDNA 3)上进行过实际测试。在 RX 7700 XT 上,DLSS 4.5 在《寂静岭:Townfall》1440p 质量模式下仅跑出 49.3 FPS,低于 DLSS 4 的 68.1 FPS 和 DLSS 3 的 71.9 FPS,也落后于 FSR 4 的 76 FPS。这一数据表明,尽管转译层在功能层面实现了对 DLSS 的调用,但在性能表现上仍与 AMD 自家的 FSR 4 存在明显差距,更不及原生 DLSS 在英伟达硬件上的运行效率。

此外,d4r 目前仅支持超分辨率功能,不支持帧生成、光线重建或 DLSS 5 神经渲染。这意味着用户无法通过该工具获得 DLSS 完整的功能集,仅能在支持超分辨率的游戏中使用。该项目还依赖 Linux 与 Proton 环境,无法在 Windows 下运行。Proton 是 Valve 为 Steam Deck 及 Linux 平台开发的 Windows 游戏兼容层,基于 Wine 构建。这一限制大幅缩小了潜在用户群体,因为绝大多数 PC 游戏玩家仍以 Windows 为主要平台。

从行业视角看,d4r 项目反映出两个趋势。其一,英伟达 DLSS 生态的封闭性与 AMD 显卡用户对高质量超分辨率技术的需求之间存在张力,第三方转译层成为部分开发者和用户探索的路径。其二,ZLUDA 等 CUDA 兼容层的持续演进,正在让跨硬件运行英伟达专有技术从理论走向实践,尽管性能损耗仍然显著。此前已有开发者打造第三方工具让 AMD 显卡运行 DLSS 5,并在一天内两次更新使性能提升 74%,显示出该领域迭代速度较快。

目前 d4r 尚不具备生产环境可用性,其性能表现、功能完整度与平台兼容性均有待改善。对于关注 GPU 互操作性与超分辨率技术演进的开发者而言,该项目提供了一个观察 CUDA 转译层能力边界与 RDNA 架构 FP8 硬件特性的实验样本。后续版本能否缩小与 FSR 4 的性能差距,以及是否会将支持范围扩展至 Windows 平台,值得持续关注。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
豪威发布常开型视觉AI协处理器OAX7700,停车监控方案功耗降至现有方案3%
上一篇 1天前
System76 发布 Thelio Mira AI 工作站,支持双路 NVIDIA RTX PRO Blackwell 6000
下一篇 2026年9月10日 上午11:38

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部