Архитектура AMD RDNA4 способна запускать алгоритмы DLSS 5 Neural Rendering

Архитектура AMD RDNA4 способна запускать алгоритмы DLSS 5 Neural Rendering

Энтузиастам удалось запустить экспериментальную библиотеку DLSS 5 Neural Rendering на видеокарте GeForce RTX 2070 Max Q под управлением Linux через Proton без применения ReShade. Перехват вызовов в цепочке NGX и Direct3D 12 через специальный прокси позволил сохранить базовый конвейер рендеринга игры, выполнить библиотеку nvngx dlssnr 310.8 и передать обратно кадр с нейронной обработкой. Анализ одного кадра выявил запуск 174 вычислительных ядер CUDA и 176 скомпилированных модулей CUBIN, среди которых обнаружены архитектурные блоки Swin и ViT, проекции QKV, а также специализированные ядра под формат FP8 E4M3.

Причиной низкой производительности на архитектуре Turing оказалось отсутствие аппаратной поддержки вычислений с плавающей запятой FP8. Видеокарта вынуждена преобразовывать инструкции FP8 в усложненный путь FP16, что сопровождается распаковкой, повышенным давлением на регистровый файл, активным сбросом данных в стек и выполнением почти 11.9 тысяч статических инструкций против 2.6 тысяч в чистом коде FP16. При этом прямое тестирование шестнадцати блоков QKV размером 3600x512x1536 показало, что сама конвертация весов E4M3 в FP16 занимает лишь 0.33 миллисекунды, а итоговая разница времени выполнения составила 4.45 миллисекунды против 4.20 миллисекунды у нативных весов FP16 с сохранением побитовой идентичности.

Подобная архитектура открывает прямую возможность адаптации DLSS 5 Neural Rendering для графических ускорителей AMD на базе архитектуры RDNA4, включая Radeon RX 9070 XT. Видеокарты новой серии обладают аппаратной поддержкой матричных вычислений FP8 в формате E4M3, что устраняет необходимость эмуляции CUDA. Переупаковка весовых коэффициентов и запуск математических операций трансформеров через интерфейсы HIP, rocWMMA или Vulkan позволят графическим процессорам AMD обрабатывать нейронный проход на уровне моделей GeForce RTX 5070.

Источник

ЦЕНТР ОБСУЖДЕНИЙ

@GameGPU_com

Присоединяйтесь к обсуждению, делитесь результатами своих бенчмарков и спорьте о производительности железа в X.

Обсудить в X

Игры

Железо