Пропускная способность PCIe больше не проблема благодаря NVENC

Пропускная способность PCIe больше не проблема благодаря NVENC

Разработчик Shootthesound представил открытую библиотеку torch-nvenc-compress для преодоления ограничений пропускной способности интерфейса PCIe в потребительских видеокартах без коннектора NVLink. Проект использует аппаратные блоки кодирования NVENC и декодирования NVDEC для сжатия активаций и кэша KV в реальном времени. В основе метода лежит предварительная обработка данных с помощью анализа главных компонент и отсечения рангов, что позволяет кодеку эффективно сжимать тензорные данные. Использование прямой обертки Direct Video Codec SDK устраняет накладные расходы субпроцессов, обеспечивая нулевое копирование из тензоров CUDA.

bandwidth amplification

Инструмент демонстрирует коэффициент сжатия без потерь до 6,1x для диффузионных моделей и 2,7x для кэша KV языковых моделей. Аппаратное перекрытие параллельных путей достигает 67% от теоретического максимума при одновременном выполнении матричных вычислений и кодирования. На видеокарте RTX 5090 с использованием трех движков NVENC скорость кодирования составляет 0,180 миллисекунды на кадр, что дает прирост производительности.

Для тестирования пропускной способности библиотеки заявлены следующие аппаратные и программные требования:

  • Наличие двух видеокарт RTX 4090 или RTX 5090 в одной системе
  • Материнская плата с поддержкой интерфейса PCIe peer-to-peer
  • Установленная среда выполнения Python
  • Библиотека PyTorch с поддержкой CUDA
  • Установленный пакет Direct Video Codec SDK
ЦЕНТР ОБСУЖДЕНИЙ

@GameGPU_com

Присоединяйтесь к обсуждению, делитесь результатами своих бенчмарков и спорьте о производительности железа в X.

Обсудить в X

Игры

Железо