NVIDIA показала рекордную производительность в DeepSeek V4 на чипах Blackwell Ultra

NVIDIA показала рекордную производительность в DeepSeek V4 на чипах Blackwell Ultra

Состоялся официальный релиз новой генеративной модели DeepSeek V4, и компания NVIDIA сразу же заявила об обеспечении полноценной поддержки новинки на базе графических ускорителей архитектуры Blackwell. Разработчики выпустили две версии нейросети: масштабную модель Pro, насчитывающую 1,6 триллиона параметров, и более быструю версию Flash на 284 миллиарда параметров. Обе конфигурации поддерживают окно контекста объемом до одного миллиона токенов.

Представители NVIDIA продемонстрировали предварительные результаты тестов на флагманских чипах уровня GB300, где скорость генерации достигла около 3500 токенов в секунду. Подобный уровень производительности обеспечивается за счет внедрения технологий NVFP4 и алгоритмов квантования FP4. Эти нововведения позволили существенно снизить задержки выборки и общую нагрузку на подсистему памяти серверов при обработке масштабных задач.

Сама нейросеть DeepSeek V4 отличается глубокой оптимизацией вычислительных ресурсов, потребляя всего 27% вычислительных операций и 10% кэша по сравнению с прошлыми решениями при работе с максимальным контекстом. Примечательно, что формат инструкций MXFP4 также заявлен для перспективных серверных процессоров Huawei Ascend 950PR и Ascend 950DT. Это гарантирует аппаратную совместимость новой модели с разрабатываемыми китайскими ускорителями, выход которых ожидается в текущем году.

ЦЕНТР ОБСУЖДЕНИЙ

@GameGPU_com

Присоединяйтесь к обсуждению, делитесь результатами своих бенчмарков и спорьте о производительности железа в X.

Обсудить в X

Игры

Железо