NVIDIA Nemotron 3 Nano: как запустить топовый ИИ на одной RTX 4090

Компания NVIDIA официально представила Nemotron 3 Nano — инновационную гибридную модель на архитектуре Mixture-of-Experts (MoE) с 30 миллиардами параметров. Несмотря на внушительный общий объем, в каждый момент времени активными являются лишь около 3,6 млрд параметров, что позволяет достичь феноменальной скорости работы при сохранении высокого уровня интеллекта. Модель получила контекстное окно объемом в 1 миллион токенов, что делает её идеальным инструментом для глубокого анализа длинных документов и сложных агентских сценариев.

NVIDIA Nemotron 3 Nano gamegpu

Ключевой особенностью релиза стала возможность полноценного запуска и дообучения на домашнем оборудовании, например на видеокартах RTX 3090 или RTX 4090 с 24 ГБ видеопамяти. Благодаря оптимизации от команды Unsloth, модель доступна в формате GGUF, который позволяет использовать квантование (сжатие) без критической потери логики. В 4-битном варианте (Q4_K_M) модель вместе с рабочим контекстом полностью умещается в 24 ГБ VRAM, обеспечивая при этом производительность, сопоставимую с гораздо более тяжелыми ИИ-системами.

NVIDIA Nemotron 3 Nano bench gamegpu

Для локального запуска разработчики рекомендуют использовать актуальные сборки llama.cpp с параметрами -ngl 99 для полного переноса вычислений на GPU. Особое внимание стоит уделить поддержке токенов рассуждения, которые позволяют модели выстраивать логическую цепочку перед ответом. По результатам тестов, Nemotron 3 Nano показывает 3.3-кратное превосходство в пропускной способности над конкурентами своего класса, такими как Qwen3-30B, при этом опережая их в тестах на кодинг (HumanEval: 78.05%) и математику (MATH: 82.88%).

ЦЕНТР ОБСУЖДЕНИЙ

@GameGPU_com

Присоединяйтесь к обсуждению, делитесь результатами своих бенчмарков и спорьте о производительности железа в X.

Обсудить в X

Игры

Железо