Компания NVIDIA официально представила Nemotron 3 Nano — инновационную гибридную модель на архитектуре Mixture-of-Experts (MoE) с 30 миллиардами параметров. Несмотря на внушительный общий объем, в каждый момент времени активными являются лишь около 3,6 млрд параметров, что позволяет достичь феноменальной скорости работы при сохранении высокого уровня интеллекта. Модель получила контекстное окно объемом в 1 миллион токенов, что делает её идеальным инструментом для глубокого анализа длинных документов и сложных агентских сценариев.

Ключевой особенностью релиза стала возможность полноценного запуска и дообучения на домашнем оборудовании, например на видеокартах RTX 3090 или RTX 4090 с 24 ГБ видеопамяти. Благодаря оптимизации от команды Unsloth, модель доступна в формате GGUF, который позволяет использовать квантование (сжатие) без критической потери логики. В 4-битном варианте (Q4_K_M) модель вместе с рабочим контекстом полностью умещается в 24 ГБ VRAM, обеспечивая при этом производительность, сопоставимую с гораздо более тяжелыми ИИ-системами.

Для локального запуска разработчики рекомендуют использовать актуальные сборки llama.cpp с параметрами -ngl 99 для полного переноса вычислений на GPU. Особое внимание стоит уделить поддержке токенов рассуждения, которые позволяют модели выстраивать логическую цепочку перед ответом. По результатам тестов, Nemotron 3 Nano показывает 3.3-кратное превосходство в пропускной способности над конкурентами своего класса, такими как Qwen3-30B, при этом опережая их в тестах на кодинг (HumanEval: 78.05%) и математику (MATH: 82.88%).