Энтузиаст с популярного форума Reddit поделился впечатляющими результатами нестандартного использования современных видеокарт. Ему удалось задействовать простаивающие RT-ядра, которые обычно отвечают за аппаратную трассировку лучей в играх, для ускорения работы локальных нейросетей на архитектуре MoE. Для тестов использовался графический ускоритель GeForce RTX 5070 Ti от корпорации NVIDIA. Автор перевел токены в трехмерное пространство, позволив аппаратному обеспечению искать нужных экспертов внутри модели.
Результаты такого подхода оказались поистине поразительными. Скорость маршрутизации токенов выросла в 218 раз, а потребление видеопамяти для этой задачи снизилось в 731 раз по сравнению со стандартными методами. При этом потеря качества ответов составила всего полтора процента. Весь исходный код своего проекта разработчик уже выложил в открытый доступ на платформе GitHub, а подробная научная статья с описанием новой методологии размещена в электронном архиве Zenodo.
В ходе работы автор сделал еще одно неожиданное открытие, касающееся самой природы нейросетей. Протестировав три разные языковые модели, включая популярную DeepSeek, он выяснил, что внутренние эксперты искусственного интеллекта не специализируются на конкретных темах вроде науки или программирования. Вместо этого они делят между собой синтаксические задачи: один блок обрабатывает пунктуацию, другой отвечает за смысловые слова, а третий берет на себя исключительно служебные части речи.