Компания NVIDIA официально поддерживает кластеризацию своих систем DGX Spark только в конфигурации из двух узлов. Однако разработчику из сообщества Autoscriptlabs этого показалось недостаточно, и он успешно объединил три станции в единый кластер с треугольной топологией (Mesh), используя прямые соединения QSFP. Главным препятствием стала библиотека коммуникаций NVIDIA NCCL, которая не умеет "из коробки" работать с такой сложной маршрутизацией без коммутатора.

Проблема заключалась в том, что при соединении трех узлов напрямую каждый линк оказывается в своей подсети (например, связь A-B в подсети 100.x, а A-C — в 101.x). Стандартный IB-плагин NCCL выбирает один интерфейс и ошибочно пытается достучаться до всех пиров через него, игнорируя таблицы маршрутизации ядра. Попытки настройки через переменные окружения NCCL_CROSS_NIC или XML-топологию результата не дали.
Решением стала разработка собственного сетевого плагина net_v8 (около 1500 строк кода на C). Автор реализовал полную поддержку RDMA через ibverbs и добавил TCP-слой для обмена данными ("рукопожатия"). Ключевая особенность плагина — функция mesh_connect, которая анализирует IP-адрес пира, находит локальный интерфейс в той же подсети и создает соединение именно на нем. Итог впечатляет: стабильная скорость более 8 ГБ/с по RDMA и успешно работающий распределенный ИИ-инференс на "неподдерживаемой" конфигурации.