Тестирование серверной сборки стоимостью 1500$ каналом Digital Spaceport показало особенности распределения нагрузки при использовании трех подержанных видеокарт RTX 3060 против одной флагманской RTX 3090. Аппаратная конфигурация включала процессор Ryzen 9 5950X, материнскую плату Gigabyte B550 Eagle, 16 ГБ оперативной памяти DDR4, накопитель NVMe на 512 ГБ, систему жидкостного охлаждения и блок питания мощностью 1000 Вт. На платформе Proxmox через контейнер LXC запускались модели Gemma 4 26B A4B и Qwen 3.6 27B с использованием инструмента llama.cpp.
В ходе замеров скорости обработки промптов три карты RTX 3060 продемонстрировали результаты, сопоставимые с показателями RTX 3090. На модели Gemma 4 при контексте 4K связка из трех карт выдала около 3200 токенов в секунду против 4095 у одиночной карты, а на контексте 128K разрыв сократился до 2026 против 2109 токенов в секунду. На плотной модели Qwen 3.6 производительность составила от 624 до 1055 токенов в секунду для трех карт и от 754 до 831 для одной RTX 3090, что делает бюджетный массив эффективным для агентских задач.
Этап генерации токенов выявил двукратное преимущество одиночной RTX 3090 из-за более высокой пропускной способности шины памяти. На модели Gemma 4 скорость составила 130–133 токенов в секунду против 64–68 у массива RTX 3060, а на плотной модели Qwen 3.6 связка из трех карт показала минимальный результат в 17 токенов в секунду против 38–40 у флагмана. Энергопотребление системы с тремя картами составило от 580 до 600 Вт, при этом использование райзеров PCIe Gen3 x1 не ограничивало работу из-за особенностей конвейерного разделения слоев в llama.cpp.