Следующее поколение ускорителей NVIDIA Feynman, запланированное к выходу в 2028 году после архитектуры Rubin, впервые интегрирует блоки LPU от Groq. Это внедрение привнесет детерминированный, управляемый компилятором поток данных и статическое планирование с низкой задержкой. Такой подход обеспечит высокую утилизацию вычислительных мощностей (MFU) в сценариях с малым размером батча, что даст колоссальный прирост производительности в задачах инференса, недостижимый для традиционных GPU-архитектур.

Инженеры столкнулись с жестким физическим барьером: масштабирование SRAM фактически остановилось. Площадь ячейки памяти почти не изменилась при переходе с N5 (~0,021 мкм²) на N3E, и даже на узле N2 плотность составляет всего ~38 Мб/мм², что делает размещение кэша на монолитном кристалле на базе TSMC A16 экономически неэффективным. Использование дорогой площади передовых пластин под плохо масштабируемую память становится слишком затратным.
Решением станет применение раздельных кристаллов SRAM, установленных поверх основного вычислительного чипа по принципу AMD X3D. Технология Backside Power Delivery (питание с обратной стороны) в техпроцессе A16 упрощает гибридное соединение слоев, устраняя проблемы с маршрутизацией сигналов на лицевой стороне. В итоге ядра Feynman будут сочетать логику на передовом техпроцессе для максимальной плотности и стекируемую SRAM на более дешевом узле. Это сохранит HBM для задач обучения, а многослойный кэш обеспечит пропускную способность для инференса, что фактически уничтожит шансы на успех для сторонних ASIC-решений.