Persistent State Machines: формальная модель внимания LLM с проверкой на FPGA
На Zenodo опубликована запись «Persistent State Machines: Complete Mathematical Proofs and Vivado Implementation Synthesis» версии 8.0, формальная дискретная модель оператора внимания (attention) в больших языковых моделях. Идея в том, что вычисление рассылается на стационарные ячейки в памяти, каждая из которых выполняет локальный детерминированный переход состояния (finite-state transition), а не централизованное умножение матриц. Авторы приводят полные математические доказательства: границы ошибки квантования, явную многофазную конструкцию дискретного Softmax при заданном допущении об ограниченности логитов, эквивалентность детерминированному конечному автомату с пространственной факторизацией и принадлежность классу сложности DSPACE(O(n)).
Работоспособность архитектуры проверена на двух конфигурациях программируемой логики (FPGA). Первая, «Low-Power Evaluation» на чипе Zynq-7000 xc7z020: полный массив из 1024 ячеек (при размерности d=128), реализованный как блок вне контекста (out-of-context). Разведённую после трассировки схему (post-route netlist) снабдили файлом активности переключений (SAIF) из пост-трассировочной функциональной симуляции, она показала, что аппаратное самоограничение активации (self-activation gating) держит переключения в узком числе ячеек. Оценённая динамическая мощность базовой логики, ниже 1,0 мВт, что соответствует нормированной динамической энергии 3,81 × 10⁻⁵ пДж на операцию.
Вторая конфигурация, интеграция в SoC с PCIe на чипе UltraScale+ xcvu9p: подмассив из 256 ячеек, представляющий одну голову внимания (attention head), встроен в полноценную систему-на-кристалле с шиной AMBA AXI4 и мостом AMD Xilinx PCIe Gen3 x1 (XDMA v4.2), запущенную в среде AWS Cloud FPGA Developer. Таймирование закрылось на едином системном тактовом сигнале 62,5 МГц с запасом (Worst Negative Slack) +1,854 нс; вся SoC заняла лишь 0,67% логических ячеек кристалла и 0,00% DSP-блоков, что авторы трактуют как хороший запас для масштабирования.
Функциональная симуляция более чем на тысяче случайных векторов дала побитовое совпадение с программной эталонной моделью с фиксированной точкой. При этом сами авторы оговаривают: все цифры по мощности и энергии, оценки инструментов синтеза для синтезированной логики, физических измерений на реальной плате не проводилось, а энергозатраты внешней памяти на уровне системы в расчёт намеренно не включены. К записи привязана поданная японская патентная заявка № 2026-177318.
Ключевые факты
- Persistent State Machines, формальная дискретная модель внимания LLM на детерминированных ячейках-автоматах; доказаны границы ошибки квантования, конструкция дискретного Softmax, эквивалентность конечному автомату и принадлежность классу DSPACE(O(n))
- На Zynq-7000 xc7z020 массив из 1024 ячеек (d=128) показал по симуляции динамическую мощность ниже 1,0 мВт и энергию 3,81 × 10⁻⁵ пДж на операцию
- На UltraScale+ xcvu9p полноценная SoC с 256-ячеечной головой внимания, AXI4 и PCIe Gen3 закрыла таймирование на 62,5 МГц (WNS +1,854 нс), заняв 0,67% логики и 0% DSP-блоков кристалла
- Более тысячи случайных тестовых векторов дали побитовое совпадение с программной эталонной моделью с фиксированной точкой
- Подана японская патентная заявка № 2026-177318; все цифры по энергии, оценки синтезатора, без измерений на физической плате
Почему это важно
Оператор внимания, главный источник вычислительной и энергетической нагрузки в инференсе LLM. Здесь предлагается не очередная программная оптимизация, а формально доказанная дискретная модель, которую можно напрямую реализовать в цифровой логике: авторы не просто утверждают эффективность, а дают математические гарантии корректности (границы ошибки квантования, эквивалентность конечному автомату) вместо чисто эмпирических приближений.
Кому это важно
Инженерам, проектирующим ASIC- и FPGA-ускорители инференса, и исследователям систем машинного обучения, которые ищут альтернативы матричным ускорителям для внимания, в частности, архитектуры на основе вычислений в памяти (in-memory computing) с низким энергопотреблением.
Как это применить
Это исследовательская запись с доказательствами и синтезируемым дизайном под Vivado, а не готовый продукт или библиотека. Ознакомиться можно через саму Zenodo-запись; на работу уже подана патентная заявка в Японии, так что коммерческое использование архитектуры, вероятно, потребует лицензирования.
Можно ли доверять
Запись самостоятельно опубликована на Zenodo и уже дошла до восьмой версии, но в аннотации не названы ни авторы, ни организация, ни статус рецензирования, ни площадка публикации. Все цифры по мощности и энергии, оценки инструментов синтеза для смоделированной логики; измерений на физической плате не проводилось, и это прямо признают сами авторы. Сравнения с существующими ускорителями внимания (GPU, TPU или другие FPGA-решения) в записи нет, так что оценить реальное преимущество архитектуры по этим данным нельзя.
Риски и подводные камни
Заявленная экономичность подтверждена только симуляцией, а не измерениями на живом железе; отсутствие сравнения с базовыми решениями не позволяет судить, насколько подход лучше существующих. Многократные ревизии записи (версия 8.0) и отсутствие институциональной привязки затрудняют независимую проверку. Патентная заявка может ограничить свободное использование архитектуры в будущих продуктах.