Разработчик запустил ИИ-модель на микроконтроллере ESP32-S3 за $10

Разработчик запустил ИИ-модель на микроконтроллере ESP32-S3 за $10

Разработчик, известный под ником SlvDev, показал, что языковую модель можно запустить не только на ноутбуке или смартфоне, но и на дешёвом микроконтроллере ESP32-S3 стоимостью меньше $10. Процесс он задокументировал на GitHub и показал на YouTube-канале Better Stack; материал о проекте 4 августа 2026 года опубликовал Tobias Mann, редактор по системам издания The Register.

ESP32-S3 создавался для датчиков и IoT-устройств, а не для генеративного ИИ: у чипа всего 520 КБ SRAM и 8 МБ псевдо-SRAM (PSRAM). О крупных моделях вроде DeepSeek V4 Flash речи не шло, поэтому SlvDev выбрал TinyStories, модель на 28,9 млн параметров, изначально разработанную Microsoft Research. Даже она при 16-битной точности требует около 60 МБ памяти, которой у чипа нет.

Чтобы уместить модель, разработчик применил две техники. Во-первых, квантование, снижение точности весов (например, с 16 бит до 8 или 4), которое дало 75-процентное сокращение объёма памяти относительно исходных 60 МБ: веса стали занимать 14,9 МБ. Во-вторых, метод per-layer-embedding (PLE), позаимствованный у семейства моделей Google Gemma: около 25 млн параметров (примерно 12 МБ) вынесли во флеш-память чипа (ESP32-S3 можно купить с флеш-накопителем до 16 МБ), оставив в оперативной памяти лишь голову вывода, эмбеддинги и KV-кэш. В итоге модель занимает в памяти чипа не 14,9 МБ, а около 2 МБ, а активации обрабатываются в тех самых 520 КБ SRAM.

В результате SlvDev получил на микроконтроллере скорость 9,88 токена в секунду, быстрее, чем читает средний человек.

Что умеет модель. По оценке издания, TinyStories на ESP32, это скорее демонстрация возможности, чем практический инструмент: модель умеет генерировать короткие, довольно связные истории, но не годится ни для чат-бота, ни для генерации кода, ни для работы в качестве агента. Есть и другая модель для микроконтроллеров, Barista: она отвечает на вопросы примерно вдвое быстрее TinyStories, но только на темы, связанные с приготовлением эспрессо.

Автор материала отмечает, что для устройств помощнее, вроде Raspberry Pi или смартфона, есть модели куда практичнее. Так, вышедшая ещё в апреле модель Google Gemma 4-E2B-it на 5,1 млрд параметров с теми же техниками квантования и PLE-офлоада занимает чуть больше гигабайта памяти при 4-битных весах, а при более агрессивном квантовании и офлоаде, около 500 МБ. По оценке автора, такой модели уже достаточно, чтобы работать локальным чат-ботом и управлять локальными агентами (например, вести календарь пользователя), избавляя от зависимости от OpenAI или Anthropic, при условии, что пользователь готов мириться с редкими галлюцинациями.

Ключевые факты

  • Разработчик SlvDev запустил модель TinyStories (28,9 млн параметров, изначально от Microsoft Research) на микроконтроллере ESP32-S3 дешевле $10; проект задокументирован на GitHub и показан на YouTube-канале Better Stack.
  • Комбинация квантования (сокращение памяти на 75%, до 14,9 МБ) и офлоада части весов во флеш-память через технику per-layer-embedding (PLE, позаимствована у Google Gemma) сжала модель до ~2 МБ в оперативной памяти чипа.
  • Скорость инференса на микроконтроллере, 9,88 токена в секунду.
  • Итоговая модель годится только на генерацию коротких историй: для чат-бота, кода или агента её использовать нельзя. Отдельная модель Barista отвечает на вопросы про эспрессо вдвое быстрее TinyStories, но не умеет ничего другого.
  • Для практичных локальных ассистентов автор указывает на модели покрупнее, например, Google Gemma 4-E2B-it (5,1 млрд параметров, около 1 ГБ при 4-битном квантовании), которая уже способна работать чат-ботом и управлять локальными агентами вроде календаря.

Почему это важно

Материал показывает, что техники сжатия моделей, квантование весов и офлоад части параметров в более медленную память (per-layer-embedding, PLE), одинаково хорошо масштабируются вниз, вплоть до микроконтроллера ценой в чашку кофе. Те же приёмы, что применяют для запуска гигантских моделей вроде DeepSeek V3 с офлоадом на NVMe-накопители, здесь уместили крошечную модель в 520 КБ SRAM.

Кому это важно

Инженерам embedded-систем и IoT, которые рассматривают простейшую генерацию текста для устройств без выделенного ИИ-чипа; хоббистам, экспериментирующим с локальными моделями на дешёвом железе; разработчикам edge-ИИ, которым интересны техники сжатия моделей для более крупных проектов на Raspberry Pi или смартфонах.

Как это применить

Проект SlvDev задокументирован на GitHub и показан на YouTube-канале Better Stack, то есть код и инструкции доступны для повторения. Связка «квантование до 4, 8 бит плюс PLE-офлоад части весов во флеш» применима к любому ESP32-S3 с флеш-памятью до 16 МБ, но результат годится максимум для генерации коротких историй или узкоспециализированного бота вроде Barista, не для чат-бота или агента общего назначения. Для практичного локального ассистента нужно железо помощнее (Raspberry Pi, смартфон) и модель уровня Gemma 4-E2B-it.

Можно ли доверять

Источник, The Register, статья с указанным автором (Tobias Mann, Systems Editor) и датой публикации. Заявка подкреплена ссылками на GitHub-репозиторий проекта и видео на YouTube-канале Better Stack, то есть первоисточники, по которым можно проверить цифры самостоятельно, названы прямо в статье. Это обычный технический репортаж, а не материал из юмористической рубрики издания.

Риски и подводные камни

Цифры описывают предельно узкий сценарий, генерацию простых историй моделью в 28,9 млн параметров, а не что-то практически применимое. Автор статьи сам подчёркивает: получившуюся связку нельзя использовать как чат-бота, для генерации кода или в качестве агента. Достижение остаётся демонстрацией технической возможности (proof-of-concept), а не готовым продуктом.

«Вы не сможете сделать из неё чат-бота, генерировать с её помощью код или использовать как агента.»

— Tobias Mann, The Register