Needle 2: агентную ИИ-модель весом 14 МБ выпустили для телефонов, часов и роботов
Разработчики выпустили Needle 2, открытую агентную ИИ-модель на 45 миллионов параметров для вызова функций, управления устройствами и структурированного извлечения данных. Вся модель, это единый исполняемый файл весом 14 МБ, который запускает полную сессию, используя не больше 28 МБ оперативной памяти. Модель распространяется по лицензии Apache 2.0, веса выложены на Hugging Face. В основе, собственная архитектура авторов Simple Attention Network, а веса сжаты в среднем до 2 бит на параметр техникой, которую авторы называют Cactus Quants: в отличие от типичного постфактум-квантования, модель обучается сразу под это сжатие, от предобучения до пост-тюнинга, включая веса, активации и KV-кэш.
На бенчмарках вызова функций и работы с устройствами Needle 2 на равных соперничает с моделями FunctionGemma 270M, LFM2.5 230M и Apple FM, притом что она в 5, 70 раз меньше их по размеру и хранится в 2 бита против их 16-битного формата (f16). На Python-задачах простого вызова функций отставание от FunctionGemma (модели в шесть раз крупнее, обученной именно под эту задачу), меньше одного балла; во всём тестовом наборе из 3641 строки доля корректно оформленных ответов держится на уровне 93,4%. По скорости: от 500 токенов в секунду при генерации ответа на Raspberry Pi 5 (и от 800 токенов в секунду при обработке входного контекста), 400, 1500 токенов в секунду на VR-гарнитурах вроде Meta Quest 3S и Apple Vision Pro, 300, 700 токенов в секунду на телефонах дешевле $200, таких как Samsung A-серии; модель также запускается на микроконтроллерах, например, ESP32-S3.
Ставка авторов в том, что распознавание команды и подбор нужной функции с нужными параметрами не требует больших языковых моделей: это задача без общих знаний о мире и без свободного текста, поэтому 45 миллионов параметров достаточно там, где чат-модели нужны миллиарды. Экономию дают несколько архитектурных решений: MLP-блок на преобразовании Адамара вместо обычных плотных проекций почти не тратит параметров на смешивание каналов; часть знаний о мире вынесена из основной сети в хешированные таблицы n-грамм, которые читаются за несколько обращений на токен и почти не расходуют вычислений; несколько параллельных «остаточных потоков» дают 27-слойной сети шириной 512 гибкость маршрутизации, как у гораздо более широкой сети. Внимание использует скользящее окно на 256 токенов, поэтому объём KV-кэша ограничен независимо от длины сессии, а системный промпт и описания инструментов закреплены как «якоря», которые нельзя вытеснить из памяти. По подсчётам авторов, обычный трансформер такой же ширины и глубины тратит 164 миллиона операций с плавающей точкой на токен, уменьшенный до размера Needle, 87 миллионов, а сам Needle, 70 миллионов, поскольку пятая часть его параметров хранится как память, не требующая вычислений вовсе; в сумме модель расходует в 7, 85 раз меньше операций на токен, чем модели, с которыми её сравнивают.
Needle 2 уже используется в производстве: производитель умных гаджетов Pebble, по собственному описанию, «пионер современной индустрии носимых устройств», запускает модель локально в приложении Index 01, чтобы превращать голосовые команды в действия без обращения к сети. У кольца Pebble Index нет экрана, поэтому команда должна выполняться мгновенно и без сбоев вне зависимости от подключения к интернету. Авторы отдельно оговаривают, что сравнение с конкурентами асимметрично в обе стороны: сравниваемые модели намеренно оставлены в 16-битном формате, потому что типичное постфактум-квантование до 2 бит ломает модели, которые не обучались под такое сжатие, это смещает сравнение в пользу конкурентов; при этом Needle обучена узко под вызов функций и не несёт нагрузки чат-моделей общего назначения, это смещает сравнение в пользу Needle. Оценка проводилась на пяти открытых бенчмарках вызова функций: Mobile Actions от Google, DroidCall, внутридоменный и внедоменный наборы Seal-Tools и BFCL v4 для одиночных обращений; конкуренты запускались через vLLM на полном контексте, Apple FM, на устройстве.
Модель не обучалась на вызовы общего назначения: её обучающие данные, это команды бытовых устройств (умный дом, телефоны, носимые гаджеты, телевизоры, автомобили) и структурированное извлечение данных, а корпоративные и Java/JavaScript-разделы бенчмарка BFCL остаются полностью вне этого распределения, именно там разрыв с конкурентами максимален. Needle 2 доступна для тестирования в отдельном плейграунде для носимых устройств, роботов, умного дома, телефонов и автомобилей; репозиторий и Python-пакет позволяют дообучить модель под собственный набор функций на своём компьютере, от нескольких минут до нескольких часов.
Ключевые факты
- Needle 2, открытая (Apache 2.0, веса на Hugging Face) агентная модель на 45 млн параметров: весит 14 МБ на диске и укладывается в 28 МБ ОЗУ на всю сессию
- На бенчмарках вызова функций она на равных соперничает с FunctionGemma 270M, LFM2.5 230M и Apple FM, будучи в 5, 70 раз меньше и используя 2-битное сжатие против их 16-битного формата
- Скорость: от 500 токенов/с генерации на Raspberry Pi 5, 400, 1500 токенов/с на VR-гарнитурах (Meta Quest 3S, Apple Vision Pro), 300, 700 токенов/с на телефонах дешевле $200; работает и на микроконтроллерах вроде ESP32-S3
- Модель уже в проде: производитель умных гаджетов Pebble использует её в приложении Index 01 своего кольца без экрана, чтобы выполнять голосовые команды офлайн
- Архитектурные приёмы (MLP на преобразовании Адамара, память в виде таблиц n-грамм, скользящее окно внимания на 256 токенов, обучение сразу под 2-битное квантование) снижают расход вычислений в 7, 85 раз на токен по сравнению с конкурентами
Почему это важно
Авторы отталкиваются от того, что основная масса устройств на краю сети, это не Mac и PC: в мире свыше 21 млрд подключённых IoT-устройств против примерно 1,5 млрд компьютеров, и, по их подсчётам, около четырёх из пяти таких устройств стоят дешевле $200. Если сузить задачу до распознавания команды и вызова уже готовой функции устройства, без общих знаний о мире и свободного текста, модели хватает 45 млн параметров там, где чат-модели общего назначения нужны миллиарды: LFM2.5-230M, например, обучена на 19 трлн токенов, примерно в 120 раз больше, чем всё обучение Needle 2, но на бенчмарках они меняются победами. Второй сдвиг, квантование до 2 бит встроено в обучение с самого начала, а не применяется постфактум, что обычно ломает качество маленьких моделей.
Кому это важно
Тем, кто делает носимые устройства, роботов, умный дом и другую бытовую электронику с голосовым или текстовым управлением без выхода в сеть: телефоны, часы, кольца, домашние хабы, простых роботов вроде Reachy Mini. Модель уже проверена в реальном продукте, кольцо Pebble Index без экрана работает на ней, чтобы превращать голосовую команду в действие мгновенно и без интернета.
Как это применить
Модель открыта по Apache 2.0, веса лежат на Hugging Face, у проекта есть отдельный плейграунд, где можно опробовать её на сценариях для носимых устройств, роботов, умного дома, телефонов и автомобилей. Репозиторий и Python-пакет позволяют дообучить свою версию Needle под словарь функций конкретного продукта прямо на своём Mac или PC, от нескольких минут до нескольких часов. Развёртывание, один самодостаточный C++-бинарник, который сам определяет процессор при старте и выбирает нужный набор инструкций; один и тот же артефакт работает от микроконтроллеров на Cortex-M до x86 и WebAssembly, ничего дополнительно устанавливать не нужно.
Можно ли доверять
Авторы подробно раскрывают инженерные решения и сами прямо указывают на асимметрию своего сравнения: конкурентов намеренно оставили в 16-битном формате, потому что обычное постфактум-квантование до 2 бит ломает модели, которые не обучались под такое сжатие, это смещает сравнение в пользу конкурентов; при этом саму Needle сравнивают только на её узкой обученной области, это смещает сравнение в её пользу. Это честное признание, а не попытка скрыть перекос. Реальная эксплуатация в проде у Pebble, независимое (насколько можно судить по материалу) подтверждение, что модель работает не только на бенчмарках. Но все числа, самоотчёт создателей модели, без стороннего аудита, и в самом материале не указаны ни дата релиза, ни условия коммерческого использования сверх лицензии.
Риски и подводные камни
Needle 2 обучена узко: её данные, это команды умного дома, телефонов, носимых устройств, телевизоров и автомобилей плюс структурированное извлечение данных. Корпоративные и общего назначения разделы бенчмарка BFCL, включая вызовы функций на Java и JavaScript, остаются полностью вне этого распределения, именно там отставание от конкурентов максимально. Модель не годится как замена чат-модели общего назначения. Все сравнительные цифры выбраны и опубликованы самими авторами, а не независимой стороной, так что к формулировкам вроде «на равных соперничает» стоит относиться как к позиции разработчиков, а не к нейтральному результату.
«Мы запускаем Cactus Needle локально в приложении вместо того, чтобы полагаться на облако. Модель занимает совсем немного места, а её работа ни разу нас не подвела.»
— Pebble, о работе Needle 2 в приложении Index 01
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.