Metis: исследователи создали первую базовую модель со встроенной памятью

Современные ИИ-агенты научились встраивать в базовую модель всё больше способностей, так появились мультимодальные модели и модели с развитым рассуждением (reasoning). Но долгосрочная память агентов до сих пор почти всегда реализована снаружи, отдельными модулями вроде retrieval-систем (RAG) и векторных хранилищ, а не как часть самой модели. Статья «Metis: Memory Foundation Model» (первый автор, Zeyu Zhang, опубликована на HuggingFace) делает первый шаг к тому, чтобы встроить память прямо в архитектуру базовой модели, авторы называют такой класс систем «memory foundation models».
Авторы формализуют «нативную память» через два элемента: во-первых, постоянное, динамически меняющееся состояние памяти внутри самой модели (backbone); во-вторых, «нативные процедуры памяти», механизмы, которыми модель сама, в ходе собственных вычислений, решает, что сохранить и как использовать сохранённое, без внешнего кода. По утверждению авторов, такой подход даёт преимущества в архитектуре, в сквозной (end-to-end) оптимизации и в эффективности по сравнению с внешними модулями памяти.
На основе этой идеи предложена модель Metis, первый прототип memory foundation model. Её архитектура добавляет базовой модели собственное состояние памяти: история взаимодействия сжимается прямо в модель и извлекается через механизм memory attention (внимание к памяти). Для обучения авторы собрали большой массив данных, ориентированных именно на память, и ввели несколько целевых функций оптимизации, чтобы модель освоила эти процедуры на этапе mid-training, промежуточного обучения между предобучением и финальной настройкой.
Ключевая техническая особенность: обновление памяти в онлайн-режиме не требует градиентов, достаточно одного прохода вперёд (forward pass). Во время инференса все обученные веса модели остаются замороженными, меняется только состояние памяти, оно преобразуется обычными прямыми вычислениями модели, без какого-либо дополнительного обучения «на лету».
Авторы провели эксперименты, показавшие, что Metis действительно демонстрирует свойства нативной памяти, и подробно разобрали её сильные стороны, ограничения и поведение. Проект и веса модели (чекпоинты) выложены в открытый доступ для дальнейших исследований.
Ключевые факты
- Metis, первый прототип «memory foundation model»: память встроена прямо в архитектуру базовой модели, а не реализована внешним модулем (как RAG или векторное хранилище)
- Нативная память формализована как два элемента: постоянное состояние памяти внутри модели и процедуры, которыми модель сама решает, что запоминать и как использовать сохранённое
- Обновление памяти не требует градиентов, достаточно одного прохода вперёд; при инференсе веса модели остаются замороженными
- История взаимодействия сжимается в состояние модели и извлекается через механизм memory attention
- Проект и чекпоинты модели выложены в открытый доступ для дальнейших исследований
Почему это важно
Сейчас долгосрочная память ИИ-агентов почти всегда реализована снаружи, через отдельные базы данных, retrieval-модули (RAG) и подобные надстройки, которые нужно проектировать, обслуживать и отдельно стыковать с моделью. Metis показывает, что память можно встроить прямо в базовую модель как часть её архитектуры, по тому же принципу, по которому в модели уже встроили мультимодальность и развитое рассуждение. Если подход подтвердится на практике, это шаг к моделям, которые накапливают и используют опыт «изнутри», без отдельной инфраструктуры памяти.
Кому это важно
Разработчикам ИИ-агентов и исследователям, которые сейчас собирают долгосрочную память агентов из внешних компонентов, векторных хранилищ, RAG-пайплайнов, и сталкиваются с их ограничениями: задержками, сложностью синхронизации, потерей контекста между вызовами. Также это интересно исследователям архитектур базовых моделей, которые ищут способы добавить моделям новые нативные способности.
Как это применить
Проект и чекпоинты модели Metis выложены в открытый доступ на HuggingFace, так что архитектуру можно изучить и протестировать напрямую. Цена, лицензия и условия коммерческого использования в доступном тексте не указаны.
Можно ли доверять
Это исследовательская публикация (препринт на HuggingFace), а не готовый коммерческий продукт. Первым автором указан Zeyu Zhang; полный состав соавторов и организацию по доступному тексту установить нельзя. Как и для большинства подобных публикаций, реальная ценность подхода подтверждается независимой проверкой и последующими исследованиями, а не заявлениями самих авторов.
Риски и подводные камни
Заявленные преимущества, в архитектуре, сквозной оптимизации и эффективности, приведены по итогам экспериментов самих авторов; независимой проверки результатов доступный текст не описывает. Также неясно, как решение масштабируется на модели большего размера и на длинные истории взаимодействия за пределами условий, описанных в статье.