Исследователи масштабировали Memory Decoder до 6,9 млрд параметров памяти

Исследователи масштабировали Memory Decoder до 6,9 млрд параметров памяти

В обычных decoder-only языковых моделях долговременная память и способность рассуждать перемешаны в одном наборе параметров, поэтому память нельзя масштабировать отдельно от остальной модели. Ранее авторы предлагали модуль Memory Decoder, отдельный параметрический блок памяти, но проверяли его только на небольшом масштабе. В новой работе, «Memory Decoder at Scale», команда довела память до 6,9 млрд параметров и предобучила её на 300 млрд токенов. На таком объёме обычный конвейер Faiss (индексация и поиск по ближайшим соседям) становится неподъёмным по стоимости, поэтому авторы построили распределённый пайплайн индексации и поиска Faiss вместе с разреженной, пакетной загрузкой kNN-распределений. Проверка на разных масштабах моделей показала: выделять больше параметров под память выгоднее по соотношению «параметры/качество», чем просто увеличивать саму базовую модель. На 17 бенчмарках связка Pythia-410M с общей памятью на 6,9 млрд параметров подняла средний балл с 29,86 до 37,34, это выше результата Pythia-12B (37,24), при этом суммарно у связки на 39% меньше параметров, чем у Pythia-12B. Для семейства Qwen3 Base, от 0,6 до 14 млрд параметров, доменная память размером 1,7 млрд параметров повышала средний балл по трём доменам более чем на 9 пунктов на каждом из проверенных масштабов. Вывод авторов: независимое масштабирование предобученной памяти, более экономный по параметрам путь к улучшению языковых моделей, чем масштабирование модели целиком. Работу подготовили Rubin Wei с шестью соавторами; код и датасет для домена выложены в открытом доступе.

Ключевые факты

  • Память Memory Decoder довели до 6,9 млрд параметров и предобучили на 300 млрд токенов
  • Стандартный Faiss-пайплайн для индексации и поиска на таком объёме не тянет, построили распределённую индексацию Faiss и разреженную пакетную загрузку kNN-распределений
  • Pythia-410M + память 6,9 млрд: средний балл на 17 бенчмарках вырос с 29,86 до 37,34, обогнав Pythia-12B (37,24) при на 39% меньшем суммарном числе параметров
  • Для Qwen3 Base от 0,6 до 14 млрд параметров доменная память в 1,7 млрд поднимает средний балл по трём доменам больше чем на 9 пунктов на каждом масштабе
  • Вывод авторов: наращивать отдельную память параметрически эффективнее, чем масштабировать саму модель

Почему это важно

Обычно память и способность рассуждать в языковой модели зашиты в одни и те же параметры, поэтому улучшать «знания» модели можно только вместе с ростом всей модели целиком, это дорого. Работа показывает, что если вынести долговременную память в отдельный параметрический модуль, её можно наращивать независимо, и это даёт лучший результат на единицу параметров, чем простое увеличение базовой модели.

Кому это важно

Тем, кто строит и обучает языковые модели и упирается в стоимость масштабирования: небольшая базовая модель с большим блоком памяти обгоняет модель в разы крупнее при меньшем суммарном числе параметров. Также полезно тем, кто адаптирует модели под конкретный домен, доменная память отдельно поднимает качество именно в нужной области.

Как это применить

Идея, присоединять предобученный модуль памяти (общий или доменный) к сравнительно небольшой базовой модели вместо того, чтобы обучать и обслуживать более крупную модель целиком. Авторы выложили код (репозиторий LUMIA-Group/MemoryDecoder-at-Scale) и датасет для доменной памяти в открытом доступе, так что связку памяти с базовой моделью и распределённый пайплайн индексации Faiss можно воспроизвести.

Можно ли доверять

Результаты опубликованы как препринт (arXiv 2607.27919, отправлен 30 июля) с открытым кодом и данными, проверены на 17 стандартных бенчмарках и на семействе Qwen3 разных размеров, это добавляет доверия. При этом издание или конференция, где работа прошла рецензирование, в источнике не указаны, а независимого повторения результатов другими командами в тексте не упомянуто.

Риски и подводные камни

Подход усложняет инфраструктуру: вместо одной модели нужна ещё и распределённая система индексации и поиска по памяти (Faiss плюс загрузка kNN-распределений), а это дополнительная инженерная нагрузка. Выигрыш показан на моделях семейств Pythia и Qwen3, переносимость на другие архитектуры источник не проверяет. Также в тексте нет данных о том, как поиск по памяти на этапе инференса сказывается на задержке и стоимости обслуживания запросов.