LatentPress: сжатие контекста нейросетей в 4, 16 раз без текстового пересказа

LatentPress: сжатие контекста нейросетей в 4, 16 раз без текстового пересказа

Сжатый контекст для языковых моделей почти всегда хранится как текст или как отрендеренное изображение, которое затем нужно заново декодировать, даже если читать его будет не человек, а сама модель. Новая работа предлагает третий вариант: LatentPress записывает историю диалогов и длинные документы не в текст, а в непрерывные «токены памяти», которые «замороженная» (неизменяемая в рамках этого метода) модель-читатель воспринимает напрямую через свои входные эмбеддинги, без восстановления текста на этапе вывода.

Сжатие выполняет компактный модуль-«писатель», подобранный под конкретную модель-читателя: он уменьшает объём контекста в 4, 16 раз, и при этом обучается только он сам, адаптер размером 4,2, 26,2 млн параметров, около 0,1% от размера самого декодера, который остаётся неизменным.

На тесте долгой памяти LongMemEval при сжатии в 7,70 раза LatentPress даёт точность 0,504, выше, чем у несжатых исходных данных (0,490), у текстовых пересказов (0,184) и у сжатия через OCR (точность в диапазоне 0,426, 0,312; на каких именно уровнях сжатия получен этот диапазон, в тексте не указано).

На наборе LongBench-QA «писатели», обученные под конкретный домен, при сжатии в 4, 8 раз не уступают чтению полного текста или превосходят его, а при сжатии в 16 раз уже отстают от несжатого варианта. По скорости запись (сжатие) одного диалога занимает 43 мс, это примерно на порядок быстрее, чем текстовый пересказ или OCR-реконструкция, а чтение сжатых токенов происходит в 5, 9 раз быстрее, чем работа с несжатым контекстом или закешированным OCR.

Авторы проверили интерфейс в двух сценариях переноса без дообучения (zero-shot): «писателя», обученного на датасете UltraChat, применили к задачам долгой памяти LongMemEval, а «писателя», обученного на QA-данных, производных от LongMemEval, к новым, ранее не встречавшимся доменам документов LongBench. По их словам, это показывает, что прямые «мягкие» токены, практичный интерфейс для передачи контекста между системами, работающий не только с текстом и изображениями. Реализация экспериментов выложена в открытом доступе на GitHub.

Ключевые факты

  • LatentPress сжимает историю диалогов и длинные документы в 4, 16 раз в виде непрерывных «токенов памяти», которые модель-читатель воспринимает напрямую через входные эмбеддинги, без восстановления текста при выводе.
  • Обучается только компактный адаптер-«писатель» (4,2, 26,2 млн параметров, около 0,1% размера декодера); сам декодер остаётся замороженным и неизменным.
  • На LongMemEval при сжатии в 7,70 раза точность LatentPress, 0,504: выше, чем у несжатых данных (0,490), текстовых пересказов (0,184) и OCR-сжатия (0,426, 0,312).
  • На LongBench-QA сжатие в 4, 8 раз не уступает чтению полного текста или превосходит его, а при 16-кратном сжатии результат уже хуже несжатого варианта.
  • Запись (сжатие) одного диалога занимает 43 мс, на порядок быстрее текстовых пересказов и OCR, а чтение сжатых токенов быстрее в 5, 9 раз, чем работа с несжатым контекстом или кешированным OCR.

Почему это важно

Контекстное окно, это то, что модель держит «в голове»: история переписки, документы, которые ей дали для анализа. Чем длиннее эта история, тем дороже и медленнее с ней работать, а сжатие в текстовый пересказ или через OCR обычно платит точностью. LatentPress показывает, что контекст можно сжимать не в текст, а в компактные векторные «токены памяти», и на тесте LongMemEval это даже точнее, чем читать несжатые исходные данные, при этом заметно быстрее и на записи, и на чтении. Если результат подтвердится на практике, это шаг к более дешёвой и быстрой «долгой памяти» для ассистентов и агентов, для которых стоимость длинного контекста сегодня, одно из главных ограничений.

Кому это важно

В первую очередь, тем, кто строит ассистентов и агентов с долгой историей общения или работой с большими документами: для них длина контекста напрямую отражается на расходах на инференс. Дальше, командам, которые проектируют инфраструктуру инференса больших моделей и ищут способ снизить стоимость и задержку длинного контекста. И исследователям, которые занимаются сжатием контекста и retrieval-augmented generation, как ещё одна точка сравнения для будущих методов.

Как это применить

Метод не требует переобучения основной модели: дообучается только компактный адаптер-«писатель» (около 0,1% параметров декодера) под конкретную «замороженную» модель-читателя, а сам декодер остаётся без изменений. Авторы выложили реализацию экспериментов в открытом доступе на GitHub (https://github.com/xuyd16ai/context_softtoken_compress), можно посмотреть код и попробовать воспроизвести результаты. Проверка на двух сценариях переноса без дообучения (с датасета UltraChat, на LongMemEval, с QA-данных LongMemEval, на новые домены LongBench) говорит, что подход не завязан намертво на один датасет, но перед использованием в продакшене стоит проверить его на своих данных и своей модели-читателе: в тексте не сказано, для декодеров какого масштаба и архитектуры результаты воспроизводились.

Можно ли доверять

Цифры получены на двух признанных тестах, LongMemEval (долгая память) и LongBench-QA (работа с длинными документами), и сравнены сразу с тремя базовыми подходами: несжатым контекстом, текстовым пересказом и OCR-сжатием, а не с одним удобным конкурентом. Реализация эксперимента открыта на GitHub, что позволяет её независимо проверить. При этом сам текст источника не называет ни авторов, ни организацию, ни архитектуру и масштаб декодера, на котором ставились опыты, это мешает оценить, кто стоит за работой и насколько результат переносится на другие модели.

Риски и подводные камни

Собственные цифры авторов показывают границу метода: на LongBench-QA уже при сжатии в 16 раз результат уступает несжатому контексту, то есть выигрыш держится в определённом диапазоне степени сжатия, а не растёт вместе с ней бесконечно. В тексте нет сравнения с другими методами сжатия контекста в непрерывные токены, только с текстовым пересказом, несжатым контекстом и OCR-сжатием, поэтому по одному источнику нельзя судить, как LatentPress соотносится с близкими по идее разработками. Источник также не обсуждает ограничения, сценарии отказа и возможные последствия метода для безопасности, эти вопросы остаются открытыми.