Метод DISCO делит длинный контекст между моделями и держит 78,4% на 1 млн токенов

Исследователи начинают с проблемы: нейросети рекламируют окна контекста в миллион токенов, но качество рассуждений с ростом входных данных часто рушится. Это явление авторы называют «гниением контекста» (context rot). По их объяснению, причина в структурной запутанности монолитных архитектур: огромная нагрузка на поиск нужных фрагментов в контексте (grounding, «привязка к контексту») исчерпывает ресурс модели, который нужен для сложных рассуждений.
В ответ предложен метод DISCO (Grounding-Reasoning Disaggregation via DIStributed long COntext scaling), то есть разделение поиска по контексту и рассуждения за счёт распределённого масштабирования длинного контекста. Идея вдохновлена распределёнными вычислительными фреймворками вроде Apache Spark. Длинный контекст разбивается между «флотом» моделей-исполнителей (Worker LLM), которые занимаются только параллельным локальным поиском нужных сведений. Центральная модель-«водитель» (Driver LLM) обучена с подкреплением (алгоритм GRPO) оптимизировать планирование. Она управляет выполнением: динамически превращает запрос в атомарные задачи извлечения информации, а затем сводит собранные свидетельства и формирует итоговый ответ. Так, по словам авторов, рассуждение отделяется от «шума» сырого контекста, и метод фактически устраняет гниение контекста.
Результаты, о которых сообщают авторы: на RULER-QA при 1 млн токенов DISCO сохраняет 78,4% точности там, где стандартные базовые подходы «схлопываются». На LongBench v2 метод обходит модели с полным контекстом на величину до 9,8 пункта. Кроме того, он, как утверждается, сопоставим с передовыми моделями вроде Gemini-3-Pro-Preview, при этом снижая затраты на вывод более чем на 80%. Авторы называют подход высокоэффективной парадигмой надёжного вывода на длинном контексте.
В тексте не указаны размеры и число моделей-исполнителей, базовая модель «водителя», а также то, относительно чего считается снижение затрат более чем на 80%.
Ключевые факты
- DISCO разделяет две задачи: параллельный локальный поиск сведений по частям контекста (модели-исполнители) и планирование со сборкой ответа (центральная модель).
- Центральная модель обучена с подкреплением по алгоритму GRPO; она превращает запрос в атомарные задачи извлечения и сводит собранные свидетельства в ответ.
- На RULER-QA при 1 млн токенов метод сохраняет 78,4% точности, где стандартные базовые подходы, по словам авторов, схлопываются.
- На LongBench v2 DISCO опережает модели с полным контекстом на величину до 9,8 пункта.
- Авторы заявляют сопоставимость с Gemini-3-Pro-Preview и снижение затрат на вывод более чем на 80%.
Почему это важно
Заявленные окна контекста в миллион токенов на практике не гарантируют качества рассуждений: по описанию авторов, оно часто рушится по мере роста входа. DISCO предлагает не наращивать одну большую модель, а разделить обязанности между поиском по контексту и рассуждением по аналогии с распределёнными вычислениями вроде Apache Spark. Если заявленные результаты подтвердятся, это путь удержать точность на очень длинных входах и одновременно сократить затраты.
Кому это важно
Исследователям и инженерам, которые работают с очень длинными документами, вопросами-ответами по большим текстовым массивам и оркестрацией нескольких моделей. Тем, кто оценивает стоимость вывода на длинном контексте: авторы говорят о снижении затрат более чем на 80%.
Как это применить
В имеющемся описании нет сведений о выпуске кода, моделей или наборов данных, поэтому готового инструмента для использования пока не видно. Практически применимая идея, сама архитектура: разбить длинный контекст на части, поручить группе моделей локально извлекать нужное, а центральной модели поручить планирование задач и итоговую сборку ответа.
Можно ли доверять
Источник, аннотация статьи, а все цифры и выводы принадлежат самим авторам. В описании не названы авторы и организации, не указаны дата публикации, число и размер моделей, а также то, какие именно базовые подходы «схлопываются» на RULER-QA и с чем сравнивается снижение затрат. Оценка «до 9,8 пункта», верхняя граница, а условия, при которых она достигается, не названы. Независимого подтверждения в материале нет.
Риски и подводные камни
Утверждение, что метод «фактически устраняет» гниение контекста, слова авторов, а не независимая проверка. Неясно, на каком именно тесте достигается сопоставимость с Gemini-3-Pro-Preview и от какой базы отсчитаны 80% экономии. Распределённая схема с несколькими моделями зависит от качества планирования центральной модели: она разбивает запрос на задачи и сводит результаты, но в описании нет данных о том, как метод ведёт себя при ошибках на этих шагах.