World-Time Compute поднял обобщение мелких моделей на 29 п.п., у крупных, почти нет

Языковые модели (LLM) хорошо обобщаются в пределах домена только тогда, когда видели много реальных размеченных примеров именно из этого домена, а для большинства доменов таких примеров просто нет. Авторы предлагают способ, который сами называют дешёвым: производить точную разметку самостоятельно. Если динамику домена можно описать кодом, один шаблон порождает множество «моделей мира», исполняемых и проверяемых программ над символьным состоянием, каждая из которых становится неисчерпаемым источником точно размеченных траекторий. Дообучение LLM на траекториях сразу по множеству таких миров авторы называют world-time compute, тренировочный аналог вычислений на этапе вывода (test-time compute): вместо того чтобы наращивать вычисления в момент ответа модели, их наращивают во время обучения, за счёт прогона модели через много проверяемых синтетических миров.

Такое дообучение поднимает способность модели обобщать на отложенные миры из той же синтезированной семьи, которые она не видела при обучении, и прирост тем больше, чем слабее исходные способности модели: у самой маленькой из протестированных моделей, на 0.5B параметров, прирост составил +29 процентных пунктов, наибольший среди всех протестированных размеров. У самой крупной из протестированных моделей прирост укладывается в шум, что согласуется с насыщением эффекта по мере роста модели. Доверять меткам можно именно потому, что миры, это проверенный код: синтезированная и затем проверенная динамика мира остаётся точной на прогонах длиной 20 шагов и даёт 100% точных ответов на пробах, вынесенных за пределы обучающего распределения в 10 раз (10x out-of-distribution), тогда как пошаговые предсказатели на основе LLM и MLP (многослойного перцептрона) накапливают ошибку на каждом шаге и в итоге разваливаются. В отличие от рандомизации домена (domain randomization), когда параметры варьируют у одного и того же симулятора, здесь каждый мир написан и проверен независимо; контрольный эксперимент с намеренно испорченными метками показал, что прирост даёт именно точность меток, а не само разнообразие задач.

Тот же рычаг работает и на реальных бенчмарках, ARC-AGI (сеточные головоломки), List Functions (задачи над списками) и CLRS (алгоритмический бенчмарк), причём в варианте, где вместо дообучения заранее на многих мирах модель дообучают отдельно под каждый конкретный мир уже на этапе теста (per-world test-time training). На List Functions авторы проверили и более сложный, межмировой вариант: один адаптер, обученный сразу на 128 непересекающихся мирах, даёт 40% точности на отложенных мирах, не входивших в обучение, против 6% у контроля с намеренно испорченными метками; разница составляет +34 процентных пункта (доверительный интервал [29, 39]).

Сами авторы описывают эффект не как универсальный закон, а как насыщающуюся закономерность: он максимален для задач с небольшим числом шагов рассуждения и для маленьких, слабых моделей, слабеет на длинных цепочках рассуждений, на задачах, завязанных на восприятие, и на задачах, где модель и так уже близка к потолку возможностей; перенос между разными задачами (cross-task transfer) слаб, если у задач нет общего навыка. Сами миры создаёт и обслуживает OpenWorld, фреймворк без внешних зависимостей (zero-dependency), который авторы описывают отдельно, в сопутствующей статье. Область применения ограничена символьным состоянием: домены, заданные напрямую через изображения (пиксели), пока остаются территорией обычных обучаемых моделей, а не моделей мира на основе кода. Весь код, рецепты экспериментов и сама рукопись, по утверждению авторов, воспроизводятся из единого репозитория.

Ключевые факты

  • «World-time compute»: если динамику домена можно записать как код, один шаблон порождает множество проверяемых «моделей мира», точно размеченные траектории для дообучения LLM берутся из них, а не из реальных размеченных примеров, которых для большинства доменов не хватает.
  • Прирост обобщения на новые, не встречавшиеся миры тем больше, чем слабее модель: +29 процентных пунктов у самой маленькой протестированной модели (0.5B параметров), и почти нулевой, в пределах шума, у самой крупной из протестированных, что похоже на насыщение эффекта.
  • Меткам можно доверять, потому что миры, это проверенный код: их динамика точна на прогонах длиной 20 шагов и даёт 100% точных ответов на пробах, отклонённых от обучающего распределения в 10 раз, тогда как обучаемые пошаговые предсказатели на основе LLM и MLP (многослойного перцептрона) накапливают ошибку и разваливаются.
  • Контрольный эксперимент с намеренно испорченными метками показал: прирост дают именно точные метки, а не разнообразие задач, в отличие от рандомизации домена (domain randomization), где просто варьируют параметры одного и того же симулятора.
  • На бенчмарке List Functions один адаптер, обученный сразу на 128 непересекающихся мирах, даёт 40% точности на новых, не встречавшихся мирах против 6% у контроля с испорченными метками, разница +34 процентных пункта (доверительный интервал [29, 39]).

Почему это важно

Языковые модели хорошо обобщаются в домене только тогда, когда видели много реальных размеченных примеров, а для большинства доменов таких примеров просто нет. Авторы предлагают способ, который сами называют дешёвым способом получить точную разметку самостоятельно: если динамику домена можно описать кодом, из одного шаблона получается сколько угодно проверяемых «миров», и на траекториях по ним модель дообучают, это и есть world-time compute, тренировочный аналог вычислений на этапе вывода (test-time compute). Главный результат в том, что прирост от такого дообучения тем больше, чем слабее исходная модель: у самой маленькой протестированной модели (0.5B параметров) он составил +29 процентных пунктов, а у самой крупной, практически сошёл на нет, то есть метод особенно полезен там, где способностей сейчас не хватает, а не там, где их и так много. Важно и то, почему меткам вообще можно доверять: миры, это не приближённая симуляция, а проверенный код, чья динамика остаётся точной на 20 шагов вперёд и даёт 100% точных ответов даже на пробах, отклонённых от обучающего распределения в 10 раз, тогда как обучаемые предсказатели динамики (пошаговые LLM или MLP) на таком горизонте накапливают ошибку и разваливаются.

Кому это важно

В первую очередь, командам, которые дообучают маленькие или недорогие языковые модели под домены с формализуемой, «символьной» динамикой: планирование, головоломки, игры, структурированное рассуждение, любые задачи, которые можно описать как код с чётким состоянием. Именно там, где реальных размеченных примеров мало, а логику домена можно запрограммировать, метод даёт наибольший выигрыш: авторы прямо показывают, что прирост концентрируется у слабых моделей, а не у сильных. Полезна работа и тем, кто выбирает между вложением вычислений в дообучение и в вычисления на этапе вывода (test-time compute): здесь показан рабочий тренировочный рычаг для той же цели, более качественного рассуждения модели, причём проверенный не только как отдельное дообучение, но и как вариант тренировки под конкретный мир уже на этапе теста (per-world test-time training), на бенчмарках ARC-AGI, List Functions и CLRS. А вот командам, чьи задачи заданы через изображения или другой «пиксельный» вход, а не через символьное состояние, метод в этом виде не поможет, сами авторы называют такие домены территорией обычных обучаемых моделей.

Как это применить

Рецепт из статьи: если динамику вашего домена можно записать как код (то есть состояние символьное, не пиксельное), напишите один шаблон, из которого можно инстанцировать много независимо написанных и проверенных «миров», каждый как исполняемая программа с точной, проверяемой динамикой. Сами миры можно создавать и обслуживать фреймворком OpenWorld, который авторы описывают как не имеющий внешних зависимостей (zero-dependency) и разбирают подробнее в отдельной сопутствующей статье. Дальше, два рабочих варианта одного и того же рычага: либо заранее дообучить модель на траекториях сразу по многим мирам (собственно world-time compute), либо дообучать модель под конкретный мир уже на этапе теста (per-world test-time training), на бенчмарках ARC-AGI, List Functions и CLRS сработал именно второй вариант. Конкретный ориентир по масштабу дан для List Functions: один адаптер, обученный сразу на 128 непересекающихся мирах, обобщается на новые, не встречавшиеся миры (40% точности против 6% у контроля с испорченными метками, разница +34 процентных пункта, доверительный интервал [29, 39]), то есть счёт идёт на десятки независимых миров, а не на единицы. Стоит помнить, для чего рычаг подходит лучше всего: эффект сильнее всего проявляется на задачах с малым числом шагов рассуждения и на маленьких, слабых моделях, так что в первую очередь имеет смысл пробовать его именно там, а не ждать столь же заметного эффекта на длинных цепочках рассуждений или на уже сильных крупных моделях. Авторы утверждают, что весь код, рецепты экспериментов и сама рукопись воспроизводятся из одного репозитория, но ссылки на него аннотация не даёт.

Можно ли доверять

Это препринт на arXiv, рецензирование нигде не упомянуто, а в тексте нет ни имён авторов, ни организаций, ни даты публикации, установить, кто стоит за работой и прошла ли она внешнюю проверку, по самому источнику нельзя. Центральный контраст статьи (маленькие модели выигрывают, большие, почти нет) тоже неполон: размер модели с наибольшим приростом (0.5B параметров) назван, а размер модели, у которой прирост укладывается в шум, нет, так что где именно проходит граница насыщения эффекта, из текста не установить. Из трёх бенчмарков, названных как подтверждение (ARC-AGI, List Functions, CLRS), конкретные цифры даны только для List Functions, 40% против 6% с доверительным интервалом [29, 39]; для ARC-AGI и CLRS сказано лишь, что тот же рычаг работает, без единого числа, так что степень эффекта на этих двух бенчмарках проверить нельзя. Заявление, что разметку можно производить дёшево, тоже не подкреплено ни одной цифрой затрат или вычислений. Наконец, фреймворк OpenWorld, которым, по утверждению авторов, создаются и обслуживаются миры, упомянут как «сопутствующая статья» без имени автора, названия, даты или ссылки, самостоятельно проверить его тоже не выйдет. Из плюсов: для главного количественного сравнения на List Functions приведён доверительный интервал, а сами авторы формулируют эффект осторожно, как «насыщающуюся закономерность, а не закон», и прямо перечисляют, где он не работает, а не выдают частный результат за универсальный.

Риски и подводные камни

Сам метод по построению ограничен доменами с символьным состоянием: домены, заданные через изображения (пиксельные), в текущем виде не покрываются и остаются, по словам авторов, территорией обычных обучаемых моделей. Даже внутри применимых доменов эффект не универсален: он слабеет на длинных цепочках рассуждений, на задачах, завязанных на восприятие, и на задачах, где модель и так уже близка к потолку возможностей, а перенос между разными задачами слаб, если у них нет общего навыка, то есть обучение на одной семье миров не гарантирует пользы для домена, устроенного по-другому. Сама предпосылка метода, что динамику домена вообще можно точно записать как код, выполняется не для всех реальных задач: у многих доменов динамика частично скрыта, шумная или плохо формализуется, а именно для таких случаев метод в этом виде неприменим. Написать и проверить много независимых «миров» под конкретный домен, само по себе нетривиальная инженерная работа, и во сколько она обходится, аннотация не сообщает: цифры про дешевизну в тексте не подкреплены ни одним числом, дешёвой названа лишь итоговая генерация меток внутри уже готовых миров. Наконец, центральное заявление о насыщении эффекта для крупных моделей опирается на модель, чей размер в тексте не назван, поэтому по самой аннотации нельзя понять, на каком масштабе параметров выгода от метода уже исчезает и стоит ли ждать эффекта на моделях того размера, которые реально используются в продакшене.