TTPO: новый метод дообучения на лету поднял точность Qwen3-1.7B в математике до 45,2% без разметки

TTPO: новый метод дообучения на лету поднял точность Qwen3-1.7B в математике до 45,2% без разметки

Обучение с подкреплением (RL) и самодистилляция на собственной политике (on-policy self-distillation, OPSD), методы дообучения, которые в последнее время сильно продвинули математические рассуждения у больших языковых моделей. Но у обоих один и тот же изъян: им нужна эталонная разметка ответов, а значит их нельзя применять для дообучения модели прямо во время работы (test-time training, TTT), когда правильных ответов заранее никто не знает. Естественная замена, псевдоразметка голосованием большинства: модель много раз решает одну задачу, а «правильным» считается ответ, который встретился чаще всего. Но этот приём хрупкий: если голосование ошиблось, неверный ответ становится учителем и портит все токены обучения.

Авторы заметили асимметрию в этой ошибке: попытки решения (rollouts), которые НЕ совпали с ответом большинства, почти всегда неверны, независимо от того, было ли само голосование правильным. На этом наблюдении построен Test-Time Policy Optimization (TTPO), асимметричная целевая функция. Попытки, согласные с псевдоразметкой, TTPO дистиллирует через OPSD; несогласные, штрафует через групповое обучение с подкреплением (Grouped RL). Дополнительно применяется отбор на уровне токенов: в дистилляции снижается вес уже «сошедшихся» позиций, а в RL-штрафе учитываются только уверенные ошибки. Благодаря такой асимметрии оба обновления остаются устойчивыми даже при частых ошибках псевдоразметки, а по мере обучения модели голосование большинства становится точнее и даёт всё более надёжный самоконтроль.

Без единой размеченной метки TTPO сравнялся по качеству с OPSD, обучаемым на эталонной разметке, на пяти конкурсных математических бенчмарках (какие именно, в тексте не названо). На модели Qwen3-1.7B в режиме тестового дообучения (TTT) точность выросла с 38,0% до 45,2%. В режиме без «размышления» (без явной цепочки рассуждений) прирост составил от +25,2% до +36,4%. Авторы также сообщают о сильном переносе метода между разными типами задач.

Ключевые факты

  • TTPO, метод дообучения языковой модели прямо во время работы (test-time training), не требующий размеченных ответов
  • Использует асимметрию: попытки решения, не совпавшие с ответом большинства голосования, почти всегда ошибочны
  • Согласные попытки дистиллируются через OPSD, несогласные, штрафуются через групповое RL, плюс отбор на уровне токенов
  • На Qwen3-1.7B в режиме TTT точность выросла с 38,0% до 45,2% без единой размеченной метки
  • Без размышления прирост составил от +25,2% до +36,4%; на пяти конкурсных бенчмарках TTPO сравнялся с OPSD, обученным на эталонной разметке

Почему это важно

RL и OPSD, главные методы дообучения моделей для математических рассуждений, но оба завязаны на эталонную разметку и потому непригодны для обучения модели прямо во время работы. Простая замена, голосование большинства, ненадёжна: одна ошибка голосования портит всё обучение. TTPO предлагает асимметричную целевую функцию, которая остаётся устойчивой даже при частых ошибках псевдоразметки, и делает дообучение без разметки практически рабочим.

Кому это важно

Исследователям и инженерам, которые занимаются математическими и логическими рассуждениями у языковых моделей и хотят дообучать модель на лету, без доступа к размеченным ответам, например, при работе с новыми или узкоспециализированными задачами, где готовой разметки просто нет.

Как это применить

TTPO применяется как схема дообучения во время инференса: модель генерирует несколько попыток решения одной задачи, псевдометкой служит ответ большинства, согласные с ней попытки дистиллируются через OPSD, несогласные штрафуются через групповое RL, а отбор на уровне токенов дополнительно фокусирует обучение на неоднозначных позициях. Авторы показывают эффект на модели Qwen3-1.7B (рост точности с 38,0% до 45,2% в TTT) и на пяти конкурсных математических бенчмарках, где результат сравнялся с обучением на эталонной разметке.

Можно ли доверять

Текст представляет собой аннотацию к статье с сайта Hugging Face Papers; в нём не указаны ни авторский коллектив, ни институциональная принадлежность, ни конкретные названия пяти бенчмарков, ни место публикации. Заявленные цифры, это собственные результаты авторов без независимого подтверждения; сравнение приведено только с одним конкурентным методом (label-supervised OPSD), без сопоставления с другими альтернативами, включая простое голосование большинства без TTPO.

Риски и подводные камни

Метод по-прежнему опирается на качество голосования большинства как источник псевдоразметки: если базовая модель систематически ошибается в определённом классе задач, асимметричное предположение «несогласный ответ обычно неверен» может не выполняться. Из текста не ясно, насколько результат переносится за пределы математических рассуждений и конкурсных задач, и как метод ведёт себя на моделях другого размера, кроме протестированной Qwen3-1.7B.