Учёные нашли причину раздувания ответов при дистилляции моделей: несовпадение EOS-токенов

Исследователи изучили эффект «раздувания длины» (length inflation) в on-policy дистилляции (OPD), режиме обучения, где ответы модели-ученика могут становиться избыточно длинными и даже упираться в лимит генерации. Источником проблемы они называют рассинхрон токена завершения (EOS) между базовой моделью-учеником и дообученной моделью-учителем: на трёх семействах моделей, Qwen3, Llama и Gemma, обе модели могут помещать свою вероятность остановки на разные EOS-токены, даже если формально их наборы токенов остановки идентичны. Этот рассинхрон подавляет у ученика предпочитаемое им действие остановки, но не переносит на него надёжно то действие остановки, которое предпочитает учитель.
Авторы показывают, что просто выровнять набор токенов остановки при декодировании недостаточно. Если же считать функционально эквивалентные EOS-токены единым смысловым действием остановки, это заметно снижает раздувание длины, вызванное рассинхроном, и снижает во всех трёх семействах моделей. Дополнительно авторы проследили, как поведение остановки меняется в ходе обучения, на разных стадиях OPD в рамках так называемого K2-Horizon: предпочтения по токену остановки существенно сдвигаются по ходу обучения, а на поздних этапах OPD проявляется отдельное раздувание длины, которое сохраняется даже после того, как токены остановки выровнены.
Общий вывод авторов: рассинхрон токена завершения, важный, но не единственный источник динамики длины ответов в on-policy дистилляции. Вместе с работой они выложили реализацию с предложенными исправлениями обработки токена остановки.
Ключевые факты
- В on-policy дистилляции (OPD) ответы модели-ученика могут неоправданно разрастаться и упираться в лимит генерации.
- Причина, ученик и дообученный учитель по-разному распределяют вероятность остановки между разными EOS-токенами, даже когда формальные наборы токенов остановки совпадают.
- Проверка на трёх семействах моделей, Qwen3, Llama и Gemma, показала: одного выравнивания набора токенов остановки недостаточно.
- Если считать функционально эквивалентные EOS-токены единым смысловым действием остановки, раздувание длины заметно снижается во всех трёх семействах.
- На поздних стадиях обучения OPD (K2-Horizon) возникает отдельное раздувание длины, которое сохраняется даже после выравнивания токенов остановки; авторы выложили реализацию своих исправлений.
Почему это важно
On-policy дистилляция, способ передать поведение большой дообученной модели-учителя меньшей базовой модели-ученику через генерацию по собственной политике ученика. Если при этом ответы ученика начинают неоправданно разрастаться и упираться в лимит генерации, это впустую тратит вычислительный бюджет и портит качество обучения. Работа находит конкретный и до этого не описанный механизм такого раздувания, рассинхрон между тем, на каком именно токене остановки настроен учитель и на каком ученик, даже когда формальный набор допустимых токенов остановки у них одинаковый.
Кому это важно
Тем, кто занимается дистилляцией языковых моделей, сжатием знаний большой дообученной модели в меньшую, и сталкивается с тем, что ответы ученика после обучения становятся длиннее, чем нужно. Результат применим к разным семействам моделей: авторы проверили его на Qwen3, Llama и Gemma.
Как это применить
Авторы предлагают не просто выравнивать набор токенов остановки у ученика и учителя при декодировании (этого недостаточно), а трактовать функционально эквивалентные EOS-токены как единое смысловое действие остановки, то есть учитывать, что у разных токенов может быть одна и та же функциональная роль «закончить генерацию», даже если это разные токены. Такой подход заметно снижает вызванное рассинхроном раздувание длины во всех трёх проверенных семействах моделей. Вместе со статьёй авторы выложили реализацию с этими исправлениями обработки токена остановки.
Можно ли доверять
Это исследовательская работа с эмпирической проверкой сразу на трёх независимых семействах открытых моделей (Qwen3, Llama, Gemma) и дополнительным анализом по стадиям обучения (K2-Horizon), а не единичный случай на одной модели. Авторы также опубликовали код с реализацией предложенного исправления, что позволяет проверить результат самостоятельно. При этом в тексте аннотации не приведены конкретные численные величины, ни насколько велико раздувание длины изначально, ни насколько именно его снижает предложенный метод.
Риски и подводные камни
Сами авторы подчёркивают, что рассинхрон токена завершения, важный, но не исчерпывающий источник раздувания длины: даже после выравнивания токенов остановки на поздних стадиях OPD проявляется отдельное раздувание длины, природа которого в статье не объясняется и не устраняется предложенным методом. То есть решение снимает часть проблемы, а не всю её целиком.
«Одного лишь выравнивания набора токенов остановки при декодировании недостаточно, а если считать функционально эквивалентные EOS-токены единым смысловым действием остановки, это заметно снижает вызванное рассинхроном раздувание длины ответов во всех трёх семействах моделей.»
— авторы исследования