Active Taskless Distillation: навык передали через одно слово на запрос

Active Taskless Distillation: навык передали через одно слово на запрос

В статье с Hugging Face Papers утверждается, что языковые модели могут передавать способности через текст, никак не связанный с целевой задачей. Отправная точка: после дообучения (post-training) модели обычно улучшают на данных под конкретную задачу. Ранее работы о «подсознательном обучении» (subliminal learning) показали, что сведения об этих обновлениях способны просачиваться через посторонние генерации, но в основном на примерах черт и предпочтений и с использованием больших объёмов выходных данных учителя.\n\nАвторы вводят метод Active Taskless Distillation (ATD). Он передаёт способность, используя всего одно слово от учителя на каждый запрос. ATD «прощупывает поведенческую тень» дообучения: отбирает запросы, на которых общий публичный предок учителя и ученика почти безразличен в выборе между двумя обычными словами. Ученик, инициализированный из этого предка, учится только на получившихся парах «запрос, слово». Ему не нужны ни примеры целевой задачи, ни логиты учителя, ни параметры учителя.\n\nВ основном эксперименте по программированию с моделью Qwen2.5-1.5B авторы сообщают о приросте на HumanEval+ в 5,34 процентного пункта по сравнению с точно подобранным контролем, учитывающим посторонние факторы (nuisance-matched control). Часть текста аннотации в этом месте повреждена, поэтому что именно посчитано числом 5 664, установить нельзя. Далее, по словам авторов, перенос показан и в научных знаниях, здравом смысле и понимании прочитанного, на других поколениях, размерах и семействах моделей. Функциональный анализ, как пишут авторы, показывает, что сила усвоенного сигнала отслеживает силу обновления учителя.

Ключевые факты

  • Метод Active Taskless Distillation (ATD) передаёт навык от дообученного учителя ученику, используя лишь одно слово учителя на запрос.
  • Ученик учится только на парах «запрос, слово»: без примеров целевой задачи, логитов и параметров учителя.
  • Запросы отбирают там, где общий публичный предок учителя и ученика почти безразличен между двумя обычными словами.
  • В основном эксперименте с Qwen2.5-1.5B прирост на HumanEval+ составил 5,34 п.п. относительно точно подобранного контроля.
  • Перенос показан также в научных знаниях, здравом смысле и понимании прочитанного; сила сигнала отслеживает силу обновления учителя.

Почему это важно

Работа показывает, что после дообучения в поведении модели остаётся «тень», которую можно считать даже по нейтральным словам. Прежние исследования подсознательного обучения касались в основном черт и предпочтений при большом объёме выходных данных учителя. Здесь, по утверждению авторов, передаётся именно способность, а объём сигнала минимален: одно слово на запрос.

Кому это важно

Исследователям обучения и дистилляции моделей, а также тем, кто занимается безопасностью: результат говорит о том, что сведения об обновлениях модели могут просачиваться через тексты, на первый взгляд не связанные с задачей.

Как это применить

Из доступного текста аннотации практическая инструкция не следует: код, релиз и подробности постановки опыта в ней не упомянуты. Идея метода: взять общего предка учителя и ученика, найти запросы, где он почти безразличен между двумя обычными словами, записать выбор учителя и дообучить ученика на этих парах.

Можно ли доверять

Это выводы самих авторов, приведённые в аннотации; независимой проверки в источнике нет. Текст аннотации частично повреждён в середине, а из чисел приведён только прирост 5,34 п.п. на HumanEval+ без исходных значений. Результаты для областей вне программирования в читаемой части не даны в цифрах.

Риски и подводные камни

Смысл числа 5 664 и часть описания контроля утрачены из-за повреждения текста, поэтому масштаб и условия основного опыта восстановить нельзя. Основной эксперимент проведён на небольшой модели Qwen2.5-1.5B. Сам факт скрытой передачи способностей через посторонний текст, если он подтвердится, создаёт вопросы для тех, кто полагается на фильтрацию данных.

«Мы обнаружили, что языковые модели могут передавать способности через текст, не связанный с задачей.»

— из аннотации статьи