Сколько синтетических данных нужно зонду активаций: охват, а не сложность
Зонды активаций (activation probes), это небольшие детекторы, которые следят за работой развёрнутых языковых моделей и обучаются на синтетических диалогах. Сколько таких диалогов нужно, до сих пор было открытым вопросом. Авторы статьи на arXiv построили кривые обучения на выборках от 10 до 590 синтетических примеров для трёх понятий мониторинга: ситуации с высокими ставками, ответы, вредные для человека, и ответы, не следующие инструкции пользователя. Проверка шла на четырнадцати отложенных (не участвовавших в обучении) оценочных распределениях и четырёх моделях-зондах; менялись также языковая модель-генератор данных и подробность промпта.
Первый результат: потребность в данных задаётся тем, что именно отслеживается. Зонды для «высоких ставок» и «вреда» оказываются в пределах нескольких сотых от своего плато начиная с 80 примеров на Gemma-3-27B-IT, а зондам для «невыполнения инструкции» нужно в несколько раз больше. Тот же порядок понятий сохраняется на трёх меньших моделях-зондах и на реальных примерах из dev-набора.
Второй результат касается совета из предыдущих работ: тратить бюджет генерации на ширину (больше видов данных), а не на глубину (больше примеров каждого вида). Нужную понятию глубину авторы измеряют как «размер половинного прироста» подогнанной кривой, число примеров, при котором достигнута половина всего выигрыша. Понятие и распределение вместе объясняют 42-45% дисперсии этого показателя, а генератор, модель-зонд и детальность промпта, менее 10%.
Главный вывод: значение этого показателя определяется охватом, а не сложностью каждого вида данных (числом примеров собственного вида, нужных распределению для насыщения). Медианный размер половинного прироста для каждого вида, по одному на оценочное распределение, составляет 7-11 примеров своего вида при всех трёх понятиях одинаково. Различается другое: как далеко примеры одного вида переносятся на остальные виды того же понятия. При «высоких ставках» перенос почти полный, при «вреде» меньше, при «невыполнении инструкции», наименьший. Именно это объясняет основную часть разрыва между понятиями и на сгенерированных, и на реальных примерах.
Отсюда практический итог: ширина окупается по-разному. Для «невыполнения инструкции», где ни один вид не покрывает другой, нужно много видов данных. Для «высоких ставок», где один вид покрывает остальные, ширина почти избыточна. Авторы публикуют оценочные наборы, dev-наборы и сгенерированные наборы.
Ключевые факты
- Кривые обучения зондов активаций построены на 10, 590 синтетических примерах для трёх понятий: высокие ставки, вред для человека, невыполнение инструкции пользователя; проверка, на четырнадцати отложенных распределениях и четырёх моделях-зондах.
- На Gemma-3-27B-IT зонды для «высоких ставок» и «вреда» выходят в пределы нескольких сотых от плато с 80 примеров, зондам для «невыполнения инструкции» нужно в несколько раз больше; порядок сохраняется на трёх меньших моделях и на реальных примерах.
- Понятие и распределение объясняют 42, 45% дисперсии размера половинного прироста, генератор, модель-зонд и детальность промпта, менее 10%.
- Медианный размер половинного прироста для каждого вида данных, 7, 11 примеров своего вида при всех трёх понятиях; различается перенос между видами: почти полный при «высоких ставках», наименьший при «невыполнении инструкции».
- Ширина (больше видов данных) необходима для «невыполнения инструкции» и почти избыточна для «высоких ставок»; авторы публикуют оценочные, dev- и сгенерированные наборы.
Почему это важно
Зонды активаций применяют для мониторинга развёрнутых языковых моделей, а обучают их на синтетических диалогах. Генерация таких данных стоит ресурсов, и вопрос «сколько хватит» раньше оставался открытым. Работа предлагает объяснение: решает не сложность отдельного вида данных (здесь все виды ведут себя похоже, медиана, 7-11 примеров своего вида), а то, насколько один вид переносится на другие виды того же понятия. Это уточняет совет предыдущих работ тратить бюджет на ширину, а не на глубину.
Кому это важно
Прежде всего тем, кто обучает мониторы для языковых моделей на синтетических данных: командам безопасности и оценки качества, исследователям интерпретируемости. Результаты полезны и тем, кто планирует бюджет на генерацию обучающих наборов для детекторов.
Как это применить
Согласно выводам авторов, перед генерацией полезно понять, какое понятие отслеживается. Если один вид данных почти покрывает остальные, как при «высоких ставках», хватает небольшого числа примеров (на Gemma-3-27B-IT, порядка 80). Если виды не покрывают друг друга, как при «невыполнении инструкции», нужно много разных видов данных и в несколько раз больше примеров. Авторы выложили оценочные наборы, dev-наборы и сгенерированные наборы, на которых можно воспроизвести и проверить результаты.
Можно ли доверять
Это научная статья на arXiv, пересказ опирается на её аннотацию. Выводы подкреплены проверкой на четырнадцати отложенных распределениях, четырёх моделях-зондах, разных генераторах и уровнях детальности промпта, а также на реальных примерах из dev-набора; оценочные наборы выпущены в открытый доступ. Числа вроде «около 80 примеров» относятся к конкретной модели Gemma-3-27B-IT и трём понятиям мониторинга, так что переносить их на другие задачи нужно осторожно.
Риски и подводные камни
Выводы получены для трёх конкретных понятий и конкретного набора распределений; для других задач мониторинга охват может вести себя иначе. Порог «80 примеров» указан для Gemma-3-27B-IT. Для зондов «невыполнения инструкции» потребность описана лишь как «в несколько раз больше», точной цифры нет. Вывод о том, что ширина почти избыточна при «высоких ставках», не означает, что она не нужна вовсе для других понятий.
«Потребность определяется тем, что именно отслеживается.»
— из аннотации статьи