MASS: новый метод отбора данных для дообучения LLM сохраняет качество на малой доле выборки
Авторы статьи решают задачу отбора данных для контролируемого дообучения (SFT) больших языковых моделей: по мере роста объёма кандидатных данных всё важнее выбирать из них ценное подмножество, чтобы снизить стоимость обучения и одновременно не потерять в качестве модели.
Проблема существующих методов, по словам авторов, в том, что они измеряют разнообразие данных напрямую в исходном пространстве эмбеддингов. В этом пространстве вперемешку смешаны сразу несколько разных сигналов: доминирующие семантические направления, тонкие различия в разметке (supervision) и локальный шум, из-за этого геометрические метрики разнообразия оказываются ненадёжными ориентирами для отбора.
Авторы предлагают решать отбор данных как иерархическую задачу покрытия, от грубого уровня к точному, и называют свой метод MASS. Работает он в два этапа. Сначала плотный автокодировщик строит низкоразмерные координаты главного многообразия данных, это даёт грубую семантическую группировку всего массива на смысловые кластеры. Затем уже внутри каждой такой группы в дело вступает TopK-разреженный автокодировщик: он выделяет немногочисленные, но информативные признаки и с их помощью выполняет качественно-ориентированный отбор, то есть ищет внутри группы не просто разные, а именно ценные и разнообразные примеры.
Метод проверили на двух датасетах для мультимодального (визуально-текстового) дообучения, Vision Flan и LLaVA-CoT. По результатам экспериментов MASS стабильно превосходит сильные базовые методы отбора данных при разных бюджетах выборки (то есть при разных ограничениях на объём отбираемых данных). В части настроек MASS достигает результата обучения на полном датасете или превосходит его, используя лишь небольшую часть данных. Конкретные числовые показатели точности, размеры бюджетов и названия сравниваемых базовых методов в тексте источника не приведены.
Ключевые факты
- Отбор данных для дообучения LLM авторы формулируют как иерархическую задачу покрытия, от грубых семантических групп к точным сигналам качества внутри них, а не как прямое измерение разнообразия в исходном пространстве эмбеддингов.
- Метод MASS работает в два этапа: плотный автокодировщик сжимает данные в низкоразмерные координаты главного многообразия и грубо группирует их по смыслу.
- Внутри каждой группы TopK-разреженный автокодировщик находит немногочисленные, но информативные признаки и по ним отбирает качественные и разнообразные примеры, это второй, точный этап покрытия.
- На датасетах Vision Flan и LLaVA-CoT MASS стабильно обходит сильные базовые методы отбора данных при разных бюджетах выборки.
- В ряде настроек MASS достигает или превосходит качество обучения на полном датасете, используя лишь малую его часть; точный размер этой части в тексте источника не указан.
Почему это важно
Чем больше становятся наборы данных для дообучения LLM, тем дороже обучать модель на всём массиве и тем важнее уметь заранее выбрать из него самое ценное подмножество. Авторы указывают на конкретный изъян существующих методов отбора: они меряют разнообразие данных прямо в исходном пространстве эмбеддингов, где перемешаны доминирующие смысловые направления, тонкие различия в разметке и локальный шум, из-за этого метрика разнообразия становится ненадёжной. MASS решает это разделением задачи на два уровня: сначала грубая семантическая группировка через низкоразмерные координаты многообразия, затем точный отбор внутри группы через разреженные признаки TopK-автокодировщика. Такое разделение, рабочая альтернатива методам, где всё разнообразие пытаются оценить одной метрикой в исходном пространстве.
Кому это важно
В первую очередь, исследователям и инженерам, которые готовят и фильтруют данные для дообучения языковых и мультимодальных моделей: чем точнее отбор, тем меньше данных нужно скачать, разметить и прогнать через обучение при том же качестве результата. Эксперименты в статье поставлены на мультимодальных (визуально-текстовых) датасетах Vision Flan и LLaVA-CoT, так что метод в первую очередь адресован командам, которые дообучают модели с обработкой изображений и текста, а не только текстовые LLM.
Как это применить
Пайплайн MASS, это надстройка над этапом подготовки данных, а не сама модель: сначала на всём пуле кандидатных данных обучается плотный автокодировщик, дающий низкоразмерные координаты главного многообразия и грубую группировку по смыслу; затем внутри каждой группы обучается TopK-разреженный автокодировщик, который вычленяет информативные признаки и по ним отбирает финальное подмножество под заданный бюджет данных. В источнике не указаны ни доступность кода, ни лицензия, ни конкретные размеры бюджетов, при которых воспроизводились результаты, судить о трудозатратах внедрения по одному тексту статьи нельзя.
Можно ли доверять
Материал, препринт на arXiv, то есть без подтверждения, что статья прошла рецензирование конференции или журнала. Текст источника (аннотация) не содержит числовых результатов, ни точных значений точности, ни процентов улучшения, ни размеров бюджетов, при которых сравнивались методы, ни названий самих базовых методов отбора данных, с которыми сравнивают MASS, ни имён авторов или их организации. Формулировки об эффективности MASS, «стабильно превосходит», «в некоторых настройках достигает или превосходит полный датасет», качественные, без точных цифр; проверить масштаб выигрыша по одной аннотации не получится, нужен полный текст статьи с таблицами результатов.
Риски и подводные камни
Главный риск для практика, отсутствие конкретики: без чисел неясно, насколько велик выигрыш MASS над базовыми методами и при каком именно объёме отобранных данных он достигает качества полного датасета. Метод добавляет собственный этап обучения, сначала автокодировщика для координат многообразия, затем разреженного автокодировщика для признаков внутри групп, а это дополнительные вычислительные затраты и гиперпараметры (размер скрытого пространства, порог TopK), эффект от подбора которых по аннотации не оценить. Эксперименты ограничены двумя мультимодальными бенчмарками (Vision Flan и LLaVA-CoT); перенос метода на чисто текстовое SFT или на другие домены источник не описывает.