X-AuT сжал аудио-энкодер Qwen3-ASR-0.6B почти без потери точности

X-AuT сжал аудио-энкодер Qwen3-ASR-0.6B почти без потери точности

Сокращение глубины аудио-энкодера снижает стоимость инференса речевых ИИ-моделей (speech LLM), но если убирать блоки целиком, это искажает эмбеддинги, которые дальше обрабатывает декодер: модель начинает пропускать фрагменты речи и слишком рано обрывать генерацию (преждевременный конец последовательности). Исследователи представили X-AuT, прогрессивный фреймворк, который решает эту проблему: сначала он короткими поведенческими пробами (behavioral probes) определяет, какие слои аудио-энкодера можно убрать с наименьшим ущербом, а затем восстанавливает точность урезанной модели через выравнивание представлений (representation alignment), кросс-масштабную дистилляцию (cross-scale distillation), постепенный по расписанию переход обучения на собственные предсказания модели-студента (scheduled student-policy supervision) и дообучение LoRA.

Основа языковой модели при этом остаётся замороженной, во время дистилляции обучаются только LoRA-адаптеры в слоях внимания и разделяемый выходной эмбеддинг (tied embedding). Для обучения берутся данные с наивысшим уровнем согласия из конвейера проверки согласованности транскриптов (transcript-consistency pipeline), а на этапе дообучения источники данных дополнительно перевзвешиваются.

Метод проверили на модели Qwen3-ASR-0.6B на десяти открытых китайско-английских бенчмарках. Сокращение аудио-энкодера с 18 до 16 слоёв не просто сохранило точность, а снизило среднюю по бенчмаркам ошибку распознавания с 5,61% до 5,27%. Более агрессивная версия, 14 слоёв, с 20,7% меньшим числом параметров аудио-блока, даёт ошибку 5,75%: немного хуже 18-слойного оригинала, зато заметно лучше прямого прореживания сразу до 14 слоёв, которое даёт 6,73% ошибки, поэтапный переход через промежуточные состояния явно выигрывает у одномоментного урезания. Отдельно авторы сравнили источник знаний для дистилляции: при одинаковом протоколе обучения модель, дистиллированная от учителя на 1,7 млрд параметров, даёт среднюю ошибку 5,55%, тогда как самодистилляция без внешнего учителя, 8,45%.

Авторы сами оговаривают ограничения: все цифры получены за один прогон (single-run), без повторов и оценки разброса, а эффект от сжатия неодинаков на разных бенчмарках. В тексте нет сравнения с внешними конкурирующими ASR- или speech-LLM-системами, цифры 8,45% и 6,73% это собственные абляции авторов, а не результаты других продуктов. Нет и данных о реальном ускорении инференса, только число параметров и ошибка распознавания, без задержки или пропускной способности. Имена авторов и их организация в тексте не указаны, не сказано, относительно какой версии (18- или 16-слойной) считали «20,7% меньше параметров», и не уточняется, будут ли открыты код и веса модели помимо сайта проекта.

Ключевые факты

  • X-AuT, фреймворк для прогрессивного сжатия аудио-энкодера речевых ИИ-моделей: слои для удаления выбираются поведенческими пробами, а точность восстанавливается кросс-масштабной дистилляцией и дообучением LoRA.
  • На модели Qwen3-ASR-0.6B сокращение аудио-энкодера с 18 до 16 слоёв снизило среднюю ошибку по десяти бенчмаркам с 5,61% до 5,27%, сжатие даже улучшило точность.
  • Более компактная версия (14 слоёв, на 20,7% меньше параметров аудио-блока) даёт ошибку 5,75%, заметно лучше прямого прореживания сразу до 14 слоёв (6,73%).
  • Дистилляция от учителя на 1,7 млрд параметров даёт 5,55% ошибки против 8,45% при самодистилляции без внешнего учителя.
  • Авторы прямо оговаривают: все цифры, с одного прогона (single-run), эффект неодинаков на разных бенчмарках, а сравнения с внешними конкурирующими системами в тексте нет.

Почему это важно

Инференс речевых ИИ-моделей дорог отчасти из-за аудио-энкодера, части, которая превращает звук в эмбеддинги для языковой модели. Его можно сделать компактнее, урезав число слоёв, но авторы показывают: наивное удаление целых блоков портит эмбеддинги, которые видит декодер, и порождает конкретные ошибки, пропуски фрагментов речи и слишком раннее завершение генерации. X-AuT показывает, что сжатие можно делать управляемо: на одной из двух заявленных точек (с 18 до 16 слоёв) точность распознавания не просела, а даже выросла, средняя ошибка снизилась с 5,61% до 5,27%, то есть более дешёвая по инференсу модель оказалась ещё и точнее исходной.

Кому это важно

Тем, кто разворачивает речевые ИИ-модели и ASR-системы в проде и упирается в стоимость инференса из-за размера аудио-энкодера, метод даёт готовый рецепт сжатия без переобучения языковой модели с нуля: её основа остаётся замороженной, меняются только LoRA-адаптеры и выходной эмбеддинг. Практически полезен и тем, кто уже использует модель Qwen3-ASR-0.6B, именно на ней получены обе рабочие точки, 16- и 14-слойная. Инженерам, занимающимся дистилляцией моделей в целом, интересно отдельное наблюдение: дистилляция от полноценного учителя на 1,7 млрд параметров (5,55% ошибки) заметно надёжнее самодистилляции без внешнего учителя (8,45%).

Как это применить

Пайплайн X-AuT, многоэтапный. Сначала короткие поведенческие пробы определяют, какую комбинацию слоёв аудио-энкодера оставить. Затем урезанная модель восстанавливается: выравнивание представлений, кросс-масштабная дистилляция, постепенный по расписанию переход обучения на предсказания самой модели-студента и, наконец, дообучение LoRA, ядро языковой модели при этом заморожено, обучаются только LoRA-адаптеры в слоях внимания и разделяемый выходной эмбеддинг. Обучающие данные отбираются по наивысшему уровню согласия из конвейера проверки согласованности транскриптов, а на дообучении источники данных перевзвешиваются. В статье описаны две готовые операционные точки: 16 слоёв, где точность выше исходной, и 14 слоёв, где модель компактнее, но точность немного ниже исходной. Их можно выбирать под допустимый компромисс между размером и точностью, поскольку для точки 14 слоёв поэтапное прореживание обыгрывает прямое урезание слоёв «в один шаг».

Можно ли доверять

Источник, полный текст научной статьи на HuggingFace, читается без искажений. Метод проверен на десяти открытых китайско-английских бенчмарках, выборка достаточно широкая для ASR-задачи. Но у результатов узкий периметр проверки: авторы сами называют их результатами одного прогона (single-run), без повторов и оценки разброса, и прямо пишут, что эффект от сжатия неодинаков на разных бенчмарках. В тексте нет сравнения с внешними конкурирующими ASR- или speech-LLM-системами, единственные точки сравнения (8,45% при самодистилляции, 6,73% при прямом прореживании), это собственные абляции авторов. Имена авторов и организация в тексте не указаны, поэтому независимо оценить, кто стоит за работой, по самому тексту нельзя.

Риски и подводные камни

Выигрыш неравномерен: на менее агрессивной точке (16 слоёв) точность действительно улучшилась, но на более агрессивной (14 слоёв) она чуть просела, с 5,61% до 5,75%, в обмен на 20,7% меньше параметров аудио-блока, причём в тексте не уточняется, относительно какой версии (18- или 16-слойной) считали это сокращение. Цифр про экономию на инференсе нет вовсе: есть только число параметров и ошибка распознавания, а задержки или пропускной способности в тексте нет, насколько метод реально ускоряет работу, по статье не проверить. Результаты, с одного прогона, без оценки устойчивости к разным сидам или повторным запускам. Не сказано, планируют ли авторы открыть код или веса модели помимо сайта проекта, и не расшифровано, что означает само название «X-AuT».