AuK объединила генерацию и редактирование речи в одной открытой модели

AuK объединила генерацию и редактирование речи в одной открытой модели

Исследователи представили AuK, открытую фундаментальную модель, которая объединяет генерацию и редактирование речи в одном интерфейсе: пользователь описывает задачу текстовой инструкцией и добавляет аудио-контекст, а модель её выполняет. Модель охватывает пять групп задач: генерацию речи, редактирование содержания, улучшение и разделение звука, паралингвистическое редактирование (изменение тона, эмоциональной окраски, темпа речи) и акустическое редактирование.

Чтобы обучить модель такому широкому набору задач, авторы построили корпус примерно из 3,03 млрд пар «инструкция, аудио» и 1,95 млн часов эффективных обучающих данных, суммарно по всем пяти группам задач.

Архитектура AuK состоит из трёх частей. За понимание смысла инструкции отвечает мультимодальная большая языковая модель. За акустические характеристики, вариационный автоэнкодер (VAE), совместно обученный на речи, обычном аудио и музыке. Саму генерацию выполняет гибридный трансформер на основе rectified flow: двухпотоковые MMDiT-блоки сменяются объединёнными однопотоковыми DiT-блоками.

Обучение проходит в несколько этапов. Сначала модель «разогревают» только на генерации, затем переходят к совместному предобучению на генерации и редактировании вместе. После этого применяют два метода постобучения: оптимизацию по предпочтениям на основе обратной связи людей, для открытого (open-ended) редактирования, и обучение с подкреплением на основе вознаграждения, для генерации речи.

Чтобы удешевить вывод, модель дополнительно дистиллировали, с инициализацией по методу consistency и адаптированным под конкретные задачи (task-routed) вариантом Decoupled DMD. Результат назвали AuK-Flash: эта версия делает вывод за 4 шага без classifier-free guidance и работает в 4,5 раза быстрее полной модели по фактически затраченному времени выполнения (wall-clock) при сопоставимых условиях.

По данным авторов, AuK лидирует в генерации речи, и в zero-shot-режиме, и по текстовым инструкциям, а также в общем редактировании по инструкциям; в задачах восстановления сигнала (например, шумоподавлении) модель лишь на уровне конкурентов, без явного лидерства. Исходный код и веса модели выложены в открытый доступ, заявленная цель, воспроизводимость и дальнейшие исследования.

Ключевые факты

  • AuK, открытая (код и веса выложены в свободный доступ) фундаментальная модель, которая по текстовым инструкциям и генерирует, и редактирует речь в едином интерфейсе.
  • Обучена на ≈3,03 млрд пар «инструкция, аудио» и 1,95 млн часов эффективных обучающих данных по пяти группам задач: генерация речи, редактирование содержания, улучшение и разделение звука, паралингвистическое редактирование, акустическое редактирование.
  • Архитектура сочетает мультимодальную большую языковую модель (понимание смысла инструкции), VAE, совместно обученный на речи, аудио и музыке (акустические характеристики), и гибридный трансформер на rectified flow с двухпотоковыми MMDiT- и объединёнными однопотоковыми DiT-блоками.
  • Постобучение включает оптимизацию по человеческим предпочтениям (для редактирования) и обучение с подкреплением на основе вознаграждения (для генерации речи); дистиллированная версия AuK-Flash делает вывод за 4 шага без classifier-free guidance и работает в 4,5 раза быстрее полной модели.
  • По данным авторов, AuK лидирует в генерации речи, как в zero-shot-режиме, так и по текстовым инструкциям, и в общем редактировании по инструкциям, но лишь на уровне конкурентов в задачах восстановления сигнала вроде шумоподавления.

Почему это важно

Речевые ИИ-инструменты обычно устроены как набор узких моделей: одна для синтеза голоса, другая для шумоподавления, третья, для смены интонации или разделения звуковых дорожек. AuK, попытка свести генерацию и редактирование речи к одному интерфейсу, где задачу задают текстовой инструкцией и аудио-контекстом, а не выбором отдельного инструмента под каждый тип правки. По сути, авторы переносят на аудио тот же принцип, по которому одна языковая модель по инструкциям закрывает множество текстовых задач, и подкрепляют его корпусом на 3+ млрд обучающих пар и многоэтапным рецептом обучения, от «разогрева» до постобучения по предпочтениям и обучения с подкреплением.

Кому это важно

Разработчикам речевых и аудио-продуктов, дубляжа, голосовых ассистентов, инструментов монтажа подкастов, сервисов шумоподавления и восстановления звука, потому что код и веса модели открыты и её можно запустить или дообучить под свою задачу напрямую. Исследователям генеративных аудио-моделей, как пример рабочего рецепта: единая инструкционная модель на нескольких типах задач плюс дистилляция для скорости. Командам, для которых важна скорость вывода в проде, из-за версии AuK-Flash с ускорением в 4,5 раза.

Как это применить

Авторы выложили исходный код и веса модели в открытый доступ, их можно скачать, изучить архитектуру и запустить самостоятельно; условия лицензии и точное место публикации репозитория в самом отчёте не указаны. Там, где важна скорость (например, редактирование, близкое к реальному времени), стоит смотреть на дистиллированную AuK-Flash: она делает вывод за 4 шага без classifier-free guidance и работает в 4,5 раза быстрее полной модели. Поскольку модель управляется текстовыми инструкциями, для разных сценариев, генерации с нуля, редактирования содержания, шумоподавления, изменения паралингвистики или акустики, не нужен отдельный инструмент под каждый: подход можно попробовать на своей задаче через один и тот же интерфейс.

Можно ли доверять

Это технический отчёт, опубликованный на Hugging Face Papers, а не заметка независимого издания. В самой аннотации не названы ни авторы, ни организация, которая стоит за работой. Заявления о «лидирующих» результатах в генерации и редактировании и о «конкурентоспособности» в задачах восстановления сигнала, оценка самих авторов по их собственным экспериментам; конкретные бенчмарки и модели-конкуренты, с которыми сравнивали AuK, в аннотации не названы, указаны только категории задач, и независимо проверить масштаб отрыва по одному тексту нельзя. Не указаны и количество параметров, размер модели, а также условия лицензии на выложенные код и веса. В плюс то, что авторы вообще открывают код и веса: это делает независимую проверку в принципе возможной, даже если сама аннотация её не даёт.

Риски и подводные камни

Пока нет ни названных бенчмарков, ни моделей-конкурентов для сравнения, ни независимых тестов, оценить, насколько велик заявленный отрыв в качестве, со стороны нельзя. Отсутствие данных о размере модели и о лицензии усложняет планирование: неясно, сколько вычислительных ресурсов потребует запуск и на каких условиях можно использовать веса в своём продукте. Архитектура и обучение AuK, многокомпонентная многоэтапная система (мультимодальная LLM, VAE, гибридный трансформер, несколько стадий предобучения и постобучения, отдельная дистилляция), и воспроизвести её целиком по краткому отчёту, даже имея открытый код, скорее всего будет непросто.