Alibaba выпустила Qwen-Music, нейросеть сочиняет песни с вокалом и кавер-версии

Команда Qwen (Alibaba) представила технический отчёт о Qwen-Music, модели генерации музыки, которая создаёт музыкально насыщенные и качественные по звучанию песни с полноценным вокалом. Модель решает две задачи: генерация музыки по тексту (Text to Music Generation), создание совершенно новых песен по текстовому описанию, тексту песни и музыкальным атрибутам, и генерация кавер-версий (Cover Song Generation), переработка существующих песен в другом стиле и с другим вокалом.
Архитектура состоит из трёх компонентов. Qwen-Music-Tokenizer сжимает аудио в поток «музыкальных семантических токенов» с частотой 25 Гц и одной кодовой книгой (single-codebook), сохраняя смысловую и мелодическую информацию для предсказания языковой моделью. На основе этих токенов Qwen-Music-LLM выполняет авторегрессионное моделирование музыки; ключевая новизна, механизм «цепочки рассуждений по мелодии» (Melody-CoT), который сначала планирует мелодию, а затем генерирует полную песню, это повышает креативность, музыкальность, структурную связность и точность клонирования мелодии по референсному аудио. Чтобы преодолеть ограничения по качеству звучания, которые дают дискретные семантические токены, третий компонент, Qwen-Music-Render, выполняет генеративный рендеринг в стерео, добавляя акустические детали и создавая высококачественные стереоволны.
Qwen-Music-LLM обучили более чем на 5 миллионах часов многоязычных музыкальных данных, охватывающих сотни языков. Обучение включало предварительный этап с учётом качества данных (quality-aware pre-training) и последовательное дообучение: инициализацию с учителем (supervised initialization), офлайн-DPO и онлайн-GSPO, для дальнейшего улучшения музыкальности и следования инструкциям.
На 600 тестовых запросах на китайском и английском языках Qwen-Music показала лучший результат (state-of-the-art) по 13 из 16 объективных метрик музыкальности и качества звука. В оценке живыми экспертами модель также предпочли проприетарным системам-конкурентам. В задаче создания кавер-версий Qwen-Music точнее сохраняет мелодию оригинала, чем ведущие проприетарные системы.
Ключевые факты
- Alibaba (команда Qwen) выпустила Qwen-Music, модель генерации музыки с полноценным вокалом по текстовому описанию и функцией кавер-версий существующих песен.
- Архитектура из трёх частей: Tokenizer сжимает аудио в семантические токены с частотой 25 Гц, LLM с механизмом Melody-CoT планирует мелодию перед генерацией всей песни, Render выполняет генеративный стерео-рендеринг для высокого качества звука.
- Модель обучена более чем на 5 млн часов многоязычной музыки на сотнях языков; постобучение включает офлайн-DPO и онлайн-GSPO.
- На 600 тестовых запросах Qwen-Music показала SOTA-результат по 13 из 16 объективных метрик, и профессиональные оценщики предпочли её проприетарным системам-конкурентам.
- В задаче создания кавер-версий Qwen-Music точнее сохраняет мелодию оригинала, чем ведущие проприетарные системы.
Почему это важно
Пока большинство нейросетей для музыки создают в основном инструментал, Qwen-Music нацелена на полноценные песни с вокалом, за счёт связки токенизатора, языковой модели с планированием мелодии (Melody-CoT) и отдельного модуля стерео-рендеринга для качества звука. По заявленным в отчёте результатам, SOTA на 13 из 16 объективных метрик и предпочтение экспертов на стороне Qwen-Music, модель позиционируется как конкурент проприетарным системам генерации музыки, а не только открытым аналогам.
Кому это важно
Разработчикам и исследователям в области генеративного аудио, как ориентир по архитектуре (Tokenizer + LLM + Render, механизм Melody-CoT) и по методике обучения (5 млн часов данных, DPO, GSPO). Музыкантам, продюсерам и командам, создающим музыкальные ИИ-инструменты, как потенциальная технология для генерации демо-треков, аранжировок и кавер-версий. Тем, кто следит за конкуренцией Alibaba/Qwen с проприетарными системами генерации музыки.
Как это применить
В техническом отчёте не указаны условия доступа, цена или дата публичного релиза модели, только архитектура, метод обучения и результаты оценки. Практически применить Qwen-Music пока можно скорее как референс для архитектурных решений (Melody-CoT, разделение семантического моделирования и рендеринга), чем как готовый сервис, доступность источник не раскрывает.
Можно ли доверять
Результаты, из собственного технического отчёта команды Qwen: тестовая выборка 600 запросов на китайском и английском языках, 13 из 16 метрик и предпочтения «профессиональных оценщиков» сформированы и опубликованы самими авторами, независимой верификации в тексте нет. Это не делает результаты недостоверными само по себе, но методика сравнения с «ведущими проприетарными системами», какими именно, в тексте не названо, в отчёте не детализирована.
Риски и подводные камни
Функция кавер-версий, переработка существующих песен с сохранением мелодии оригинала, поднимает вопросы авторского права: в отчёте не обсуждаются ни лицензирование исходных треков, ни политика использования чужих голосов. Также не раскрыты ограничения модели, устойчивость к артефактам, охват жанров и языков за пределами заявленных тестов, источник об этом не сообщает.