YuE2 обошла Suno v5 в генерации песен по тесту SongBench
На сайте map-yue2.github.io представлены три специализированные модели для музыки: YuE2, для генерации песен, MERT2, для представления (эмбеддинга) музыкального аудио и SheetSage2, для автоматической транскрипции музыки. Кто их разработал, на странице не указано: авторы говорят о себе только «мы» и «наши модели», без имени человека, команды, организации или ссылки на статью и код. Сайт устроен как интерактивная демонстрация: раздел «избранные партитуры» (Selected score) даёт послушать песню и затем разобрать её мелодию, ритм и аккорды по символическому плану; «кавер и редактирование» (Cover & Editing) показывает, как меняются мелодия, текст, темп и аранжировка знакомой песни; «агентное редактирование музыки» (Agentic music editing) перестраивает песню через диалог с моделью; «обзор жанров» (Genre Explorer) собирает примеры прослушивания по жанрам и языкам.
Главная заявленная цифра, сравнение с Suno v5. На бенчмарке WildSongBench (192 запроса, 15 сравниваемых настроек систем, 7 метрик оценки, замер от 5 сентября 2026 года) YuE2 в режиме best-of-8, когда из восьми сгенерированных вариантов по музыкальности, точности следования запросу и точности текста песни выбирается один, набрала 6.9632 балла по метрике SongBench. Это самый высокий средний балл среди всех 15 настроек систем в сравнении; Suno v5 в том же сравнении получила 6.8721. Источник сам уточняет, что при разных из семи метрик порядок настроек систем меняется, то есть превосходство YuE2 относится к итоговому среднему баллу SongBench, а не к лидерству по каждому отдельному показателю.
MERT2, модель представления музыкального аудио, существует в двух вариантах энкодера: MERT2-30s (обучающий контекст 30 секунд) и MERT2-FS (300 секунд, «полная песня»); у обоих по 632 млн параметров. На бенчмарке MARBLE (15 метрик, сравнение с девятью опубликованными базовыми моделями) MERT2 показал лучший результат по 14 из 15 метрик, в задачах тегирования, определения тональности, жанра и распознавания эмоций. Например, точность жанра на датасете GTZAN у MERT2-30s, 91.72, точность уточнённой тональности на GiantSteps у MERT2-FS, 67.05. Источник уточняет методику: итоговый счёт лучшего результата берётся как лучший из двух энкодеров, а представления модели для каждой задачи выбирались по значению уже на тестовой выборке.
SheetSage2, одна модель сразу для шести задач транскрипции музыки: определение бита, сильной доли такта, тональности, аккордов, структуры и мелодии. Она достигла лучшего результата по 10 из 13 метрик в сравнении с SheetSage1, Madmom и системами, заточенными под отдельные задачи; при этом использовалась одна модель, выбранная по значению функции потерь на валидации, а не отдельная модель под каждую задачу. Примеры баллов: F1 распознавания вокальной мелодии по классам высоты тона на датасете RWC-Pop, 82.51, точность распознавания аккордов (мажор/минор) на датасете osu2017, 90.08. На датасете Chords1217 (1217 треков) сравнение не полностью равноценно: по признанию самого источника, базовая модель ChordFormer оценивалась пятикратной кросс-валидацией, а SheetSage2, одной фиксированной моделью сразу на всех 1217 треках.
Все три модели обучены преимущественно на музыке с лицензией CC0 и на синтетических данных; большую часть синтетических данных по лицензии поставляет компания Tokenwave.AI. Объём обучающих данных разный: у MERT2, 700 тысяч часов, у YuE2, 346 тысяч часов, у SheetSage2, 28,4 тысячи часов. Источник добавляет, что придерживается «этичного и ответственного использования данных», не раскрывая, что это означает на практике.
Страница не даёт ссылки на статью, код, технический отчёт или условия лицензии ни для одной из моделей и не указывает шкалу метрики SongBench, из-за этого нельзя содержательно оценить, насколько велик разрыв между баллами YuE2 и Suno v5.
Ключевые факты
- YuE2 в режиме best-of-8 набрала 6.9632 балла по метрике SongBench на бенчмарке WildSongBench (192 запроса, 15 сравниваемых настроек систем), выше, чем Suno v5 (6.8721) в том же сравнении; сам источник отмечает, что порядок настроек систем меняется в зависимости от метрики.
- MERT2 (два энкодера по 632 млн параметров, 30-секундный и 300-секундный, «полная песня») заняла первое место по 14 из 15 метрик бенчмарка MARBLE среди девяти опубликованных базовых моделей: например, точность жанра на GTZAN, 91.72, точность тональности на GiantSteps, 67.05.
- SheetSage2, одна модель для шести задач транскрипции музыки (бит, сильная доля такта, тональность, аккорды, структура, мелодия), достигла лучшего результата по 10 из 13 метрик; F1 вокальной мелодии на RWC-Pop, 82.51, точность аккордов на osu2017, 90.08.
- Модели обучены преимущественно на музыке с лицензией CC0 и синтетических данных (большую часть синтетики по лицензии поставляет Tokenwave.AI): у MERT2, 700 тыс. часов обучающих данных, у YuE2, 346 тыс. часов, у SheetSage2, 28,4 тыс. часов.
- Кто разработал модели, не указано (только безличное «мы»); нет ссылки на статью, код или лицензию, а шкала метрики SongBench не раскрыта, оценить величину разрыва с Suno v5 по существу нельзя.
Почему это важно
Генерация песен, представление музыкального аудио для классификации и автоматическая транскрипция обычно решаются разными узкоспециализированными моделями, здесь заявлены сразу три модели с лучшими на момент публикации результатами каждая в своей категории. У YuE2 заявлен ещё один момент, кроме самого качества: генерация опирается на «символический план» песни (нечто вроде нотной раскладки мелодии, ритма и аккордов), который можно посмотреть и отредактировать, а не только переслушать готовую аудиодорожку целиком, отсюда и демо-разделы для кавера, точечного редактирования и «агентного» изменения песни через диалог. При этом YuE2 напрямую сравнивается с Suno v5, одним из самых узнаваемых коммерческих генераторов музыки: если цифры подтвердятся независимо, это сигнал, что модели без статуса крупного коммерческого продукта подбираются по качеству генерации к лидеру рынка. Отдельно заметно, что SheetSage2 закрывает шесть разных задач транскрипции одной моделью, тогда как раньше это обычно требовало отдельной модели под каждую задачу.
Кому это важно
Разработчикам инструментов на музыкальном ИИ: MERT2 как модель представления аудио пригодится для тегирования, поиска по жанру, тональности и эмоциональной окраске; SheetSage2 закрывает разом шесть задач транскрипции (бит, сильная доля такта, тональность, аккорды, структура, мелодия) одной моделью вместо нескольких специализированных. Исследователям в области анализа музыки (MIR), как новая точка сравнения на бенчмарке MARBLE и на транскрипционных задачах. Командам, которые строят продукты для генерации музыки и сравнивают себя с Suno, как ориентир по качеству, хотя бы по одной конкретной метрике. Музыкантам, продюсерам и обычным пользователям, пока скорее нет: ни лицензии, ни доступа, ни цены на странице не указано.
Как это применить
Практически применить сегодня нечего: страница не даёт ни кода, ни весов моделей, ни технического отчёта, ни условий лицензии. Что можно сделать уже сейчас, держать цифры в поле зрения как текущий верхний ориентир: 14 из 15 метрик MARBLE у MERT2, при выборе модели представления аудио под тегирование или классификацию; 10 из 13 метрик у SheetSage2, как альтернативу набору отдельных моделей под каждую задачу транскрипции. Тем, кто сравнивает генерацию песен с Suno v5, стоит помнить: заявленное превосходство YuE2 получено в режиме best-of-8 (выбор одного варианта из восьми сгенерированных) и относится к среднему баллу SongBench по 192 запросам, а не к результату при одной-единственной попытке генерации.
Можно ли доверять
На странице не указано, кто разработал модели, только безличное «мы»/«наши модели», без имени человека, команды или организации. Нет ссылки на статью, код или технический отчёт, то есть цифры нельзя проверить независимо по первоисточнику, только на слово авторов страницы. Не указана и шкала метрики SongBench (максимум неизвестен), поэтому разрыв между YuE2 (6.9632) и Suno v5 (6.8721) невозможно оценить содержательно, это может быть существенное отличие или статистический шум, проверки на значимость источник не приводит. В пользу доверия, то, что сравнение охватывает 15 разных настроек систем и 7 метрик на WildSongBench, а не одно подобранное число, а баллы MERT2 и SheetSage2 даны по конкретным публичным датасетам (GTZAN, GiantSteps, RWC-Pop, osu2017), которые можно сверить при появлении независимого воспроизведения.
Риски и подводные камни
Методика подсчёта лучшего результата выбрана самими авторами и не везде симметрична: у MERT2 засчитывается лучший из двух вариантов энкодера, а представления для сравнения отбирались по значению уже на тестовой выборке, это может завышать итоговый счёт относительно единой фиксированной настройки. На датасете Chords1217 сравнение прямо неравноценно: по признанию самого источника, базовая модель ChordFormer проверялась пятикратной кросс-валидацией, а SheetSage2, одной фиксированной моделью на всех 1217 треках. Источник сам предупреждает, что порядок настроек систем на WildSongBench меняется в зависимости от метрики, лидерство YuE2 не универсально по каждому из семи показателей. Ни количество параметров, ни архитектура самих YuE2 и SheetSage2 не раскрыты, известный параметр (632 млн) относится только к энкодерам MERT2. Наконец, ни для одной из трёх моделей не указана лицензия: то, что обучающие данные лицензированы как CC0 или синтетика, не гарантирует, что сами модели открыты или доступны для использования.