LAION выпустила LAION-BVD, открытый датасет из 80 млн видео
Организация LAION представила LAION-BVD (LAION Big Video Dataset), крупномасштабный открытый видеодатасет для мультимодального (видео, аудио, изображение) предобучения моделей. Из пула в 1,3 млрд специфичных для платформ видеоссылок, найденных через CommonCrawl, авторы скачали и обработали 80 млн видео общей длительностью 10 млн часов.
С помощью content-aware обнаружения сцен из видео извлечены клипы, для которых синтетически сгенерированы текстовые описания (капшны) как для видеоряда, так и для звуковой дорожки. Отдельно из видео извлечены кадры смены сцен, они используются как альтернативный источник данных изображение-текст: их визуальное распределение отличается от типичных веб-корпусов изображений и дополняет существующие источники для предобучения.
Модели, обученные на LAION-BVD, показывают конкурентоспособные результаты на стандартных бенчмарках видео-текст и аудио-текст. Модели ViCLIP, обученные на этом датасете, соответствуют или превосходят модели, обученные на InternVid, до 2,1% на видео-текстовых бенчмарках, причём качество устойчиво растёт при увеличении масштаба обучения с 10 до 50 млн клипов. Аудио-текстовые модели CLAP на LAION-BVD показывают конкурентоспособные результаты по сравнению с другими крупными неотобранными аудиодатасетами за счёт звуковых дорожек, извлечённых напрямую из видео. Кадровые CLIP-модели также демонстрируют высокое качество поиска изображение-текст на стандартных бенчмарках. Конкретные числовые значения для аудио- и кадровых бенчмарков в источнике не приведены.
Авторы объясняют выпуск датасета тем, что крупные видеодатасеты и обученные на них модели сейчас сосредоточены у небольшого числа преимущественно проприетарных технологических компаний, что ограничивает независимые исследования и воспроизводимость результатов. LAION-BVD выпущен исключительно для исследовательских целей, коммерческое использование запрещено; конкретная лицензия в тексте не названа. Авторы предупреждают, что датасет, как и другие крупные веб-корпуса, может содержать смещения, стереотипы и неравномерное представление языков, регионов и тем, которые способны унаследовать обученные на нём модели. Описание опубликовано в препринте на arXiv (авторы, Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti и ещё девять соавторов).
Ключевые факты
- LAION выпустила LAION-BVD, открытый видеодатасет для мультимодального предобучения: 80 млн скачанных видео общей длительностью 10 млн часов.
- Видео отобраны из пула 1,3 млрд специфичных для платформ ссылок, найденных через CommonCrawl.
- Из видео методом content-aware обнаружения сцен извлечены клипы с синтетически сгенерированными видео- и аудио-описаниями; отдельно извлечены кадры смены сцен для данных изображение-текст.
- Модели ViCLIP, обученные на LAION-BVD, соответствуют или превосходят модели на InternVid до 2,1% на видео-текстовых бенчмарках, с устойчивым ростом при масштабировании обучения с 10 до 50 млн клипов.
- Датасет доступен только для исследовательских целей, коммерческое использование запрещено; описание опубликовано в препринте на arXiv (12 соавторов).
Почему это важно
LAION-BVD, крупнейший открытый видеодатасет для мультимодального (видео+аудио+изображение) предобучения: 80 млн скачанных и обработанных видео общей длительностью 10 млн часов, отобранных из пула 1,3 млрд специфичных для платформ ссылок, найденных через CommonCrawl. По словам авторов, крупные видеодатасеты и обученные на них модели сейчас сосредоточены у небольшого числа преимущественно проприетарных технологических компаний, что ограничивает независимые исследования и воспроизводимость, LAION-BVD призван расширить открытый доступ к данным такого масштаба.
Кому это важно
Исследователям мультимодальных моделей (видео-текст, аудио-текст, изображение-текст), академическим лабораториям без доступа к закрытым корпусам крупных компаний, разработчикам открытых моделей вроде ViCLIP и CLAP.
Как это применить
Датасет предназначен исключительно для исследовательских целей, коммерческое использование запрещено. С помощью content-aware обнаружения сцен из видео извлечены клипы, для которых сгенерированы синтетические видео- и аудио-описания; отдельно из видео извлечены кадры смены сцен как альтернативный источник данных изображение-текст.
Можно ли доверять
Материал, официальная страница релиза LAION с описанием методологии и ссылкой на препринт на arXiv (авторы: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti и ещё девять соавторов). Заявленные результаты подкреплены сравнением: модели ViCLIP, обученные на LAION-BVD, соответствуют или превосходят модели, обученные на InternVid, до 2,1% на стандартных видео-текстовых бенчмарках, с устойчивым ростом качества при увеличении масштаба обучения с 10 до 50 млн клипов. Конкретные цифры бенчмарков для аудио-текстовых моделей CLAP и кадровых CLIP-моделей в тексте не приведены, указана лишь качественная оценка «конкурентоспособные результаты» и «высокое качество поиска».
Риски и подводные камни
Авторы прямо предупреждают, что LAION-BVD, как и другие крупные веб-датасеты, может содержать смещения, стереотипы и неравномерное представление языков, регионов и тем, обученные на нём модели способны унаследовать эти искажения. Датасет собран из открытых веб-источников через CommonCrawl, что поднимает вопросы прав и авторства контента; авторы призывают пользователей уважать права создателей контента и соблюдать применимые законы и условия платформ. Конкретная лицензия в тексте не названа, указано только текстовое ограничение «только для исследований, не для коммерческого использования».