Представлена GigaChat Audio, ИИ-модель с таймкодами для 120-минутных записей

Представлена GigaChat Audio, ИИ-модель с таймкодами для 120-минутных записей

Разработчики представили GigaChat Audio, модель для понимания аудио, решающую задачу «временной привязки» (temporal grounding): большинство аудио-ИИ плохо справляются с указанием точного момента события в длинной записи, а не только с пересказом её содержания.

Модель отвечает на вопросы о записи с явными временными метками и работает с аудио длиной до 120 минут. Технически подход строится на чередовании периодических временных меток с непрерывными аудио-токенами; модель обучена на крупномасштабных синтетических данных, сгенерированных каскадным конвейером (несколько ИИ-этапов подряд формируют обучающие примеры).

По заявлению авторов, модель показывает высокую точность временной привязки как на коротких, так и на длинных бенчмарках, а также умеет строить описания и краткие пересказы отдельных фрагментов записи, привязанные к конкретному времени. В работе проведена серия абляций (экспериментов с отключением отдельных компонентов), они изучают, как способ представления времени, частота временных меток, токенизация и состав обучающих данных по длительности записей влияют на точность и вычислительные затраты.

Веса модели и датасеты выложены в открытый доступ на Hugging Face под названием GigaChat3.1-Audio-10B-A1.8B, авторы заявляют, что это сделано для дальнейших исследований в области понимания времени в аудио.

Ключевые факты

  • GigaChat Audio, модель для аудио, которая отвечает на вопросы с точными таймкодами, а не просто пересказывает содержание записи
  • Работает с аудио длиной до 120 минут
  • Метод: чередование периодических временных меток с непрерывными аудио-токенами, обучение на синтетических данных из каскадного конвейера
  • Проведена серия абляций, изучено влияние представления времени, частоты меток, токенизации и микса длительностей на точность и вычислительную стоимость
  • Веса модели и датасеты выложены в открытый доступ на Hugging Face (GigaChat3.1-Audio-10B-A1.8B)

Почему это важно

Большинство аудио-ИИ умеют пересказывать содержание записи, но плохо справляются с вопросом «в какой именно момент это произошло». GigaChat Audio нацелена именно на эту задачу, точную привязку ответа ко времени, причём на записях длиной до двух часов, что заметно длиннее типичных тестовых аудио.

Кому это важно

Разработчикам инструментов для расшифровки и анализа длинных аудио- и видеозаписей: подкастов, совещаний, звонков, лекций, там, где важно не просто получить пересказ, а найти конкретный момент, когда что-то было сказано или произошло.

Как это применить

Модель и обучающие датасеты выложены в открытом доступе под названием GigaChat3.1-Audio-10B-A1.8B на Hugging Face, так что их можно скачать и протестировать или использовать как основу для собственных экспериментов с временной привязкой в аудио.

Можно ли доверять

Заявленные результаты, точность временной привязки на коротких и длинных бенчмарках, приведены авторами в собственном описании модели; независимой проверки третьими сторонами в источнике нет. Открытая публикация весов и датасетов даёт возможность проверить заявления самостоятельно.

Риски и подводные камни

Обучающие данные для временной привязки синтетические, сгенерированные многоэтапным (каскадным) конвейером, а не размечены людьми, это обычная практика, но она может закладывать систематические ошибки каскадного пайплайна в саму модель. Конкретные числовые показатели точности в тексте источника не приведены.