Нейросеть распознаёт услышанную речь по МЭГ и объясняет, как это делает

Нейросеть распознаёт услышанную речь по МЭГ и объясняет, как это делает

Нейросети уже умели распознавать короткие отрезки услышанной речи по записям магнитоэнцефалографии (МЭГ), неинвазивного метода, измеряющего магнитные поля мозга. Такие модели обучают с CLIP-подобной целевой функцией, сопоставляя сигнал мозга с аудио-эмбеддингами модели wav2vec 2.0. Проблема в том, что веса таких сетей не соответствуют никаким измеримым электрофизиологическим величинам, поэтому оставалось неясно, какие именно свойства речи модель на самом деле использует для распознавания.

Авторы взяли за основу одну из лучших существующих архитектур для распознавания речи по МЭГ и переделали в ней и входную часть, и декодер. Пространственное внимание, которое раньше работало по плоской раскладке датчиков шлема, заменили на сферические гармоники, заданные прямо на трёхмерной геометрии МЭГ-шлема. Количество индивидуальных для каждого испытуемого веток представления сократили с 270 до 25, к каждой ветке добавили временной фильтр, чтобы она соответствовала конкретному нейронному источнику и по расположению, и по времени, а сам декодер сделали более мелким (менее глубоким). Перед обучением из данных также убирали компоненты, связанные с движениями глаз и сердечной активностью, чтобы модель не подстраивалась под эти паразитные сигналы вместо речи.

На бенчмарке MEG-MASC модель достигла точности 39,75 ± 0,34% по метрике top-1 (угадать точный сегмент среди 1005 кандидатов), результат усреднён по шести обученным решениям, при этом декодер использует примерно в 20 раз меньше параметров, чем более ранняя версия архитектуры. Веса модели удалось сопоставить с источниками в мозге: они указывают на зоны, которые согласуются с известной сетью восприятия речи, а ветви, связанные с левым полушарием, несут более высокочастотные ритмические компоненты, которых не видно в правом полушарии.

Чтобы понять, какие именно свойства звука модель использует, авторы применили парный метод окклюзии (маскирования) на самих записях МЭГ: из 19 проверенных свойств стимула 15 вносят заметный вклад в распознавание, сильнее всего, тишина (паузы), интенсивность звука, гласные и резкие начала звуков. Отдельный эксперимент показал контринтуитивный эффект: если в испытания со списками случайных слов (без связного смысла) подставить записи МЭГ, снятые во время связной, осмысленной речи, точность распознавания растёт. Это говорит о том, что мозговая активность без нарративной структуры несёт меньше информации, пригодной для восстановления, чем активность во время связной речи. Наконец, целевые эмбеддинги wav2vec 2.0 можно сжать примерно до двенадцати обучаемых признаковых измерений без потери точности, а вот сильное сжатие по времени, наоборот, заметно снижает качество.

Ключевые факты

  • Модель распознаёт короткие отрезки услышанной речи по МЭГ, заменив плоское пространственное внимание на сферические гармоники, заданные на 3D-геометрии шлема, и сократив число индивидуальных веток представления с 270 до 25
  • На бенчмарке MEG-MASC точность top-1 среди 1005 кандидатов составила 39,75 ± 0,34% (усреднение по шести обученным решениям) при примерно в 20 раз меньшем числе параметров декодера, чем у прежней архитектуры
  • Веса модели сопоставляются с источниками в мозге и указывают на зоны, согласующиеся с сетью восприятия речи; ветви левого полушария несут более высокочастотные ритмические компоненты, чем правого
  • Метод парной окклюзии показал, что из 19 проверенных свойств звука 15 влияют на распознавание, сильнее всего, тишина, интенсивность звука, гласные и резкие начала звуков
  • Целевые эмбеддинги wav2vec 2.0 можно сжать до примерно двенадцати признаковых измерений без потери точности; активность мозга во время связной речи несёт больше информации, чем при случайных списках слов

Почему это важно

Прежние нейросети для распознавания речи по МЭГ работали как чёрный ящик: они неплохо угадывали, что слышал человек, но их внутренние веса не соответствовали никаким измеримым величинам мозга, и было непонятно, что именно модель использует для решения задачи. Эта работа одновременно делает декодер компактнее, примерно в 20 раз меньше параметров, и превращает его в инструмент, чьи веса и решения можно связать с конкретными зонами мозга и конкретными свойствами звука.

Кому это важно

Прежде всего исследователям в области когнитивной нейронауки и декодирования речи по неинвазивным сигналам мозга, а также разработчикам интерфейсов мозг-компьютер, которые ищут способы восстанавливать речь у людей, лишённых возможности говорить. Полезна работа и тем, кто занимается интерпретируемостью моделей глубокого обучения, здесь показан конкретный набор приёмов, которые превращают точную, но непрозрачную сеть в модель с интерпретируемыми весами.

Как это применить

Ключевые архитектурные решения переносимы на похожие задачи: замена пространственного внимания по плоской раскладке датчиков на сферические гармоники, заданные на реальной 3D-геометрии сенсоров; резкое сокращение числа индивидуальных для испытуемого веток представления с добавлением временного фильтра под каждую; более мелкий декодер; удаление артефактов от движений глаз и сердечной активности перед обучением. Для проверки того, что реально движет решением модели, использован метод парной окклюзии прямо на записях МЭГ, этот же приём применим к другим декодерам сигналов мозга.

Можно ли доверять

Источник, препринт с полным текстом аннотации, результаты получены на публичном стандартном бенчмарке MEG-MASC и усреднены по шести обученным решениям, что указывает на попытку авторов проверить устойчивость результата, а не полагаться на единичный запуск. При этом сама аннотация не называет ни авторов, ни организации, ни место публикации работы, эти сведения не приведены в тексте источника, и в пересказе они не указываются.

Риски и подводные камни

В тексте источника не названа архитектура, относительно которой посчитано «примерно в 20 раз меньше параметров», поэтому масштаб выигрыша сложно оценить в абсолютных цифрах. Нет сравнения точности ни с результатами человека-слушателя, ни с другими опубликованными методами декодирования речи по МЭГ. Не раскрыто, что именно представляют собой «шесть обученных решений», разных испытуемых, случайные инициализации или разбиения данных. Наконец, находки об источниках в мозге и значимых свойствах звука получены внутри конкретной архитектуры и конкретного метода окклюзии, это не прямое доказательство того, как работает восприятие речи в мозге вообще.