Учёные Института Вейцмана создали ИИ, который по снимку мозга восстанавливает увиденную картинку

Мишаль Ирани и её коллеги из Института Вейцмана (Реховот, Израиль) разработали ИИ-инструмент, который по снимку мозга определяет, на что смотрит человек, и воссоздаёт это изображение. Работает и в обратную сторону: по картинке инструмент предсказывает активность мозга. Работа была представлена на конференции Cognitive Computational Neuroscience в Нью-Йорке в прошлом месяце (относительно даты публикации материала MIT Technology Review). Упоминаний публикации в рецензируемом журнале в материале нет.
Нейробиологи годами пытались использовать функциональную магнитно-резонансную томографию (фМРТ), чтобы восстанавливать увиденное и происходящее в сознании; первые результаты были размытыми и малопонятными. фМРТ с помощью мощного магнита отслеживает поток насыщенной кислородом крови; области, которые «загораются» на снимках, считаются особенно активными. Разрешение невелико: в типичных сканерах подсвеченный воксель охватывает около трёх кубических миллиметров, а в каждом кубическом миллиметре около 16 000 нейронов. Команда Ирани использовала общедоступные данные, собранные другими исследователями на более новых сканерах с более высоким разрешением: по словам Ирани, воксель там охватывает около одного кубического миллиметра.
По словам Ирани, прежние инструменты не дотягивают: если человек видел банан, модель нарисует банан, но с другой структурой и в другом положении. Её «декодер мозга» обучали на данных восьми человек, каждому из которых показали около 9 000 изображений в фМРТ-сканере с высоким разрешением. У декодера две ветви: одна предсказывает структуру изображения (например, где какие цвета), другая, его содержание (например, связку бананов на тарелке). Эти предсказания передаются диффузионной модели, которая и строит итоговую картинку.
Данных нужно было гораздо больше, чем имелось, поэтому команда обучила ещё и энкодер, предсказывающий активность мозга по изображению, и стала использовать энкодер и декодер вместе, улучшая оба. Схема такая: берут новое изображение (скажем, леопарда), энкодер предсказывает, как выглядел бы фМРТ-снимок человека, видящего его, а декодер по этому снимку восстанавливает картинку. Сначала результат мало похож на леопарда, но многократное обучение даёт заметное улучшение. Так модели можно учить на любом количестве картинок, в том числе тех, что никогда не показывали человеку в сканере: по словам Ирани, около 70% обучающих данных, изображения, изначально не связанные с фМРТ-снимками.
Сопоставив данные нескольких исследований, команда также выявила области мозга, функции которых, судя по всему, общие у всех людей: одна реагирует на изображения еды, другая, на спорт. Получившийся «универсальный энкодер мозга» работает со снимком нового человека при минимальной калибровке. По словам Ирани, другим инструментам обычно требуется около 40 часов фМРТ-данных на нового человека, а её декодеру, один час. Нейробиолог Томми Спрэг отмечает, что это ценно для науки: по его словам, час фМРТ стоит что-то около 600, 1 000 долларов.
Идеальным инструмент не назван: Ирани показала по Zoom, что торт он восстановил как стопку из трёх сэндвичей, а собаку в ванне, как похожего по цвету козла в ванне. Тем не менее, по словам автора материала, это передовой уровень: в сравнительном тесте инструмент оказался заметно лучше ранее описанных. «В целом мы действительно опередили остальных с большим отрывом», говорит Ирани. «Чтение мыслей» она называет «милым, броским названием» того, что они делают. В материале не приведено числовых метрик качества.
Дальше Ирани планирует перейти от изображений к видео и аудио. Она хочет научиться восстанавливать то, о чём люди думают или что представляют, и содержание снов, но признаёт: «Этого у нас пока нет». Такой инструмент, по её словам, мог бы позволить полностью парализованным людям общаться только с помощью мозговой активности и помочь прояснить, например, как выглядят флешбэки при ПТСР.
Джуди Иллс, нейроэтик и профессор неврологии Университета Британской Колумбии, не участвовавшая в исследовании, называет работу «великолепной», а идею терапевтического применения для людей с неврологическими состояниями, «невероятно волнующей». Но Спрэг предупреждает: если появится способ скрытно извлекать информацию о том, о чём вы думаете, то «150 лет научной фантастики могут стать реальностью в любой момент, и это во многом тревожно». Заставить человека без согласия лежать неподвижно в сканере трудно, но, как говорится в материале, Ирани и другие учёные работают над похожими подходами для расшифровки активности мозга по ЭЭГ (шапочка с электродами или даже наушники). Марчелло Иенка, нейробиолог и философ из Технического университета Мюнхена, называет переход к ЭЭГ «переломным моментом»: после калибровки устройства под мозг пользователя компаниям может быть относительно просто извлекать дополнительную информацию, потенциально без согласия; он также допускает, что некоторые суды могли бы принимать реконструкции мысленных образов как доказательства. Ирани признаёт риск злоупотреблений при использовании ЭЭГ, но пока не обеспокоена: «Я стараюсь думать только о хорошем».
Ключевые факты
- Мишаль Ирани и коллеги из Института Вейцмана создали ИИ, который по фМРТ-снимку восстанавливает изображение, которое видит человек, и может предсказывать активность мозга по картинке.
- Декодер с двумя ветвями (структура и содержание изображения) передаёт предсказания диффузионной модели; обучали его на данных восьми человек, каждому показали около 9 000 изображений.
- По словам Ирани, около 70% обучающих данных, картинки без парных фМРТ-снимков, а новому человеку нужен один час данных вместо обычных около 40 часов у других инструментов.
- В сравнительном тесте инструмент оказался заметно лучше прежних, но делает ошибки: торт превратился в три сэндвича, собака в ванне, в козла; числовых метрик в материале нет.
- Исследователи видят пользу для неврологии, но Спрэг и Иенка предупреждают о рисках для приватности, особенно при переходе к ЭЭГ.
Почему это важно
Реконструкция увиденного по активности мозга, давняя задача нейронауки, и первые попытки давали размытые, малопонятные картинки. Команда Ирани, по её словам и по результатам сравнительного теста, заметно превзошла предыдущие инструменты, а главное, резко сократила объём данных, нужных для нового человека: час вместо около 40 часов. Заодно метод помог выявить области мозга с общими для всех людей функциями, например реагирующие на еду и на спорт.
Кому это важно
Нейробиологам: фМРТ стоит около 600, 1 000 долларов в час (по словам Спрэга), и экономия времени сканирования может ускорить исследования. Неврологам и людям с неврологическими состояниями: Иллс называет терапевтическое применение «невероятно волнующим», а Ирани допускает, что метод поможет полностью парализованным общаться. Также материал будет интересен специалистам по этике ИИ и регуляторам, поскольку речь о приватности мыслей.
Как это применить
Готового продукта в материале нет: это исследовательская разработка, представленная на конференции. Ирани сейчас работает с нейробиологами, чтобы использовать инструменты для новых открытий о мозге, и планирует перейти к видео и аудио. Сроков для ЭЭГ, видео, аудио или клинического применения в материале не названо.
Можно ли доверять
Источник, материал MIT Technology Review, имя автора в тексте не указано. Результаты изложены со слов Ирани и представлены на конференции; в материале не упомянуты публикация в рецензируемом журнале и числовые метрики точности, сравнение с другими инструментами описано только качественно. Комментарии Иллс, Спрэга и Иенки, независимые от разработчиков оценки: Иллс прямо названа не участвовавшей в исследовании.
Риски и подводные камни
Инструмент ошибается: торт стал стопкой сэндвичей, а собака, козлом. Он пока работает с тем, что человек видит; реконструкция мыслей, воображаемого и снов, по словам Ирани, пока невозможна. Главный риск, приватность: Спрэг предупреждает о скрытом извлечении мыслей, а Иенка, о том, что при переходе к ЭЭГ компаниям может быть относительно просто извлекать данные потенциально без согласия, а суды могли бы принимать реконструкции как доказательства. Ирани риск признаёт, но пока не обеспокоена.
«Никто из нас не может позволить себе 40 часов томографии для нового испытуемого.»
— Томми Спрэг, нейробиолог Калифорнийского университета в Санта-Барбаре