Microsoft Research: бенчмарки ИИ довольно просты для реальной работы, считает Невилл

Выпуск Microsoft Research Podcast: прикладной учёный Microsoft Research Чад Аталла беседует с Дженнифер Невилл, партнёром-руководителем исследовательской группы (partner research manager) в Microsoft Research и профессором кафедры имени Сэмюэла Д. Конте по информатике и статистике в Purdue. По словам ведущего, она опубликовала более 130 работ с более чем 10 000 цитирований, получила премию NSF CAREER, попала в список IEEE «10 to Watch» в области ИИ и получила награды за лучшие статьи на конференциях по интеллектуальному анализу данных (International Conference on Data Mining) и по обучению представлений (International Conference on Learning Representations). Её исследования посвящены машинному обучению и ИИ для интерактивных областей и структурированных данных: как данные, на которых обучают системы, влияют на их поведение и насколько оно совпадает с желаниями пользователей.
Первая часть разговора посвящена карьере. Невилл рассказывает, что в юности хотела заниматься чем угодно, кроме информатики, потому что в ней работал её отец. Она училась на математике, затем на физике, но эти специальности ей не подошли; на какое-то время бросила колледж, вернулась на когнитивную науку, но там, по её словам, не хватало математики. Потом она поработала и вернулась учиться информатике, потому что хотела работать с данными, и так случайно «нашла ИИ». В исследования попала через обязательный проект на программе honors: решила изучать анализ интернет-данных со связями между объектами, попала к преподавателю, который только начинал работать в области статистического реляционного обучения, опубликовала статью на воркшопе, и «зацепилась». Главным крючком называет эмоциональный азарт: понять то, чего ещё никто не понимает, на самом краю знаний.
В Microsoft Невилл пришла в 2021 году из академии и до сих пор остаётся профессором, преподаёт и руководит студентами 20 лет. Первый творческий отпуск (sabbatical) после получения постоянной позиции она провела в Институте Саймонса в Беркли, на теоретической стороне; второй, в Microsoft Research, где увидела, как алгоритмы ведут себя в реальных системах, с реальными пользователями и данными: «от этого трудно вернуться». Разницу между академией и индустрией она видит в цели: в академии вопросы чаще абстрактные и охватывают много областей сразу (так получают финансирование, например от DARPA и NSF), а в индустрии проще работать в реальных системах и ориентироваться на продукты и интересы компании. По её мнению, сейчас тем, кто занимается ИИ-системами, лучше всего быть в индустрии.
Главная содержательная часть видимого фрагмента, миссия её команды, которая называется AI Interaction and Learning. Она старается расширить границы поведения ИИ-систем в реалистичных рабочих условиях: выяснить, где проходит граница возможностей нынешних систем, как пользователи переживают это на реальных рабочих процессах и как улучшить модели для сложных задач. Оценкой команда занимается потому, что, по словам Невилл, стандартные бенчмарки, которыми пользуются специалисты по ML и ИИ, довольно просты по сравнению с тем, как люди применяют системы на практике. Поэтому сначала нужно спросить, чего мы хотим от этих систем, и разработать практические оценки: многоходовое поведение, совместные среды, долгие (long-horizon) задачи пользователей. Найденные провалы и пробелы показывают, где систему нужно улучшать теоретически или алгоритмически. Итоговая цель команды, разработка лучших алгоритмов, моделей и методов оценки, чтобы поднять качество моделей.
Согласно описанию выпуска, дальше в разговоре речь идёт о «неожиданных сбоях» (surprising failures), которые проявляются при проверке моделей за пределами традиционных бенчмарков, о практических советах по работе с современными ИИ-системами, о важности внимательно смотреть на данные, когда результаты расходятся с ожиданиями, и о том, чему десятилетия развития ИИ научили Невилл в вопросе предсказания будущего. Эта часть разговора в доступном тексте не раскрыта: самих примеров сбоев в видимой части нет.
Ключевые факты
- Дженнифер Невилл руководит командой AI Interaction and Learning в Microsoft Research и остаётся профессором Purdue; в Microsoft пришла в 2021 году из академии.
- По её словам, стандартные бенчмарки, которыми оценивают ИИ, довольно просты по сравнению с реальным использованием.
- Команда проектирует практические оценки: многоходовое поведение, совместные среды, долгие задачи пользователей.
- Оценка нужна как отправная точка: выявленные пробелы показывают, какие алгоритмы и модели нужно улучшать.
- Невилл считает, что тем, кто сейчас работает над ИИ-системами, лучше всего быть в индустрии; по описанию выпуска, в разговоре также обсуждаются «неожиданные сбои» моделей.
Почему это важно
Невилл формулирует знакомую проблему оценки ИИ: привычные бенчмарки довольно просты по сравнению с тем, как люди реально используют системы. Её команда предлагает оценивать модели там, где живут настоящие рабочие процессы: в многоходовых диалогах, совместных средах и долгих задачах. Из таких оценок, по её словам, следует понимание, где именно нужно улучшать алгоритмы и модели.
Кому это важно
Тем, кто занимается оценкой и разработкой ИИ-систем и хочет понять, чем проверка в реалистичных условиях отличается от стандартных тестов. Также интересно тем, кто выбирает между академической и индустриальной карьерой в ИИ: Невилл прямо говорит, что сейчас для работы над ИИ-системами индустрия, по её мнению, лучшее место, хотя и признаёт пользу обеих сред.
Как это применить
Прямых инструкций в видимой части нет, но подход описан ясно: сначала спросить, чего вы хотите от системы, затем построить практические проверки в похожих на реальные условиях (многоходовое поведение, совместная работа, долгие задачи), а по найденным пробелам решать, что улучшать. Практические советы по работе с современными ИИ-системами, обещанные в описании выпуска, в доступном тексте не приведены.
Можно ли доверять
Это интервью в подкасте Microsoft Research: собеседницу представляет коллега из Microsoft Research, рассказ о работе команды идёт со слов самой Невилл. Регалии (более 130 работ, свыше 10 000 цитирований) названы ведущим. Количественных результатов оценок, названий бенчмарков и моделей в доступной части нет, так что это рассказ о подходе, а не доказательство его эффективности. Нужно учесть и то, что текст доступен не полностью: часть про «неожиданные сбои» известна только по описанию выпуска.
Риски и подводные камни
Выводы здесь, мнение исследовательницы о собственном направлении, без данных в видимой части. Заявление «индустрия сейчас лучшее место для работы над ИИ-системами», её личная оценка, а не установленный факт. Не стоит домысливать содержание «неожиданных сбоев»: конкретные примеры в доступном тексте не приводятся.
«Мы сосредоточились на оценке потому, что, как мы видим, стандартный способ оценки у специалистов по ML и ИИ, это бенчмарки, которые довольно просты по сравнению с тем, как люди будут использовать эти системы на практике.»
— Дженнифер Невилл, Microsoft Research Podcast