DeepMind и EVE Online: партнёрство ради игровых ИИ-агентов

DeepMind и EVE Online: партнёрство ради игровых ИИ-агентов

Google DeepMind опубликовала в своём блоге материал, посвящённый 15 годам исследований ИИ на играх, и сообщила о новом исследовательском партнёрстве с Fenris Creations, независимой студией, стоящей за вселенной EVE (EVE Online, EVE Vanguard, EVE Frontier).

Компания напомнила ключевые вехи этого пути. В 2015 году в Nature вышла статья о Deep Q-Network (DQN), нейросети, которая научилась играть в 49 разных игр для Atari 2600 напрямую по сырым пикселям, без какого-либо специфичного для конкретной игры инжиниринга. Дальше последовали AlphaGo, обыгравшая в 2016 году чемпиона мира по го Ли Седоля (в тексте DeepMind имя дано в написании "Lee Sae Dol"); AlphaGo Zero, обучившаяся полностью через игру с самой собой без данных от человека; AlphaZero, обобщившая тот же подход на шахматы, сёги и го; MuZero, научившаяся играть, даже не зная заранее правил игры; и AlphaStar, в 2019 году достигшая уровня гроссмейстера в StarCraft II. По словам DeepMind, тот же исследовательский задел позже помог AlphaFold решить 50-летнюю задачу предсказания структуры белков, за это в 2024 году была присуждена Нобелевская премия по химии.

От игр "на победу" DeepMind перешла к вопросу, может ли ИИ понимать и взаимодействовать с любым игровым миром так, как это делает человек. Отсюда, SIMA (Scalable Instructable Multiworld Agent), универсальный игровой агент: он воспринимает происходящее на экране так же, как игрок, понимает инструкции на естественном языке и управляет игрой обычной клавиатурой и мышью, без доступа к API или исходному коду игры. SIMA 2 работает на базе моделей Gemini и способна вести диалог и рассуждать в реальном времени; она демонстрирует человекоподобную игру в таких средах, как No Man's Sky, Valheim и Hydroneer.

Новое партнёрство с Fenris Creations DeepMind называет очередной главой этой истории. Fenris Creations больше двух десятилетий строит одну из самых необычных постоянных игровых вселенных: EVE Online, запущенная в 2003 году, это массовая многопользовательская космическая симуляция, где тысячи игроков делят один и тот же мир, непрерывно развивающийся уже более 20 лет, с игровой экономикой на реальном спросе и предложении и торговыми сетями на тысячи звёздных систем. Партнёрство охватывает всю расширяющуюся вселенную студии: помимо классической EVE Online, это EVE Vanguard, та же persistent-вселенная, но с видом от первого лица и тактическими боями на земле, и EVE Frontier, открытая среда с программируемыми "Smart Assemblies", где сами правила мира можно менять. По утверждению DeepMind, такие постоянные и открытые миры, хороший полигон именно для тех способностей, которые компания считает ключевыми для будущего ИИ: непрерывное обучение без забывания прежних навыков, память, удерживающая знания дольше контекстного окна современных моделей, планирование на недели, месяцы и годы вперёд, и работа со сложной многоагентной динамикой, кооперацией, конкуренцией, переговорами и экономикой.

Первый практический результат сотрудничества уже есть: система Aura Guidance на базе Gemini подсказывает новым игрокам EVE Online ответы, основанные на реальных вопросах и ответах из раздела помощи новичкам (Rookie Help). Дальнейшую программу исследований DeepMind описывает поэтапно: начать с офлайн-инстанса EVE Online, изолированной песочницы, отдельной от живых игроков; затем перейти к EVE Frontier, чтобы изучать совместное существование людей и агентов в постоянном и открытом мире; и только когда возможности агентов созреют, рассматривать их появление в живых EVE Online и EVE Vanguard, с целью обогатить, а не заменить игру людей.

В посте DeepMind также благодарит других студий-партнёров по играм для ИИ-исследований: Coffee Stain (Valheim, Satisfactory, Goat Simulator 3), Foulball Hangover (Hydroneer), Hello Games (No Man's Sky), Keen Software House (Space Engineers), RubberbandGames (Wobbly Life), Strange Loop Games (Eco), Thunderful Games (ASKA, The Gunk, Steamworld Build), Digixart (Road 96), а также Tuxedo Labs и Saber Interactive (Teardown).

Ключевые факты

  • DQN в 2015 году (статья в Nature) научился играть в 49 разных игр Atari 2600 напрямую по сырым пикселям, без специфичного для каждой игры инжиниринга
  • AlphaGo обыграла чемпиона мира по го в 2016 году, AlphaStar в 2019 году достигла уровня гроссмейстера в StarCraft II, а AlphaFold на тех же наработках решил 50-летнюю задачу предсказания структуры белков и получил Нобелевскую премию по химии в 2024 году
  • SIMA / SIMA 2 на базе моделей Gemini, универсальный игровой агент: воспринимает экран как игрок, понимает естественный язык и играет обычной клавиатурой и мышью без доступа к API или коду игры
  • DeepMind объявила исследовательское партнёрство с Fenris Creations, независимой студией вселенной EVE (EVE Online, с 2003 года, EVE Vanguard, EVE Frontier), ради изучения непрерывного обучения, памяти, долгосрочного планирования и многоагентной динамики
  • Система Aura Guidance на базе Gemini уже помогает новым игрокам EVE Online ответами из раздела Rookie Help; дальше DeepMind планирует начать с офлайн-песочницы EVE Online, перейти к EVE Frontier и лишь потом, при зрелости технологии, рассмотреть выход в живые EVE Online и EVE Vanguard

Почему это важно

Игры, исторический полигон для главных прорывов DeepMind: от DQN и AlphaGo до AlphaFold, получившего Нобелевскую премию. Партнёрство с Fenris Creations переводит этот путь на новый уровень, от игр с чёткими правилами и очками к постоянному, живому и открытому миру EVE Online, где нужно тестировать не узкое умение выигрывать, а непрерывное обучение, долгосрочную память, планирование на месяцы и годы и поведение среди тысяч других агентов и людей одновременно.

Кому это важно

Разработчикам игр, как потенциальный источник новых ИИ-агентов для NPC, тестирования и адаптивного геймплея. Исследователям ИИ, как площадка для изучения многоагентных систем и долгосрочного планирования в открытом мире. Игрокам EVE Online, как участникам вселенной, куда DeepMind рассчитывает в перспективе привести таких агентов.

Как это применить

Пока речь не о готовом продукте с ценой или лицензией, а об исследовательской программе. DeepMind описывает поэтапный план: сначала офлайн-инстанс EVE Online, изолированный от живых игроков; затем EVE Frontier как площадка для совместной работы людей и агентов; и только при зрелости возможностей, потенциальное появление агентов в живых EVE Online и EVE Vanguard, с целью обогатить игру людей, а не заменить их. Уже работающий пример прикладного результата, система Aura Guidance на Gemini, которая подсказывает новичкам EVE Online по вопросам из раздела Rookie Help.

Можно ли доверять

Источник, официальный блог Google DeepMind, то есть материал промо-характера от первого лица компании: конкретных дат объявления партнёрства, сумм вложений или сроков вывода агентов в живую игру в тексте нет, они не раскрыты в источнике. Технические вехи (DQN, AlphaGo, AlphaStar, AlphaFold, Нобелевская премия), исторические факты, ранее подтверждённые независимо; актуальность самого партнёрства и его деталей проверить можно только по дальнейшим публикациям DeepMind и Fenris Creations.

Риски и подводные камни

DeepMind прямо признаёт, что живая экономика и социальная динамика EVE Online держатся на реальном взаимодействии игроков, появление там развитых ИИ-агентов, даже вводимое поэтапно, потенциально способно повлиять на этот баланс, поэтому компания и планирует переход только после офлайн- и полуоткрытых этапов тестирования. В посте нет данных о том, как именно будет контролироваться безопасность агентов на живых серверах и какие метрики докажут их "зрелость" для перехода к следующему этапу.

«Мы стремимся к той же конечной цели, что и всегда: ИИ как катализатор, а не замена.»

— Google DeepMind, блог компании