Brood War Bench: Codex Astra обходит Grok и Claude Fable в StarCraft, но играют как новички

Brood War Bench: Codex Astra обходит Grok и Claude Fable в StarCraft, но играют как новички

Разработчик под ником «benswerd» на Hacker News построил Brood War Bench, бенчмарк, в котором ИИ-агенты играют друг против друга в StarCraft: Brood War через самостоятельно написанную обвязку, позволяющую управлять игрой только через агентов. Идея выросла из личного эксперимента: автор играл в такую версию игры с друзьями, и оказалось, что даже люди, почти не знакомые со StarCraft, неплохо справлялись, просто попросив своего агента «атаковать», а тот сам строил армию и проводил атаку. Это натолкнуло автора на вопрос, далеко ли агенты способны зайти самостоятельно, без человека за спиной.

Для ответа собрали турнир по круговой системе: каждая связка «модель + уровень усилий (effort)» сыграла с каждой другой, матчи шли параллельно на виртуальных машинах платформы Freestyle, а движок игры и логи обеих сторон сохранялись для каждого матча.

Главный вывод: ни один агент не сыграл выше уровня новичка. По формулировке автора, обычный новичок, устроивший раннюю агрессию (в жаргоне RTS такую тактику называют «чиз», от английского cheese), выиграл бы у любой из этих ИИ-против-ИИ партий.

Среди участников самым сильным и стабильным оказался Codex Astra: он последовательно обыгрывал остальные модели. Его ключевой приём, не наращивание экономики, а ранняя диверсия: пробник (рабочий юнит протоссов) отправлялся через карту тревожить рабочих или здания соперника, и это срабатывало на удивление хорошо, противники подолгу «размышляли», что делать с одним пробником, вместо того чтобы действовать. При этом в устойчивом производстве Codex Astra был заметно слабее: он затягивал с технологиями, подсылал защитникам по одному-два базовых юнита и бросал рабочих в последний бой. Автор также заметил, что Codex создавал отдельных подагентов для экономики, производства армии и управления боем, но те слабо координировались друг с другом, из-за этого подагент армии часто отправлял в атаку каждый новый юнит поодиночке, не дожидаясь, пока накопится критическая масса, что автор называет типичной ошибкой новичка. В матчах, где автор сам направлял Codex, координация подагентов заметно улучшалась. Показательный эпизод устойчивости, игра G009: после потери армии и главной базы конфигурация Codex 5.6 Terra/medium подняла в воздух свой последний командный центр и перевела его в противоположный угол карты, продержавшись после этого ещё шесть минут.

Grok, напротив, проводил игру в основном «в размышлениях». В игре G043 конфигурация Grok 4.6 на настройке усилий xhigh за 43 минуты сгенерировала 11 138 токенов рассуждений, но отдала лишь шесть пакетов команд и ни разу не вывела на поле боевой юнит. В игре G003 Grok на xhigh построил всего три морпеха и так и не дошёл до базы противника; в игре G002 Grok на средней настройке усилий построил двух зилотов и тоже не пересёк карту. По наблюдению автора, это было похоже не столько на плохую стратегию, сколько на неспособность агента непрерывно наблюдать за игрой и действовать.

Claude Fable выделялся среди участников тем, что по-настоящему пытался играть в игру: строил экономику и продвигался по дереву технологий, а не останавливался на первом доступном юните. В игре G007 Fable дошёл до Логова, Шпиля и муталисков и победил; в игре G027 построил Роботный завод, Цитадель Адуна, Обсерваторию и Архивы тамплиеров и тоже выиграл. Но амбиции не гарантировали результата: в игре G036 Fable успел построить Фабрику и Академию, однако его база была разгромлена моделью Opus 5.

Общий паттерн, отмеченный автором: старые модели склонны играть RTS как пошаговую игру и погибают, пока «думают»; новые модели иногда попадают в ту же ловушку, этим отчасти можно объяснить, почему настройки с меньшими усилиями иногда показывали результат лучше, но в целом новые модели заметно лучше учитывают цену раздумий. Автор также отмечает, что оценки стоимости матчей для Codex и Sonnet в бенчмарке, это оценки по числу токенов, а не точные денежные суммы.

Несмотря на слабый общий уровень игры, автор бенчмарка настроен оптимистично: проект далёк от исчерпания, наблюдение за играми агентов увлекло его, и он ожидает, что моделям и самому бенчмарку ещё есть куда расти.

Ключевые факты

  • Бенчмарк Brood War Bench устраивает турнир ИИ-агентов друг против друга в StarCraft: Brood War по круговой системе, с параллельными матчами на VM платформы Freestyle.
  • Ни одна модель не сыграла выше уровня новичка; по оценке автора, новичок с ранней агрессией («чиз») выиграл бы у любой из партий агентов.
  • Codex Astra стабильно побеждает соперников за счёт ранней диверсии пробником, но слаб в устойчивом производстве войск; его подагенты экономики, производства и боя координируются плохо.
  • Grok тратит игру на рассуждения вместо действий: в одном матче Grok 4.6 (xhigh) за 43 минуты выдал 11 138 токенов рассуждений, но лишь шесть пакетов команд и не вывел ни одного боевого юнита.
  • Claude Fable честно пытался строить экономику и проходить по дереву технологий и дважды побеждал, но проиграл модели Opus 5 в игре, где не успел довести развитие до конца.

Почему это важно

Большинство бенчмарков ИИ-агентов проверяют статичные задачи, код, диалог, поиск информации, где у модели есть время подумать. Brood War Bench ставит агентов в реальную стратегическую игру с непрерывным течением времени, где промедление буквально стоит жизни юнитам. Это обнажает проблему, незаметную в чат-бенчмарках: агент может рассуждать долго и качественно, но если рассуждение не превращается вовремя в действие, оно бесполезно. Ровно это и произошло с Grok, сотни строк размышлений при почти полном бездействии.

Кому это важно

Разработчикам агентных систем и мультиагентных архитектур, где несколько подагентов (экономика, производство, боевое управление, как у Codex Astra в этом бенчмарке) должны координироваться в реальном времени. Полезно и тем, кто проектирует оценки для автономных агентов: бенчмарк показывает, что старые метрики «может ли модель решить задачу» не ловят провалы в темпе и координации, которые вылезают только в динамической среде.

Как это применить

Из наблюдений бенчмарка следует конкретный урок проектирования агентов: подагентам, отвечающим за разные функции (экономику, производство, бой), нужен канал синхронизации перед тем, как каждый начнёт действовать самостоятельно, иначе получается ситуация Codex Astra, где боевой подагент отправляет юниты в атаку по одному, не дождавшись критической массы от остальных. Второй урок, явно ограничивать бюджет «размышлений» перед действием: провал Grok, это не нехватка интеллекта, а отсутствие дисциплины наблюдай-действуй в реальном времени.

Можно ли доверять

Это самостоятельный отчёт создателя бенчмарка на его собственном сайте, а не независимое исследование или публикация с рецензированием. В тексте не указаны ни имя и должность автора, ни организация за проектом, ни дата проведения тестов, известен только ник на Hacker News. Числовые примеры (токены, длительность, количество юнитов) взяты из конкретных, названных по номеру игр (G043, G003, G002, G009) и звучат как прямые данные с прогонов, а не оценки на глаз, что повышает доверие к деталям, но общие выводы о моделях сделаны автором бенчмарка и независимой проверки не проходили.

Риски и подводные камни

Один RTS-бенчмарк, узкая полоса способностей: успех через раннюю диверсию пробником (то, что хорошо получалось у Codex Astra), это тактическая находка для конкретной игры, а не показатель общего стратегического мышления модели. Разные модели тестировались на разных настройках усилий (effort), и часть примеров относится к отдельным матчам, а не к усреднённой статистике по всем играм, переносить единичный эпизод (например, одну неудачную игру Grok) на весь модельный класс не стоит. Оценки стоимости матчей для Codex и Sonnet в бенчмарке, это оценки по числу токенов, а не подтверждённые денежные суммы.

«Новичок, устроивший фотон-раш, выиграл бы у любой из этих партий.»

— автор Brood War Bench, из отчёта о результатах бенчмарка