ARC-AGI обновили до версии 3: бенчмарк для ИИ-агентов в интерактивных средах

ARC-AGI, таблица лидеров проекта ARC Prize, отслеживающая прогресс ИИ в сторону общего интеллекта. Первые версии, ARC-AGI-1 и ARC-AGI-2, измеряли «пассивный флюидный интеллект», способность решать новые абстрактные головоломки без обучения на похожих примерах. Версия ARC-AGI-3 меняет саму постановку задачи: теперь ИИ-агенты должны адаптироваться на лету к новым интерактивным средам, а не просто выдавать один правильный ответ на статичную задачу.

Основной график таблицы лидеров, диаграмма рассеяния «стоимость решения задачи против точности»: авторы подчёркивают, что настоящий интеллект, это не только решённые задачи, но и решение их эффективно, с минимумом ресурсов. Системы разбиты на три категории. «Рассуждающие системы» показаны соединёнными точками, одна и та же модель на разных уровнях «размышления» (reasoning); линия тренда обычно выходит на асимптоту: чем больше времени модель думает, тем меньше дополнительный прирост точности. «Базовые LLM», это одношаговый вывод без расширенного рассуждения (пример из текста, GPT-4.5 и Claude 3.7), они показывают «сырую» производительность моделей без надстроек. «Kaggle-системы», решения с конкурса ARC Prize, работающие в жёстких рамках: бюджет $50 вычислений на 120 оценочных задач; это специально оптимизированные под ARC Prize эффективные методы.

В таблицу попадают только системы, полный прогон которых стоит меньше $10 000; если модель не смогла выдать ответы на все задачи, недостающие автоматически засчитываются как неверные. Часть результатов помечена как «preview», неофициальные оценки на основе неполного тестирования. Отдельно указаны два предварительных допущения: оценка ARC-AGI-2 для одной из моделей основана на частичном тестировании и ценах o1-pro, а оценка стоимости для другой модели, на предварительных ценах Gemini 3 Pro, модель предполагается перепроверить после официального релиза.

Ключевые факты

  • ARC-AGI прошёл путь от версий 1 и 2 (пассивный флюидный интеллект, статичные головоломки) к версии 3, где ИИ-агенты должны адаптироваться на лету к новым интерактивным средам
  • Главный график таблицы лидеров, соотношение стоимости решения задачи и точности: эффективность важна не меньше самого результата
  • Три категории решений: рассуждающие модели с трендовыми линиями по уровням reasoning, базовые LLM без расширенного рассуждения (в примере, GPT-4.5, Claude 3.7) и Kaggle-решения с бюджетом $50 на 120 задач
  • В зачёт идут только системы дешевле $10 000 за полный прогон; недоделанные ответы автоматически считаются ошибкой
  • Часть результатов помечена «preview» как неофициальные и неполные; отдельные оценки, предварительные (например, по ценам ещё не вышедшей Gemini 3 Pro)

Почему это важно

ARC-AGI считается одним из немногих бенчмарков ИИ, устойчивых к заучиванию: задачи новые и требуют абстрактного рассуждения, а не запоминания похожих примеров из обучающих данных. Переход к версии 3 меняет саму суть измерения, вместо одноразового ответа на статичную головоломку бенчмарк теперь проверяет, способен ли ИИ-агент адаптироваться на лету в незнакомой интерактивной среде. Это ближе к тому, как агенты будут работать в реальных задачах, а не просто отвечать на фиксированный вопрос.

Кому это важно

Исследователям и разработчикам, которые сравнивают модели и агентные системы не только по точности, но и по эффективности, сколько стоит решение одной задачи. Участникам конкурса ARC Prize, чьи Kaggle-решения соревнуются в отдельной весовой категории с жёстким бюджетом. Всем, кто следит за прогрессом в сторону общего ИИ и ищет ориентир, менее подверженный переобучению на тестовых наборах, чем стандартные бенчмарки.

Как это применить

Таблица лидеров открыта на arcprize.org/leaderboard и построена вокруг диаграммы «стоимость задачи, точность». Системы можно смотреть по трём категориям: рассуждающие модели с трендовыми линиями по уровням reasoning, базовые LLM без расширенного рассуждения и экономичные Kaggle-решения с фиксированным бюджетом $50 на 120 задач. Это позволяет выбирать не просто модель с максимальным процентом решённых задач, а ту, что даёт лучший баланс точности и цены за задачу.

Можно ли доверять

Данные публикует сам проект ARC Prize, это официальная, регулярно обновляемая таблица лидеров, а не сторонний пересказ. При этом часть результатов помечена как «preview», неофициальные оценки на основе неполного тестирования, а часть оценок стоимости прямо названа предварительной: например, стоимость для одной модели указана по ценам ещё не выпущенной Gemini 3 Pro и подлежит перепроверке после релиза.

Риски и подводные камни

Недоделанные прогоны (когда модель не успела выдать ответы на все задачи) автоматически засчитываются как неверные, это может занижать результат моделей, которым просто не хватило бюджета или времени, а не тех, что хуже рассуждают. В сравнение по цене попадают только системы дешевле $10 000 за полный прогон, самые дорогие эксперименты остаются за кадром таблицы. Предварительные оценки по ещё не вышедшим моделям могут измениться после официального релиза и пересчёта цен.

«Истинный интеллект, это не только решение задач, но и решение их эффективно, с минимальными ресурсами.»

— ARC Prize, описание таблицы лидеров ARC-AGI