Artificial Analysis обновила Intelligence Index до v4.2: Claude Fable 5.1 обошла GPT-6 Astra

4 сентября 2026 года компания Artificial Analysis выпустила версию 4.2 своего Intelligence Index, рейтинга больших языковых моделей. Это промежуточное обновление перед полноценным релизом v5: команда решила не ждать, а быстро отреагировать на то, что за последние недели на рынке появилось сразу несколько передовых моделей, хотя обычно Index намеренно не меняют вокруг крупных релизов, чтобы сохранить его стабильность. С момента выпуска Index v4 в январе прошло 8 месяцев.
В v4.2 добавили два новых теста. Первый, AA-Briefcase, собственная разработка Artificial Analysis с закрытым (held-out) набором задач: модели выполняют многонедельные проекты «офисной» агентной работы, каждый с множеством связанных подзадач и тысячами исходных файлов, а оценка идёт по рубрикам и попарному сравнению ответов сразу по трём критериям, успешность выполнения задачи, качество анализа и качество подачи результата. Второй, GDP.pdf, тест от Surge AI на чтение и синтез длинных документов: 100 PDF-файлов из десяти предметных областей общим объёмом 4592 страницы (текст, таблицы, графики, сноски, оговорки-исключения), а ответы проверяют по 1275 составленным экспертами атомарным критериям, итоговый показатель All-pass Rate засчитывает задачу только если выполнены все критерии сразу. Из индекса убрали GPQA Diamond, тест на научное рассуждение, как «насыщенный», то есть переставший различать модели.
Отдельное изменение, доля закрытых (held-out) тестовых наборов в общем весе индекса выросла до 40%, вдвое больше, чем в версии 4.1. В число закрытых наборов входят AA-Briefcase, AA-Omniscience и решения для CritPt; по заявлению Artificial Analysis, это снижает возможность лабораторий подгонять модели под конкретные бенчмарки, и в версии 5 эта доля будет расти дальше. Обновили и саму инфраструктуру оценки: в тест AA-LCR (версия 1.1) добавили системный промпт для проверяющей модели и исправили ошибки в эталонных ответах; для GDPval-AA v2 и AA-Briefcase улучшили выборку и заново откалибровали шкалу рейтинга Эло, чтобы она меньше «гуляла» при добавлении новых моделей; для SciCode доработали песочницу проверки кода так, чтобы медленный, но корректный код не засчитывался как провал.
По итоговому рейтингу Intelligence Index лидирует Claude Fable 5.1 от Anthropic, за ней следует GPT-6 Astra от OpenAI, которая прибавила 4 пункта индекса по сравнению с предыдущей моделью OpenAI, GPT-5.6 Sol. Третье место у Meta, далее идут SpaceXAI, Moonshot/Kimi, Z.AI и Google. На границе эффективности «цена за задачу» (Cost per Task Pareto frontier) удерживаются модели четырёх лабораторий, Anthropic, OpenAI, Meta и Z.AI. По экономности в токенах среди моделей, близких к границе интеллекта, лидирует GPT-6 Astra, она расходует меньше токенов почти всех конкурентов; на разных концах этой кривой находятся Claude Fable 5.1, Grok 4.5 и Gemini 3.5 Flash-Lite (сравнение не включает модели с индексом ниже 25).
В тесте AA-Briefcase на агентную офисную работу лидируют Claude Fable 5.1 и Opus 5 от Anthropic, за ними, GPT-6 Astra и Muse Spark 1.3 от Meta; при этом GPT-6 Astra обошла предыдущую модель OpenAI, GPT-5.6 Sol, примерно на 85 очков рейтинга Эло. А вот в тесте на чтение документов GDP.pdf лидирует уже OpenAI: GPT-6 Astra показала 33,2% по метрике All-pass Rate, GPT-5.6 Sol, 28,2%, а Claude Fable 5.1, 26,2%.
Ключевые факты
- 4 сентября 2026 года Artificial Analysis выпустила Intelligence Index v4.2, промежуточное обновление рейтинга моделей перед версией v5; с выхода v4 в январе прошло 8 месяцев
- Добавлены два новых теста: AA-Briefcase (многонедельные агентные офисные задачи с закрытым набором) и GDP.pdf от Surge AI (синтез данных из 100 PDF, 4592 страниц, проверка по 1275 критериям); убран насыщенный GPQA Diamond
- Доля закрытых (held-out) тестов в весе индекса выросла до 40%, вдвое больше, чем в v4.1, чтобы лабораториям было сложнее подгонять модели под бенчмарки
- В общем Intelligence Index лидирует Claude Fable 5.1 (Anthropic), далее GPT-6 Astra (OpenAI, +4 пункта к GPT-5.6 Sol), затем Meta, SpaceXAI, Moonshot/Kimi, Z.AI и Google
- В AA-Briefcase впереди Claude Fable 5.1 и Opus 5, затем GPT-6 Astra (+~85 очков Эло к GPT-5.6 Sol) и Muse Spark 1.3; в GDP.pdf, напротив, лидирует GPT-6 Astra (33,2%) перед GPT-5.6 Sol (28,2%) и Claude Fable 5.1 (26,2%)
Почему это важно
Intelligence Index, один из наиболее цитируемых независимых рейтингов больших языковых моделей, и его методология напрямую влияет на то, какие модели индустрия считает «передовыми». Обновление v4.2 отвечает на главную проблему таких рейтингов, подгонку моделей лабораториями под конкретные тесты: доля закрытых тестовых наборов в весе индекса выросла до 40% (вдвое больше, чем в v4.1), а насыщенный и переставший различать модели GPQA Diamond убран из подсчёта. Одновременно добавлены тесты, ближе к реальным задачам, многонедельная агентная офисная работа (AA-Briefcase) и синтез фактов из тысяч страниц PDF-документов (GDP.pdf).
Кому это важно
Разработчикам и компаниям, выбирающим модель для продакшн-задач: рейтинг напрямую сравнивает лабораторий не только по общему индексу, но и по границе «цена за задачу» и по расходу токенов. Самим лабораториям, Anthropic, OpenAI, Meta, Z.AI, Google, Moonshot/Kimi и SpaceXAI, чьи модели фигурируют в новом рейтинге и на новых, более сложных тестах. Тем, кто интересуется агентными сценариями использования ИИ (AA-Briefcase) и работой с длинными документами (GDP.pdf), здесь результаты лабораторий расходятся с общим рейтингом.
Как это применить
При выборе модели для агентных задач, требующих выполнения многошаговых проектов с большим числом файлов, стоит смотреть отдельно на результаты AA-Briefcase, где лидируют Claude Fable 5.1 и Opus 5, а не только на общий Intelligence Index. Для задач синтеза информации из больших объёмов документов ориентир, GDP.pdf, где, наоборот, впереди GPT-6 Astra. Если важна экономичность по токенам при сохранении близкого к максимальному качества, GPT-6 Astra расходует меньше токенов, чем почти все конкуренты около границы интеллекта.
Можно ли доверять
Artificial Analysis, известный независимый поставщик бенчмарков ИИ-моделей, публикующий методологию и changelog каждого обновления индекса, включая точные размеры тестов (100 PDF, 4592 страницы, 1275 критериев для GDP.pdf) и изменения инфраструктуры оценки. При этом рост доли закрытых тестовых наборов до 40% означает, что часть данных, по которым считается индекс, недоступна для независимой проверки третьими сторонами, читателю остаётся полагаться на добросовестность методологии самой Artificial Analysis.
Риски и подводные камни
Переанкеровка шкалы рейтинга Эло для GDPval-AA v2 и AA-Briefcase и исправление ответов в AA-LCR v1.1 означают, что сравнивать абсолютные цифры между версиями индекса напрямую становится сложнее, они пересчитаны заново. Рост доли закрытых тестов снижает прозрачность и воспроизводимость результатов для сторонних наблюдателей, хотя и уменьшает риск подгонки моделей под конкретные публичные задачи. В источнике не указано, сколько именно составляла доля закрытых тестов в версии 4.1 (известно только, что 40%, это вдвое больше), и не назван год выхода Index v4, только месяц (январь) и что с тех пор прошло 8 месяцев.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.