AISI и EvalEval сделали результаты ИИ-бенчмарков воспроизводимыми

AISI и EvalEval сделали результаты ИИ-бенчмарков воспроизводимыми

UK AI Security Institute (AISI) и коалиция EvalEval объявили о новом этапе сотрудничества, начавшегося на совместном воркшопе при NeurIPS 2025. AISI выкладывает публично отчитанные методы оценки, результаты, контекст и настройки конфигурации через платформу EvalEval Evaluation Cards, которая объединяет метаданные бенчмарков, данные прогонов и информацию о моделях в единую сопоставимую структуру. Публикация сопровождается статьёй AISI How Inference Compute Shapes Frontier LLM Evaluation («Как вычисления на этапе инференса влияют на оценку передовых языковых моделей»), которая изучает, как результаты бенчмарков зависят от объёма вычислений во время инференса и протокола оценки. Релиз включает верифицированные результаты, контекст и конфигурацию для пяти бенчмарков из главного эксперимента статьи: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0. Эти результаты охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Дополнительно опубликованы результаты двух связанных оценок по кибербезопасности, Cyber CTFs и The Last Ones, которые используют другой, частично пересекающийся набор моделей. По данным источника, результаты на Humanity's Last Exam меняются в зависимости от протокола оценки и объёма вычислений: когда модели получали от эксперта-оракула обратную связь о правильности ответа после каждой попытки, они продолжали решать дополнительные задачи по мере роста числа использованных токенов. Схема EvalEval Every Eval Ever (EEE) и платформа Evaluation Cards призваны решить проблему: результаты оценок публикуются в разных форматах и на разных площадках, часто без данных, достаточных для их воспроизведения, а повторный прогон бенчмарков сам по себе может быть непозволительно дорогим. Работа опирается и на другие инструменты AISI, OptStop (повышение эффективности оценки) и HiBayES (повышение статистической строгости), а также на стандартизацию анализа транскриптов и методов элиситации способностей моделей. Конкретных числовых результатов (баллов, процентов) по шести моделям на пяти бенчмарках в самом тексте не приводится, только доступ к данным через платформу.

Ключевые факты

  • AISI и EvalEval выложили через платформу Evaluation Cards верифицированные результаты, контекст и настройки для пяти бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0
  • Результаты охватывают шесть моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4
  • Дополнительно опубликованы данные двух оценок по кибербезопасности, Cyber CTFs и The Last Ones, на другом наборе моделей
  • Релиз сопровождает статью AISI How Inference Compute Shapes Frontier LLM Evaluation о влиянии объёма вычислений при инференсе и протокола оценки на результаты бенчмарков
  • Цель, использовать общую схему отчётности Every Eval Ever, чтобы результаты разных оценщиков было можно сравнивать и воспроизводить

Почему это важно

Результаты ИИ-бенчмарков сейчас публикуются в разных форматах и часто без деталей, нужных для их проверки или повторения, а перезапуск оценки может быть слишком дорогим. Совместный релиз AISI и EvalEval, попытка закрыть этот разрыв: выложить не только итоговые баллы, а полный контекст и конфигурацию оценки, чтобы результаты можно было воспроизвести и сравнить с другими отчётами.

Кому это важно

Разработчикам моделей, которые отчитываются о результатах оценок; создателям бенчмарков, использующим схему Every Eval Ever; исследователям в области оценки ИИ, управления и политики, которым нужны сопоставимые данные о том, как модели вроде Claude Opus 4.6 или GPT-5.4 ведут себя на разных протоколах тестирования.

Как это применить

Разработчики моделей могут публиковать верифицированные результаты оценок через платформу Evaluation Cards; разработчики бенчмарков, отчитываться по схеме Every Eval Ever; исследователи и специалисты по политике в сфере ИИ, изучать карточки оценок по бенчмарку или модели, чтобы понять, при каких настройках получен тот или иной результат.

Можно ли доверять

Материал, официальный совместный блог AISI (государственного института безопасности ИИ Великобритании) и коалиции EvalEval, описывающий их собственную инициативу; независимой сторонней оценки в тексте нет. Конкретных числовых результатов по моделям в самом посте не приводится, только описание того, что и как опубликовано.

Риски и подводные камни

Это инфраструктурная инициатива, а не прорыв в возможностях моделей: она облегчает сравнение оценок, но не решает проблему воспроизводимости сама по себе, эффект зависит от того, сколько разработчиков моделей и создателей бенчмарков реально начнут отчитываться по общей схеме. В тексте также не указаны даты публикации самого поста и статьи, что затрудняет проверку актуальности данных.

«Мы рады этому решению и с нетерпением ждём дальнейшей стандартизации и совместного использования оценок с AISI и другими организациями, занимающимися оценкой ИИ.»

— EvalEval Coalition