Учёные: почти половина ИИ-бенчмарков перестала отличать модели
Препринт «When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation» вводит формальное определение «насыщения» бенчмарка, состояния, когда модели перестают заметно различаться по результату теста, и его ценность как измерительного инструмента падает. Авторы проанализировали 60 бенчмарков для языковых моделей по 14 связанным с насыщением параметрам. Итог: почти половина изученных бенчмарков уже насыщена, и чем старше бенчмарк, тем выше вероятность насыщения. Отдельный вывод касается причины: устойчивость бенчмарка к насыщению определяется тем, насколько тщательно эксперты отбирали задания, а не тем, закрыты ли тестовые данные от публичного доступа, то есть засекречивание тестовой выборки само по себе не спасает бенчмарк от старения. Из этого авторы делают практический вывод: осознанные решения при проектировании бенчмарка способны продлить срок его полезной жизни и подсказать более устойчивые подходы к оценке моделей. Текущая, третья версия препринта датирована 29 июня 2026 года; впервые работа была выложена на arXiv 18 февраля 2026-го. В качестве контактного лица в истории публикации на arXiv указана Мубашара Ахтар, полный список авторов и их принадлежность к организациям на доступной странице не приведены.
Ключевые факты
- Работа впервые даёт формальное определение «насыщения» бенчмарка и проверяет его на выборке из 60 бенчмарков для языковых моделей по 14 связанным параметрам
- Почти половина изученных бенчмарков уже насыщена, модели перестают заметно различаться по результату
- Вероятность насыщения растёт с возрастом бенчмарка
- Устойчивость к насыщению связана с экспертным отбором заданий, а не с тем, закрыты ли тестовые данные от публики
- Актуальная третья версия препринта опубликована 29 июня 2026 года, первая версия появилась 18 февраля 2026-го
Почему это важно
Бенчмарки, это основной инструмент, по которому индустрия судит о прогрессе моделей и принимает решения о том, какую модель разворачивать в продукте. Если бенчмарк насыщен, разные модели показывают на нём почти одинаковый результат, и сравнение теряет смысл, решения начинают опираться на метрику, которая уже ничего не измеряет. Работа показывает, что это не единичный случай, а системная тенденция: почти половина из 60 проверенных бенчмарков уже в таком состоянии, и с возрастом бенчмарка ситуация только ухудшается.
Кому это важно
В первую очередь, тем, кто создаёт и поддерживает бенчмарки для языковых моделей, а также исследовательским командам и лабораториям, которые выбирают между моделями, опираясь на публичные рейтинги и лидерборды. Косвенно это касается и всех, кто читает новости вида «модель X обошла модель Y на бенчмарке Z»: чем старше упомянутый тест, тем выше шанс, что он уже не различает модели содержательно.
Как это применить
Главный практический вывод исследования, держать тестовую выборку в секрете не является надёжной защитой от насыщения бенчмарка; решает экспертный, тщательный отбор заданий на этапе проектирования. Командам, которые создают или обновляют бенчмарки, стоит инвестировать именно в качество и разнообразие задач, а не полагаться на закрытость данных. Тем, кто использует существующие бенчмарки для сравнения моделей, стоит с осторожностью относиться к старым и широко используемым тестам и проверять, не сблизились ли на них результаты разных моделей до неразличимости.
Можно ли доверять
Источник, препринт на arXiv, третья версия которого вышла 29 июня 2026 года; доступная страница не сообщает статус рецензирования и не называет площадку публикации. На странице виден только текст аннотации: не перечислены ни конкретные 60 бенчмарков, ни все 14 использованных параметров, ни детали методологии измерения насыщения и экспертного отбора, это ограничивает возможность независимо оценить строгость выводов по одному лишь абстракту. Обсуждение на Hacker News набрало 87 очков и 90 комментариев, что говорит об интересе к теме, но не заменяет рецензирование.
Риски и подводные камни
Доступный текст, это только аннотация статьи, а не полная работа: точная доля насыщенных бенчмарков не названа (сказано лишь «почти половина»), сами бенчмарки и параметры не перечислены поимённо, методология не раскрыта. Это значит, что проверить корректность классификации «насыщен / не насыщен» для конкретных тестов по имеющемуся тексту невозможно, а выводы о причинно-следственной связи между экспертным отбором и устойчивостью бенчмарка стоит воспринимать как предварительные до знакомства с полным текстом статьи.