Закон Гудхарта настиг ИИ-бенчмарки: BIG-bench утёк в GPT-4, а Meta обыграла Chatbot Arena
BIG-bench, открытый бенчмарк, собранный усилиями сотен исследователей, с самого начала содержал защиту от нечестного использования: уникальную контрольную строку, «канарейку», спрятанную в данных, чтобы каждый мог проверить, не попал ли бенчмарк в обучающую выборку модели. Когда OpenAI готовила технический отчёт по GPT-4, собственная проверка компании на контаминацию (загрязнение обучающих данных тестовыми) показала: BIG-bench всё равно оказался в обучающих данных GPT-4, модель по запросу воспроизводила канарейку, и результаты по этому бенчмарку пришлось исключить из отчёта. Механизм, придуманный, чтобы ловить нечестность, не пережил столкновения с автоматическим сбором данных из интернета в промышленных масштабах. Закон, который это описывает, ещё в 1975 году сформулировал Чарльз Гудхарт, писавший о британской денежно-кредитной политике: как только показатель становится целью, он перестаёт быть хорошим показателем. Спустя полвека баллы ИИ-бенчмарков решают, какие компании привлекают инвестиции, какие модели покупают предприятия и о каких моделях пишут пресс-релизы, а стимул выбить нужную цифру как никогда силён.
Это не уникальная для искусственного интеллекта проблема, а паттерн, который вычислительная техника открывает заново раз за разом. Закон Кэмпбелла предсказал, а американская реформа школьного образования No Child Left Behind подтвердила: как только стандартизированные тесты стали целью, учителя начали натаскивать учеников на сам тест, баллы выросли, а знания нет. У машинного перевода была похожая история: годами системы оптимизировали под метрику BLEU и в итоге хорошо считали баллы, но плохо переводили, потому что BLEU вознаграждает совпадение по n-граммам (последовательностям слов), а не по смыслу. В 2018 году Manheim и Garrabrant формализовали четыре варианта действия закона Гудхарта; в нынешней ситуации с ИИ-бенчмарками доминируют два, регрессионный, когда тест незаметно становится частью обучающих данных, и состязательный, когда манипулируют самим процессом оценки. У каждого из них теперь есть количественные подтверждения, и именно это отличает нынешний момент от эпохи BLEU: дальше уже не единичные случаи.
Самая наглядная демонстрация контаминации, GSM1k, работа Zhang и соавторов из Scale AI (2024 год). Исследователи заказали у людей-разметчиков 1205 новых школьных математических задач, по сложности подогнанных под GSM8K, стандартный бенчмарк для проверки арифметических рассуждений, а затем прогнали через них ведущие модели, которые именно эти вопросы точно никогда не видели. Точность упала: на величину до 13 процентных пунктов у худших моделей в первой версии оценки и до 8 процентных пунктов в финальной версии, прогнанной на полном опубликованном наборе задач. Семейства моделей Phi и Mistral показали, по формулировке авторов GSM1k, систематическое переобучение почти на всех размерах модели. Ключевая улика, в корреляционном анализе: чем выше вероятность, что модель дословно воспроизведёт задачу из GSM8K, тем больше разрыв между её результатами на GSM8K и на GSM1k (коэффициент корреляции Спирмена r² = 0,36). Это заучивание, а не математика: результат по публичному бенчмарку говорит о модели примерно то же, что результат экзамена, об ученике, у которого заранее были ответы.
Дальше выяснилось, что сами вопросы местами сломаны. Gema и соавторы вручную перепроверили 5700 вопросов MMLU (стандартного бенчмарка на знания) по всем 57 темам и оценили, что ошибки, неверный ключ ответа, двусмысленная формулировка, вопросы без однозначного ответа, содержат 6,49% вопросов бенчмарка; в разделе про вирусологию доля дефектных вопросов среди проверенных доходила до 57%. После исправления ошибок рейтинг моделей изменился. Это не особенность одного MMLU: аудит «Fantastic Bugs» (Truong и соавторы) применил статистику теории измерений сразу к девяти широко используемым бенчмаркам, и экспертная проверка подтвердила изъяны в доле до 84% вопросов из числа тех, что аудит пометил как наиболее подозрительные, не всех вопросов бенчмарков, а именно помеченных. У самого GSM8K, по данным материала, базовый уровень ошибок, около 5%. Получается, что системы стоимостью в миллиарды долларов ранжируют с точностью до десятых долей балла по ответам, которые никто толком не вычитывал.
Ответом сообщества на контаминацию статических тестов стала Chatbot Arena, живой лидерборд, где анонимные модели сравнивают между собой реальные пользователи, голоса стекаются в рейтинговую модель Брэдли, Терри, а фиксированного набора вопросов, который можно слить в интернет, там просто нет. Arena стала главным публичным ориентиром, и её тоже обыграли, только другим способом. Работа «The Leaderboard Illusion» (Singh и соавторы, 2025 год; исследователи из Cohere Labs, Стэнфорда, Принстона, MIT, Ai2 и других организаций) проанализировала около двух миллионов сравнений на Arena между 243 моделями от 42 разработчиков. Центральный вывод касается закрытого тестирования: перед запуском Meta прогнала через Arena 27 непубличных вариантов Llama 4 и опубликовала только тот результат, который выбрала сама. Авторы показывают: если выбирать лучший балл из N попыток, это ломает статистические предпосылки, на которых держится рейтинг, система исходит из того, что у каждой модели одна честная попытка, а не лучшая из 27. Чтобы измерить, сколько шума это создаёт, исследователи отправили на Arena два идентичных чекпоинта одной и той же модели под разными именами, их баллы разошлись на 17 пунктов. Добавляется и перекос в данных: каждый из двух крупнейших закрытых провайдеров получил, по оценке авторов, от 19% до 20% всех сравнений на Arena, тогда как 83 модели с открытыми весами суммарно получили меньше 30%. В контролируемых экспериментах дообучение на данных из распределения Arena дало относительный прирост результата до 112% на тесте ArenaHard (построенном на том же распределении данных), тогда как результат на MMLU при этом немного снизился. Отдельно Meta уличили в том, что она отправляла на Arena вариант Llama 4, оптимизированный под «разговорность» и обошедший в рейтинге ту версию модели, которую компания в итоге выпустила.
У этой истории есть и другая сторона. LMArena, сервис, который держит Chatbot Arena, оспорила такую трактовку, и в её ответе есть содержательные аргументы: баллы идентичных чекпоинтов попадают в перекрывающиеся доверительные интервалы; политика закрытого тестирования была публично объявлена ещё в марте 2024 года и открыта для любого провайдера с достаточными ресурсами; а цифра в 112% относится к тесту ArenaHard, а не к самой живой Arena. Часть этих возражений справедлива. Но ни одно из них не опровергает главного: горстка хорошо обеспеченных ресурсами лабораторий систематически пользовалась стратегией «лучший из N попыток», пока более мелкие лаборатории отправляли на оценку каждую модель по одному разу, а рейтинговая модель исходит из того, что так никто не делает. Ни один злодей тут ничего не подтасовывал специально, стимулы исподволь исказили результат в целом добросовестного академического проекта, ровно как и предсказывает закон Гудхарта.
Причина, по которой это повторяется: место в лидерборде привлекает прессу, публикации попадают в презентации для инвесторов, презентации влияют на решения о закупке ИИ-систем, и ни одно звено этой цепочки не заинтересовано разбираться, что цифра значит на самом деле. У явления даже появилось название, «бенчмаркетинг». Жульничать напрямую не обязательно: разработчики просто подбирают температуру генерации, стратегию формулировки запроса и число заранее заданных примеров в запросе (в англоязычной терминологии, few-shot), которые дают максимальный итоговый балл, и эти настройки редко совпадают с тем, что используется в реальной эксплуатации. Каждое решение по отдельности выглядит оправданным, а в сумме получается балл, описывающий модель, которую в таком виде никто и никогда не запустит. Довершает картину насыщение: MMLU из по-настоящему сложного теста превратился в бенчмарк, который топовые модели проходят примерно на 90%, а HumanEval и HellaSwag фактически упёрлись в потолок. Когда все модели одинаково хорошо сдают один и тот же экзамен, индустрия переходит на новый бенчмарк, он становится целью, его тоже загрязняют и насыщают, и каждый следующий цикл короче предыдущего. Цена этого ложится на покупателей: команды, которые строят собственные оценки на реальных юридических, медицинских или финансовых задачах, регулярно получают точность заметно ниже той, что обещал ближайший публичный бенчмарк.
Что реально помогает, без иллюзии волшебной таблетки. Приватные, регулярно обновляемые тестовые наборы бьют прямо по механизму нечестности и, по мнению автора материала, остаются единственным средством, которое действительно работает: если вопросы никогда не попадали в открытый интернет, их не может быть в обучающих данных, а при регулярном обновлении набора заучивание прошлогодних вопросов не помогает в следующем году. GSM1k, как раз такой образец; похожим путём десятилетие назад прошли исследователи компьютерного зрения с наборами ImageNetV2 и CIFAR-10.1, на которых и выяснилось, что классификаторы переобучились под исходные датасеты. Цена реальна: вопросы, написанные и проверенные экспертами-людьми, стоят дорого, а защита временна, приватные наборы тоже устаревают, просто медленнее; на сколько именно медленнее, материал не уточняет. Проверку на контаминацию стоит вести как рутинную гигиену, сверку совпадающих n-грамм с обучающими корпусами, замеры перплексии, которые выдают подозрительно гладкое воспроизведение текста бенчмарка, но не как решение проблемы: Sun и соавторы проверили 20 предложенных способов защиты от контаминации на 10 моделях и пяти бенчмарках и не нашли ни одного, который значимо повышал бы устойчивость к контаминации по сравнению с простым бездействием. Для тех, кто просто выбирает модель для внедрения, самый полезный, хоть и самый скучный совет, оценивать модель на собственных данных: мини-бенчмарк из 20, 50 вопросов, собранный из реальных обращений в поддержку, договоров или запросов конкретной компании, предскажет качество работы модели на её задачах лучше любого публичного лидерборда, просто потому, что на этой конкретной нагрузке модель ещё никто не обучал. Если для масштабирования оценки подключается ИИ-модель в роли судьи, нужно контролировать её известные перекосы, в сторону определённой позиции ответа, многословия и собственных же формулировок, иначе есть риск незаметно применить закон Гудхарта уже к собственной приватной оценке. Для общих публичных лидербордов структурные меры уже сформулированы авторами «The Leaderboard Illusion»: запретить отзыв уже опубликованных баллов, обязать раскрывать все протестированные варианты модели, ограничить объём закрытого тестирования, уравнять выборку данных между провайдерами. Удержит ли хоть один лидерборд такую дисциплину, пока его крупнейшие участники, они же крупнейшие имена в индустрии, материал называет открытым вопросом.
Возвращаясь к канарейке: индустрия построила ловушку для нечестности, модели её «съели», а баллы по бенчмарку продолжили цитировать как ни в чём не бывало. Именно эта последовательность событий, а не какой-то один загрязнённый бенчмарк, и есть главный вывод материала. Закон Гудхарта, не баг, который можно однажды исправить: любое число, которое решает вопрос финансирования, рейтинга или закупки, будет оптимизировано, градиентным спуском или отделом маркетинга, а чаще и тем, и другим сразу. Вопрос никогда не был в том, как построить бенчмарк, который невозможно обыграть: полвека данных, от денежно-кредитной политики до стандартизированных школьных тестов, говорят, что такого не существует. Вопрос в том, как принимать решения, зная, что каждый бенчмарк, которому вы доверяете, уже отчасти фикция.
Ключевые факты
- BIG-bench, открытый бенчмарк с защитной «канарейкой» в данных, всё равно попал в обучающую выборку GPT-4: собственная проверка OpenAI на контаминацию это подтвердила, и результаты пришлось исключить из технического отчёта.
- GSM1k (Zhang и соавторы, Scale AI, 2024): 1205 новых школьных математических задач того же уровня сложности, что GSM8K. На них точность ведущих моделей упала на величину до 13 процентных пунктов в первой версии оценки и до 8 процентных пунктов в финальной; семейства Phi и Mistral показали систематическое переобучение почти на всех размерах.
- Gema и соавторы вручную перепроверили 5700 вопросов MMLU по всем 57 темам: ошибки нашлись в 6,49% вопросов бенчмарка (в разделе про вирусологию, в 57% проверенных), и после исправлений рейтинг моделей изменился.
- «The Leaderboard Illusion» (Singh и соавторы, 2025): анализ около двух миллионов сравнений на Chatbot Arena показал, что перед запуском Llama 4 Meta тайно прогнала через лидерборд 27 вариантов модели и опубликовала лучший результат; два идентичных чекпоинта под разными именами разошлись в рейтинге на 17 пунктов.
- Sun и соавторы проверили 20 предложенных способов защиты от контаминации на 10 моделях и пяти бенчмарках, ни один не дал значимого преимущества перед простым бездействием.
Почему это важно
Баллы по ИИ-бенчмаркам решают, какие компании привлекают инвестиции, какие модели покупают предприятия и о каких моделях выходят восторженные пресс-релизы, то есть измерение давно стало целью, а закон Гудхарта (сформулирован ещё в 1975 году применительно к денежно-кредитной политике) гласит: как только показатель становится целью, он перестаёт быть надёжным показателем. Материал впервые сводит это наблюдение не к отдельным анекдотам, а к количественным данным сразу по нескольким направлениям: BIG-bench утёк в обучающие данные GPT-4 несмотря на встроенную защиту; свежий набор GSM1k показал падение точности ведущих моделей на школьных задачах на новых вопросах, на величину до 13 процентных пунктов в первой версии оценки и до 8 процентных пунктов в финальной; ручная перепроверка MMLU нашла ошибки примерно в 6,49% вопросов; а анализ Chatbot Arena показал, что перед запуском Llama 4 Meta тайно прогнала через лидерборд 27 вариантов модели. Иначе говоря, показатели, на основе которых принимаются решения на миллиарды долларов, систематически завышены, и не по вине одной компании или одного бенчмарка, а из-за структуры самих стимулов.
Кому это важно
В первую очередь, тем, кто использует бенчмарки как основание для решений: инвесторам и советам директоров, которые оценивают ИИ-компании по строчке в лидерборде; корпоративным закупщикам, которые выбирают модель для внедрения по публичному рейтингу; журналистам и авторам пресс-релизов, пересказывающим эти баллы как факт. Важно это и самим ИИ-лабораториям, чья репутация опирается на бенчмарки, оказавшиеся менее надёжными, чем считалось, и исследователям, которые проектируют следующее поколение оценочных наборов и рискуют повторить те же ошибки. Наконец, это касается любого читателя, который встречал фразы вроде «модель показала 90% на MMLU» и воспринимал их как окончательный аргумент.
Как это применить
Материал предлагает конкретную иерархию мер, ни одна из которых не панацея. Тем, кто может себе это позволить, стоит строить приватные, регулярно обновляемые тестовые наборы по образцу GSM1k: вопросы, которые никогда не попадали в открытый интернет, физически не могут просочиться в обучающие данные, а ротация не даёт заучить прошлогодний набор. Проверки на контаминацию, совпадение n-грамм с обучающими корпусами, замеры перплексии на предмет подозрительно гладкого воспроизведения текста бенчмарка, стоит запускать как рутинную гигиену, но не как решение: по данным Sun и соавторов, ни один из 20 протестированных способов защиты не дал значимого преимущества перед бездействием. Самый практичный совет для тех, кто просто выбирает модель, оценивать её на собственных данных: мини-бенчмарк из 20, 50 вопросов на основе реальных обращений, договоров или запросов конкретной компании предсказывает рабочее качество модели лучше любого публичного рейтинга. Если для масштабирования такой оценки используется ИИ-модель в роли судьи, нужно отдельно контролировать её собственные перекосы, в сторону определённой позиции ответа, многословия и текстов, похожих на её же собственные, иначе есть риск применить закон Гудхарта уже к своей приватной оценке. Для публичных лидербордов авторы «The Leaderboard Illusion» предлагают структурные меры: запретить отзыв уже опубликованных баллов, обязать раскрывать все протестированные варианты модели, ограничить закрытое тестирование и уравнять выборку данных между провайдерами.
Можно ли доверять
Материал опубликован в блоге ACM (Association for Computing Machinery, профессиональной ассоциации специалистов по информатике) на сайте cacm.acm.org, в разделе blogCACM. Это не рецензируемое исследование, а авторская колонка-синтез: в конце текста указан автор, Alex Williams, представленный как разработчик-универсал (full-stack) и бывший владелец компании Hosting Data U.K., получивший степень магистра по ИТ в University of London и позже перешедший в независимое ИТ-консультирование и техническую копирайтинговую работу. То есть это не один из авторов цитируемых исследований, а технический обозреватель, сводящий воедино чужие работы. При этом ключевые утверждения материала опираются на конкретные проверяемые источники с цифрами и методологией, работы Zhang и соавторов (GSM1k, Scale AI, 2024), Gema и соавторов (перепроверка MMLU), Truong и соавторов («Fantastic Bugs»), Singh и соавторов («The Leaderboard Illusion», 2025), а не на общие рассуждения. В пользу добросовестности изложения говорит и то, что материал не ограничивается обвинениями, а прямо приводит контраргументы LMArena, сервиса, который держит Chatbot Arena, и признаёт часть их справедливой: идентичные чекпоинты действительно попали в перекрывающиеся доверительные интервалы, политика закрытого тестирования была объявлена заранее, а цифра в 112% относится именно к ArenaHard, а не к живой Arena.
Риски и подводные камни
Ни одно из предложенных решений не работает без оговорок. Приватные тестовые наборы дороги, вопросы должны писать и проверять эксперты-люди, а не просто взять готовый набор данных, и даже они не защищены навсегда, а лишь устаревают медленнее публичных; на сколько именно медленнее, материал не уточняет. Автоматическая проверка на контаминацию отстаёт от способов её обхода: по данным Sun и соавторов, ни один из 20 протестированных методов защиты не показал значимого преимущества перед простым отсутствием защиты, и это похоже на системное свойство, а не техническую недоработку, обнаружение нечестности идёт на шаг позади самой нечестности. Оценка модели на собственных данных тоже уязвима: если для масштабирования привлекается ИИ-модель в роли судьи, а её типичные перекосы, в сторону многословных ответов, определённой позиции варианта или текстов, похожих на её же собственные, не контролировать, можно незаметно применить закон Гудхарта уже к своей приватной системе оценки. Наконец, структурные реформы публичных лидербордов, запрет на отзыв баллов, обязательное раскрытие всех протестированных вариантов, ограничение закрытого тестирования, зависят от готовности крупнейших ИИ-лабораторий добровольно ограничить именно ту практику, которая сейчас даёт им преимущество в рейтингах; материал прямо называет это открытым вопросом, не обещая, что дисциплина удержится.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.