Hugging Face провела ИИ-аудит статей ICML 2026: почти у четверти работ нашли проблемы с выводами

ICML 2026 получила рекордные 23 918 заявок и приняла 6 352 статьи, примерно вдвое больше, чем годом раньше, и это продолжение экспоненциального роста, который, по мнению авторов поста, отчасти вызван тем, что ИИ-агенты ускоряют проведение экспериментов и написание текста. Число рецензентов при этом не растёт: это волонтёры, которым часто не хватает времени и экспертизы проверить статью целиком. Пост цитирует рецензента одной из spotlight-статей: «Моя низкая оценка уверенности, потому что я не проверил все доказательства внимательно», и обещает вернуться к этой самой статье позже.
Проверить, что реально стоит за потоком публикаций, взялись Hugging Face и alphaXiv: с 15 июля по 2 августа 2026 года они провели открытый челлендж «ICML 2026 Open Reproductions». В нём поучаствовал 1 221 человек, они пользовались разными ИИ-агентами для кода (в посте прямо названы Claude Code, Codex, Cursor и Pi), которые сами читали статью, писали код, запускали эксперименты и отчитывались о результатах. Организаторы дали участникам единый интерфейс: одной командой агент мог получить текст статьи, извлечённые из неё утверждения и инструкции к челленджу. Каждый участник получил $20 облачных кредитов Hugging Face на сервисе HF Jobs; всего было запущено 2 962 облачных задания. Там, где полное воспроизведение было невозможно, например, из-за закрытых данных или неопубликованных чекпоинтов, участники запускали упрощённые («игрушечные») версии эксперимента на синтетических данных, имитирующих свойства оригинала.
Если считать по статьям, агрегируя вердикты по отдельным утверждениям: у 51% проверенных статей (1 103) хотя бы одно утверждение подтвердилось независимой проверкой, 266 из них воспроизвели полностью (подтвердились все извлечённые утверждения), ещё 632, частично, без единого опровержения; всего в рамках челленджа экспериментально подтвердили 3 978 отдельных утверждений. У 23% статей (496) хотя бы одно утверждение оказалось опровергнуто или спорно: в 49 статьях опровергли вообще все утверждения, а в 242, независимые команды, проверявшие одни и те же утверждения, пришли к противоположным выводам (сами авторы формулируют это так: «воспроизводимость не бинарна, она состязательна»). Ещё 502 статьи получили только «игрушечные» подтверждения, а по 280 не удалось установить ничего определённого, чаще всего из-за отсутствующих артефактов (кода, данных, чекпоинтов).
35 участников формально заявили, что нашли опровержение; команда Hugging Face перепроверила каждое из них состязательно, перечитывала статью и публичный логбук (дневник эксперимента) заявителя и заново выводила математику или повторяла эксперимент по тексту самой статьи. Среди подтверждённых находок: у spotlight-статьи «Towards Optimal Robustness in Learning-Augmented Paging» (той самой, из отзыва в начале поста; дальше, paging-статья) доказательство устойчивости алгоритма ломается при росте параметра, участник нашёл точный шаг, где оно рвётся, а сама команда Hugging Face самостоятельно повторила эксперимент, продлив проверку до k = 1024, и подтвердила рост ошибки с точностью около девяти сигм. У статьи «Attention's forward pass and Frank-Wolfe» три независимые команды нашли контрпримеры к теореме о том, что токены-«частицы» стягиваются к началу координат, если оно находится внутри их выпуклой оболочки: нарушения проявились на шагах t = 224, ~3 800 и 6 416, то есть более ранние проверки с ограниченным горизонтом останавливались слишком рано, чтобы их заметить. Самый чистый из контрпримеров построен в точной рациональной арифметике, что исключает любые сомнения из-за погрешностей вычислений с плавающей точкой; авторы подтвердили ошибку в тот же день и работают над исправлением. В «Self-Distillation Enables Continual Learning» теория статьи описывает «обратную» KL-дивергенцию, а код по умолчанию (который, по словам авторов, и дал все результаты статьи) считает «прямую», и тот же логбук не смог воспроизвести заявленный итоговый результат «+4 п.п.» даже на авторских коде и данных; авторы уже выложили на arXiv уточнённую версию. В «Do Transformers Need Three Projections?» участник обнаружил, что около 66% позиций, по которым считалась метрика, оказались служебными токенами-заполнителями EOS, обучающимися почти до нулевой ошибки, из-за чего измеренная перплексия занижалась примерно втрое: заявленная в аннотации «стоимость качества» в 3,1% при сокращении кэша на 50% на деле оказалась около 9,4%. А в одном случае подтвердилось не опровержение, а ошибка самого участника: логбук утверждал, что метод статьи «в 2 раза медленнее» базового варианта, но это оказалась арифметическая ошибка воспроизведения (время на одну траекторию сравнили со временем на пакет из 50); после исправления собственные данные участника подтвердили заявленное в статье ускорение в 8 раз.
Hugging Face начала писать авторам каждой подтверждённой находки, спрашивая, согласны ли они с выводами, первые ответы в основном положительные: несколько авторов уже подтвердили находки, две правки на arXiv готовятся, а в одном случае автор ещё за месяц до челленджа тихо исправил ошибку в новой версии на arXiv, и это авторы поста называют независимым совпадением результатов. Отдельно они разбирают роль человека: чисто агентное исполнение упирается в реальные пределы, агенты застревали в локальных циклах, неверно считывали зависящее от масштаба поведение (часть «подтверждающих» вердиктов по paging-статье получилась именно потому, что проверка останавливалась раньше, чем становился заметен рост ошибки по логарифму k) и иногда строили целое опровержение на банальной ошибке в единицах измерения. Самые надёжные результаты получались там, где человек направлял агента, перенаправлял его, ставил под сомнение исходное предположение или решал, что предпосылка эксперимента неверна, ещё до того, как на него потратят неделю вычислений. В номинации «человек в контуре» победила статья про стабильную генерацию изображений при экстремальном квантовании: численные метрики говорили «коллапса нет», но вопрос, действительно ли изображения выглядят пригодными для использования, был вопросом восприятия, агент построил интерфейс для разметки, а человек лично оценил все 128 пар изображений, которые агент затем проверил на согласованность; участник прокомментировал: «Я просмотрел все пары и выложил csv-файл в репозиторий, проверьте, пожалуйста». Роль человека авторы формулируют как эффективное управление интеллектом: как профессор или научный руководитель создаёт для аспирантов условия для хорошей работы, вычисления, инструментарий, доступ к данным и обратную связь в нужный момент, так и участники, получившие от агентов больше всего, были теми, кто выстроил правильную среду и задавал правильные вопросы, а затем позволял агентам самим вести эксперименты.
Авторы поста называют челлендж, вероятно, крупнейшей попыткой воспроизвести результаты научной конференции и крупнейшим открытым, разобранным по конкретным утверждениям аудитом ML-конференции на сегодняшний день; в нём поучаствовал 1 221 человек. Все логбуки, вердикты, трейсы и артефакты выложены в открытом доступе, начиная со специальной страницы (Space) челленджа на Hugging Face, а сама Hugging Face обещает повторить подобные события в будущем.
Ключевые факты
- С 15 июля по 2 августа 2026 года 1 221 участник в рамках челленджа Hugging Face и alphaXiv «ICML 2026 Open Reproductions» пытался ИИ-агентами (Claude Code, Codex, Cursor, Pi) воспроизвести результаты статей ICML 2026: каждый получил $20 облачных кредитов Hugging Face, всего запустили 2 962 облачных задания.
- У 51% проверенных статей (1 103) подтвердилось хотя бы одно утверждение, 266 воспроизвели полностью, 632 частично; у 23% (496) хотя бы одно утверждение опровергли или оспорили (в 49 статьях, все утверждения, в 242, независимые команды разошлись во мнениях); ещё 502 статьи прошли только «игрушечную» проверку, по 280 не удалось установить ничего.
- У spotlight-статьи «Towards Optimal Robustness in Learning-Augmented Paging» доказательство устойчивости алгоритма ломается, сама Hugging Face повторила эксперимент и подтвердила рост ошибки с точностью около девяти сигм; у статьи «Attention's forward pass and Frank-Wolfe» теорему опровергли три независимые команды контрпримерами на шагах t = 224, ~3 800 и 6 416, и авторы признали ошибку в тот же день.
- В «Do Transformers Need Three Projections?» около 66% позиций, по которым считалась метрика, оказались служебными токенами-заполнителями EOS, из-за чего измеренная перплексия занижалась примерно втрое, а заявленная в аннотации «стоимость качества» в 3,1% при сокращении кэша на 50% на деле оказалась около 9,4%.
- Из 35 заявленных участниками опровержений Hugging Face нашла минимум одно ложное: «в 2 раза медленнее» оказалось арифметической ошибкой воспроизведения, а не проблемой статьи, реальное ускорение в 8 раз подтвердилось. Авторы считают, что часть оценок (например, качество изображений на глаз) остаётся человеческой, в кейсе с генерацией при экстремальном квантовании участник вручную сверил все 128 пар изображений.
Почему это важно
ICML 2026 получила рекордные 23 918 заявок и приняла 6 352 статьи, примерно вдвое больше, чем годом раньше, и авторы поста прямо связывают этот рост с тем, что ИИ-агенты ускоряют проведение экспериментов и написание текста. Число рецензентов при этом не выросло: это волонтёры, которым часто не хватает времени и экспертизы проверить статью целиком, один из них написал в отзыве на spotlight-статью: «Моя низкая оценка уверенности, потому что я не проверил все доказательства внимательно». Челлендж Hugging Face и alphaXiv показывает, что теми же ИИ-агентами, которые разгоняют поток публикаций, можно проверять его в обратную сторону: организаторы называют его, вероятно, крупнейшей попыткой воспроизвести результаты научной конференции и крупнейшим открытым аудитом ML-конференции, разобранным по конкретным утверждениям, и почти у четверти проверенных статей он нашёл опровергнутое или спорное утверждение.
Кому это важно
В первую очередь это важно исследователям, которые публикуются на топовых ML-конференциях: их заявления теперь можно массово и быстро перепроверять агентами, а не только точечно и постфактум. Также организаторам конференций и рецензентам, которые ищут способ угнаться за потоком заявок без пропорционального роста числа рецензентов-волонтёров. Отдельно это важно тем, кто разрабатывает или использует ИИ-агентов для кода, в посте прямо названы Claude Code, Codex, Cursor и Pi, потому что это редкий пример проверки таких агентов не на бенчмарке, а на практике, тысячами параллельных прогонов на реальных научных задачах. И всем, кого волнует кризис воспроизводимости в науке: здесь он впервые измерен на масштабе целой крупной конференции, а не отдельной статьи.
Как это применить
Все логбуки, вердикты, трейсы и артефакты челленджа выложены в открытом доступе, начиная со специальной страницы (Space) на Hugging Face, это готовый материал, чтобы увидеть, как агент находит расхождение между тем, что заявлено в статье, и тем, что делает код. Hugging Face обещает повторить подобные события в будущем, стоит следить за анонсами, если интересно поучаствовать самому. Практический вывод авторов для тех, кто сам использует агентов для похожих задач: больше всего от агента получили не те, кто пытался всё сделать за него, а те, кто выстроил вокруг него правильную среду, вычисления, доступ к данным, обратную связь в нужный момент, и задавал правильные вопросы, оставляя сам прогон агенту. Для авторов статей и рецензентов есть и более прямой урок: раз $20 облачных кредитов и один ИИ-агент оказалось достаточно, чтобы всерьёз проверить доказательство и код, есть смысл прогонять их через агента ещё до подачи или рецензирования, как уже сделали авторы «Attention's forward pass and Frank-Wolfe» и «Self-Distillation Enables Continual Learning», оперативно отреагировав на находки: первые в тот же день подтвердили ошибку и работают над исправлением, вторые уже выложили на arXiv уточнённую версию.
Можно ли доверять
Да, но с оговорками, которые пост честно обозначает сам. Проверка была намеренно состязательной: из 35 заявленных участниками опровержений Hugging Face перепроверила каждое заново, перечитывая статью, логбук и заново выводя математику или код, и нашла как минимум одно ложное опровержение (мнимое «в 2 раза медленнее» оказалось ошибкой самого воспроизведения). А 242 статьи, где независимые команды разошлись во мнениях по одним и тем же утверждениям, прямое напоминание авторов, что «воспроизводимость не бинарна, она состязательна»: даже у этого аудита не всегда есть единственно верный вердикт.
Риски и подводные камни
У чисто агентной проверки есть реальные пределы, которые прямо перечисляют сами авторы: агенты застревали в локальных циклах, неверно считывали поведение, заметное только на большом масштабе (часть «подтверждающих» вердиктов по paging-статье получилась именно потому, что проверка останавливалась раньше, чем становился виден рост ошибки по логарифму k), и иногда строили целое опровержение на банальной ошибке в единицах измерения. Цифра «у 23% статей, опровергнутое или спорное утверждение» не значит «23% статей неверны»: 242 из этих 496, случаи, где две независимые команды с агентами разошлись во мнениях, а не однозначно доказанная ошибка. И часть оценок принципиально не автоматизируется: понять, действительно ли изображение выглядит приемлемо на глаз, агент сам не может, в кейсе с генерацией при экстремальном квантовании человеку пришлось лично разметить все 128 пар изображений вручную.
«Моя низкая оценка уверенности, потому что я не проверил все доказательства внимательно.»
— рецензент spotlight-статьи ICML 2026 «Towards Optimal Robustness in Learning-Augmented Paging»