Вышел ProgramBench Vetted, усиленный тест ИИ-агентов на реверс-инжиниринг кода из бинарника

Бенчмарк ProgramBench выпустила Meta в мае 2026 года. Идея проста: агенту дают скомпилированную программу, которую он может запускать, но не может прочитать, вместе с документацией по использованию, и просят написать новый код, воспроизводящий поведение оригинала. В исходной версии 200 задач, реальные проекты с открытым кодом уровня от мелких утилит до FFmpeg, SQLite и интерпретатора PHP. У агента есть доступ к консоли, нет интернета, лимит в тысячу шагов и шесть часов времени; итог проверяют поведенческие тесты, которые для каждой задачи заранее написал другой агент, изучивший оригинальный репозиторий и бинарник. Задача засчитывается решённой только при прохождении всех тестов.
Авторы новой версии (в тексте они не называют себя, кроме местоимения «мы») провели аудит исходного набора задач и нашли способы обмануть оценку без реальной реконструкции поведения программы: например, простое эхо документации закрывало 79,5% тестов задачи cmatrix, не реализуя её ключевую логику, а восьмистрочная обёртка вокруг уже установленного в тестовой среде исполняемого файла XZ приносила 77,3% активного вознаграждения за задачу XZ. Также обнаружились задачи вроде FFmpeg, которые зависели от отсутствующих в среде эталонных входных данных.
Чтобы закрыть эти дыры, для ProgramBench Vetted построили конвейер проверки и починки задач: агенты-«судьи» изучают рабочее пространство задачи, тестируют нужное поведение и выдают оценку с доказательствами; агенты-«врачи» на основе этих доказательств вносят точечные исправления, после чего задача проходит проверку заново. Параллельно работают детерминированные проверки конкретных измеримых свойств и отдельные агенты, которые намеренно пытаются взломать задачу или найти лазейку в системе вознаграждения. Каждую кандидатную задачу прогоняют через пять топовых моделей, которые совокупно выполняют до 15 попыток генерации тестов; повторяющиеся или поглощаемые другими проверки удаляются, а спорные случаи уходят на ручной разбор людям, которые принимают финальное решение и превращают повторяющиеся ошибки в новые правила проверки для будущих задач. В итоговый набор ProgramBench Vetted вошло 50 отобранных и провалидированных задач.
На новом лидерборде GPT 5.5 лидирует по среднему вознаграждению, 85,2%, но полностью (все тесты) решает лишь 2% задач. У Claude Opus 5 среднее вознаграждение чуть ниже, 81,9%, зато полностью решённых задач больше, 14%; по формулировке источника, Opus 5 также «лидирует почти на пороге 50%», что именно это означает, в тексте не поясняется. Хотя бы одну задачу до конца решили 6 из 17 протестированных моделей. Авторы отдельно подчёркивают, что кривые распределения частичных баллов между старым и новым бенчмарком нельзя трактовать как доказательство того, что один из них сложнее другого: наборы протестированных моделей в сравнении разные, а часть новых топовых моделей проверяли только на Vetted-версии. При этом задачи специально откалиброваны так, чтобы избегать крайностей: у 46 из 50 задач среднее вознаграждение по всей панели моделей лежит в диапазоне 20-80%, то есть большинство задач оставляет пространство и для частичного прогресса, и для дальнейшего роста результата.
Ключевые факты
- Вышел ProgramBench Vetted, переработанная 50-задачная версия бенчмарка ProgramBench, который Meta выпустила в мае 2026 года; он проверяет, может ли ИИ-агент воссоздать программу по её скомпилированному бинарнику и документации, без доступа к исходному коду
- Аудит исходных 200 задач вскрыл лазейки для обмана оценки: эхо документации закрывало 79,5% тестов задачи cmatrix без реальной реализации, а восьмистрочная обёртка вокруг уже установленного бинарника XZ приносила 77,3% вознаграждения за задачу XZ
- Для новой версии построили многоступенчатый конвейер проверки: агенты-«судьи» оценивают задачи и собирают доказательства, агенты-«врачи» точечно чинят найденные проблемы, отдельные агенты намеренно ищут лазейки, а спорные случаи разбирают люди
- На лидерборде ProgramBench Vetted GPT 5.5 лидирует по среднему вознаграждению (85,2%), но полностью решает лишь 2% задач; у Claude Opus 5 среднее вознаграждение ниже (81,9%), зато доля полностью решённых задач выше (14%); хотя бы одну задачу до конца решили 6 из 17 протестированных моделей
- Задачи откалиброваны против крайностей: у 46 из 50 задач среднее вознаграждение по всей панели моделей укладывается в диапазон 20-80%, оставляя пространство для частичного прогресса
Почему это важно
Бенчмарки на реконструкцию программы из бинарника, один из немногих форматов, где агенту нужно держать и уточнять модель поведения программы на протяжении очень длинной траектории действий (в оригинальном ProgramBench, до тысячи шагов и шести часов), а не решать задачу за несколько итераций. Это делает такие тесты полезными и для изучения координации моделей на длинном контексте, и для обучения с подкреплением по проверяемому вознаграждению (RLVR): детерминированные поведенческие проверки дают агенту плотный, привязанный к реальному поведению сигнал, который он должен встроить в единую, согласованную реализацию. Но если сам бенчмарк содержит лазейки, как показал аудит оригинального ProgramBench, где документация или обёртка вокруг готового бинарника приносили баллы без всякой реконструкции, то и оценка моделей, и сигнал для их обучения оказываются искажены. ProgramBench Vetted, попытка закрыть именно эти дыры системным аудитом и повторной валидацией, а не просто усложнить задачи.
Кому это важно
В первую очередь, командам, которые строят и оценивают ИИ-агентов для написания и понимания кода: именно на таком лидерборде уже сравниваются GPT 5.5 и Claude Opus 5. Также это важно исследователям, которые проектируют долгосрочные агентные бенчмарки и обучают модели через RLVR: показанные в тексте примеры обмана оценки (документация вместо реализации, обёртка вокруг готового бинарника), это конкретный чек-лист лазеек, которые стоит проверять в любом похожем тесте. Практический интерес есть и у специалистов по реверс-инжинирингу и безопасности бинарных программ, как у аудитории, для которой сама задача «восстановить код по исполняемому файлу» профессионально знакома.
Как это применить
В источнике нет ни цены, ни условий доступа, ни лицензии на использование ProgramBench Vetted, упоминать монетизацию или открытость датасета было бы домыслом. Практическая ценность материала для тех, кто оценивает или обучает агентные модели, в самом методе: результаты лидерборда (GPT 5.5 и Claude Opus 5 на 50 задачах) можно использовать как ориентир при выборе модели для long-horizon агентных задач кодинга, а описанный конвейер проверки задач (детерминированные гейты, состязательные агенты, ролевая пара «судья-врач», ручной разбор спорных случаев людьми) можно применять как чек-лист качества при построении собственных бенчмарков или тестовых наборов для RLVR.
Можно ли доверять
Материал опубликован на странице компании (домен vetto.ai) от лица неназванной команды («мы»), которая описывает свой собственный продукт, так что часть текста стоит читать как самопрезентацию, а не независимый аудит. При этом авторы явно называют источник: аудит исходного набора Meta и конкретные, проверяемые примеры лазеек (79,5% на cmatrix, 77,3% на XZ) с указанием, в чём именно состоял обман. Методология конвейера проверки описана подробно и по шагам, а не общими словами. Слабое место, сравнение лидербордов старого и нового бенчмарка авторы сами называют не вполне корректным (разные наборы протестированных моделей), что говорит скорее в пользу их аккуратности, чем против неё. Независимого стороннего подтверждения результатов в тексте нет.
Риски и подводные камни
Захваченный текст источника обрывается на середине фразы, поэтому не всё содержание материала (включая, вероятно, часть выводов) доступно для пересказа. Формулировка «Opus 5 лидирует почти на пороге 50%» в источнике не расшифрована, неясно, о каком именно измерении речь. Само сравнение ProgramBench и ProgramBench Vetted по лидербордам, по признанию авторов, ограничено: наборы протестированных моделей пересекаются лишь частично, а часть новых моделей проверяли только на Vetted-версии, так что напрямую делать вывод «какой бенчмарк сложнее» некорректно. И главный риск по своей природе не закрывается разовым аудитом: даже усиленный конвейер контроля не гарантирует, что модели или их разработчики со временем не найдут новые способы получать баллы без честной реконструкции поведения программы, именно поэтому в тексте описан не разовый аудит, а продолжающийся процесс проверки и починки задач.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.