HarnessEval-W оценивает модели мира роем ИИ-агентов вместо балла

Исследователи представили HarnessEval-W, агентифицированный конвейер оценки моделей мира (world models, систем, предсказывающих, как меняется физическая сцена). Их проблема: обычные бенчмарки выдают только скалярный балл, а достоверность оценки держится на цепочке рассуждений, которая этот балл обосновывает. Проверить прогон модели мира особенно сложно, нужно понять, правильно ли развиваются физика, причинность и состояние сцены; человек такие нарушения замечает естественным образом, но ни один существующий бенчмарк не умеет автоматизировать эту способность: метрики считаются «в лоб», без цепочки рассуждений, которую можно изучить или проверить.
HarnessEval-W решает это, перенося в оценку моделей мира парадигму харнесса (harness) из экосистемы больших языковых моделей, вместо фиксированной рубрики система интерпретирует контекст каждого конкретного случая оценки, разбивает вопрос оценки на измеримые подзадачи и порождает специализированных саб-агентов: каждый получает свой контекст и диагностические инструменты и разбирает ровно свою подзадачу. Родительский агент затем проверяет собранные доказательства и сводит их в итоговый вердикт. Такой иерархический процесс превращает каждую оценку в прозрачное «дерево доказательств», где итоговый результат подкреплён полной цепочкой рассуждений.
Авторы применили HarnessEval-W к 18 представительным моделям мира на 330 случаях оценки. По их данным, вердикты системы близко совпадают с предпочтениями людей и при этом дают проверяемую, детальную диагностику по каждому сгенерированному прогону. Весь конвейер выложен в открытый доступ как «живой» бенчмарк, авторы приглашают сообщество пополнять его новыми навыками саб-агентов и новыми случаями оценки по мере развития моделей мира.
Ключевые факты
- HarnessEval-W, агентифицированный конвейер оценки моделей мира: вместо одного скалярного балла система строит цепочку рассуждений, которую можно проверить
- Родительский агент разбивает каждый случай оценки на измеримые подзадачи и порождает специализированных саб-агентов с собственным контекстом и диагностическими инструментами под каждую подзадачу
- Родительский агент проверяет собранные доказательства и сводит их в итоговый вердикт, процесс формирует прозрачное «дерево доказательств»
- Систему применили к 18 представительным моделям мира на 330 случаях оценки; вердикты близко совпадают с человеческими предпочтениями и дают детальную диагностику каждого прогона
- Полный конвейер открыт как «живой» бенчмарк, сообществу предложено пополнять его новыми навыками и случаями оценки
Почему это важно
Оценка моделей мира, узкое место всей области: обычные метрики дают число, но не объясняют, почему прогон хороший или плохой, а значит ошибку метрики нельзя ни поймать, ни исправить. HarnessEval-W, первый по заявлению авторов подход, который автоматизирует именно ту способность, которую раньше выполнял только человек: замечать нарушения физики, причинности и состояния сцены и объяснять, в чём именно они состоят. Идея взять харнесс-парадигму (модель работает через набор инструментов и подзадач, а не по фиксированному шаблону) из мира больших языковых моделей и перенести её на оценку моделей мира, новый ход именно для этой предметной области.
Кому это важно
В первую очередь, исследователям и командам, которые разрабатывают и сравнивают модели мира (симуляторы физики, генераторы видео с предсказуемой динамикой, компоненты для робототехники и агентных систем, обучающихся в симуляции). Для них HarnessEval-W даёт не просто рейтинг моделей, а детальную, проверяемую диагностику по каждому сгенерированному прогону, то есть понятно не только «какая модель лучше», но и «в чём конкретно она ошибается».
Как это применить
Авторы сами открыли исходный код всего конвейера и оформили его как «живой» бенчмарк, приглашая сообщество добавлять новые навыки саб-агентов и новые случаи оценки по мере появления новых моделей мира. Практический путь для команды, работающей с моделями мира, взять открытый конвейер и прогнать через него собственную модель, получив вместо единственного числа разбор по конкретным подзадачам оценки.
Можно ли доверять
Заявление о качестве, «вердикты близко совпадают с человеческими предпочтениями», подкреплено экспериментом на 18 моделях мира и 330 случаях оценки, но в тексте нет конкретных цифр совпадения с человеческой оценкой и нет сравнения с результатами других бенчмарков; насколько велик выигрыш HarnessEval-W количественно, по представленному тексту судить нельзя. Имена авторов и организация-разработчик в тексте не указаны.
Риски и подводные камни
Сама конструкция, оценка через цепочку саб-агентов, переносит источник ошибки с одной метрики на целый набор диагностических агентов и инструментов: если ошибается сам родительский агент, сводящий доказательства в вердикт, или один из саб-агентов неверно диагностирует свою подзадачу, эта ошибка может остаться незамеченной именно потому, что выглядит как обоснованное рассуждение, а не голое число. В тексте не указаны ни лицензия, ни сроки развития проекта, ни конкретное место размещения открытого кода.