VibeLifeBench: бенчмарк, на котором ИИ-агенты проваливают долгие задачи

Существующие тесты для ИИ-агентов обычно дают короткие самодостаточные запросы в статичной обстановке. Реальная бытовая помощь устроена иначе: задача растягивается на недели, а не минуты; мир вокруг агента меняется, пока его никто не подталкивает; многие условия никогда не проговариваются прямо. Агент, который просто отвечает на текущий запрос, с такой задачей не справится. Нужен агент, который держится проактивно и последовательно: сам решает, когда действовать, когда спросить, а когда промолчать; замечает изменения, о которых никто не сообщил; и удерживает единый план от первого дня до последнего. По словам авторов, ни один существующий бенчмарк такое поведение не измеряет.
Авторы представили VibeLifeBench, бенчмарк из 200 долгосрочных задач в десяти бытовых областях. Каждая задача, это заранее прописанный сценарий на несколько недель в смоделированном мире с 22 фиктивными сервисами. Мир идёт по собственным часам, и многие изменения в нём происходят молча, их обнаруживает только агент, который сам периодически перепроверяет обстановку. Каждую задачу оценивают детальные взвешенные проверки, которые смотрят только на то, что агент реально оставил после себя: конечное состояние, своевременность его действий и соблюдение неявных условий.
Авторы протестировали на бенчмарке семь передовых моделей, все показали низкий результат, что, по их словам, показывает, насколько нынешние агенты далеки от реальной бытовой помощи. Названия моделей, конкретные баллы и перечень десяти областей и 22 сервисов в тексте не раскрываются. Авторы планируют открыть исходный код всех задач, сред и системы оценки.
Ключевые факты
- Бенчмарк VibeLifeBench, 200 долгосрочных задач в 10 бытовых областях
- Смоделированный мир с 22 фиктивными сервисами, идущий по собственным часам
- Задачи растягиваются на несколько недель, часть изменений в мире происходит без уведомления агента
- Оценка учитывает конечное состояние, своевременность действий и соблюдение неявных условий
- Все семь протестированных передовых моделей показали низкий результат; авторы планируют открыть исходный код бенчмарка
Почему это важно
Существующие тесты ИИ-агентов проверяют короткие разовые запросы в статичной обстановке, это не отражает то, как агент должен вести себя в реальной жизни, где задача растягивается на недели, а мир меняется без предупреждения. VibeLifeBench впервые системно замеряет именно это: способность агента оставаться проактивным, самостоятельно замечать изменения и долго держать единый план. Результат, семь передовых моделей показали низкий балл, говорит о том, что этот разрыв реален и велик.
Кому это важно
Разработчикам персональных ИИ-ассистентов и агентных продуктов, бенчмарк описывает ровно тот класс задач, для которого такие продукты создаются. Исследователям, оценивающим агентов, появляется методика для долгосрочных, а не разовых сценариев.
Как это применить
Авторы обещают открыть исходный код всех 200 задач, симулированных сервисов и системы оценки, после публикации любая команда сможет прогнать через VibeLifeBench собственного агента и сравнить его с другими. Пока код не выложен, использовать бенчмарк на практике нельзя.
Можно ли доверять
Текст не называет ни авторов работы, ни конкретные протестированные модели, ни их баллы, ни перечень десяти областей и 22 сервисов, проверить утверждения по опубликованному описанию пока нельзя. Методика выглядит продуманной, но до выхода кода и полного текста работы это остаётся заявлением авторов, не подтверждённым независимо.
Риски и подводные камни
Смоделированный мир из 22 фиктивных сервисов заведомо проще и предсказуемее настоящей жизни, низкий результат моделей в бенчмарке не обязательно означает такой же провал в реальных бытовых сценариях, и наоборот. Пока не раскрыты ни методология в деталях, ни исходный код, независимая проверка результатов невозможна.