SPIEval: новый бенчмарк оценил ИИ-ассистентов на смартфоне, лучший результат 57,3%

SPIEval, составленный вручную (human-curated) бенчмарк, который опирается на пять когнитивных способностей: рассуждение, разрешение неоднозначности, интеграцию сведений из разных источников, вывод предпочтений пользователя и декомпозицию запросов с несколькими намерениями. Он включает 250 задач, охватывающих 4335 персональных записей, распределённых по 10 приложениям, и поддерживает многоходовое взаимодействие через 21 инструмент.
Авторы (первый автор, Junjie Ye с соавторами) протестировали на бенчмарке девять моделей. Лучший результат показала GPT-5.5 (xhigh), 57,3% точности, худшая из моделей набрала только 16,4%; остальные восемь моделей, включая худшую, в тексте источника поимённо не названы.
Дальнейший анализ показал, что 79% сбоев связаны с неточной локализацией информации: модели чаще соглашаются на правдоподобный, но неверный ответ, вместо того чтобы продолжить поиск и проверить данные. Ещё одно наблюдение: продвинутые методы поиска применяются менее чем в 2% действий по извлечению информации, а эффективность поиска сильно различается между моделями.
Авторы делают вывод, что эти результаты обнажают фундаментальные ограничения современных мобильных ИИ-ассистентов на базе LLM и должны мотивировать дальнейшие исследования в этом направлении. Датасет и код бенчмарка выложены в открытый доступ.
Ключевые факты
- SPIEval, новый бенчмарк для оценки ИИ как мобильного ассистента, работающего с разрозненными личными данными: 250 задач, 4335 записей, 10 приложений, 21 инструмент.
- Бенчмарк опирается на пять когнитивных способностей: рассуждение, разрешение неоднозначности, интеграцию, вывод предпочтений и декомпозицию многоцелевых запросов.
- Из девяти протестированных моделей лучшей оказалась GPT-5.5 (xhigh), 57,3% точности; худшая набрала 16,4%.
- 79% сбоев вызваны тем, что модели фиксируют правдоподобную, но неверную информацию вместо продолжения проверки.
- Менее 2% действий по поиску используют продвинутые методы поиска; эффективность поиска сильно различается между моделями.
Почему это важно
ИИ-модели всё чаще выступают мобильными ассистентами, которым нужно собирать личные данные пользователя, разбросанные по разным приложениям, но специализированного бенчмарка для проверки этой способности раньше не было. SPIEval закрывает этот пробел и показывает: даже лучшая модель ошибается почти в половине задач, а масштаб проблемы, не мнение авторов, а измеренная цифра.
Кому это важно
Разработчикам мобильных ИИ-ассистентов и агентных продуктов, как ориентир, где сегодня реально проходит граница возможностей моделей. Исследователям агентных систем, как готовый инструмент для сравнения моделей на задачах с разрозненной личной информацией. Пользователям, которые полагаются на ИИ-ассистентов в повседневных задачах на телефоне, как повод не доверять таким системам вслепую.
Как это применить
Датасет и код SPIEval выложены в открытый доступ (на Hugging Face), поэтому разработчики моделей и агентов могут прогнать через него собственные системы и сравнить с девятью уже протестированными моделями. Практический вывод из анализа ошибок: модель стоит настраивать так, чтобы она продолжала поиск и проверку данных, а не фиксировалась на первом правдоподобном ответе, именно это объясняет 79% сбоев.
Можно ли доверять
Это исследовательская работа с разметкой задач человеком, контролируемой средой и проверяемыми результатами, методология рассчитана на воспроизводимость. В тексте источника не указаны ни институциональная принадлежность авторов, ни имена всех девяти протестированных моделей (кроме лучшей, GPT-5.5), что ограничивает возможность независимо перепроверить детали.
Риски и подводные камни
Из девяти моделей поимённо названа только одна, остальные восемь моделей (включая худшую по результату) не идентифицированы в тексте, сравнить с конкретными системами напрямую нельзя. Не раскрыто, какие именно «продвинутые методы поиска» имеются в виду и какие модели ими пользовались. Разбивка результатов по каждой из пяти когнитивных способностей в источнике тоже не приведена, поэтому нельзя сказать, где именно модели проседают сильнее всего.