Бенчмарк DataSpace: лучшие ИИ-агенты решают лишь 66% задач анализа данных

Исследователи представили DataSpace, бенчмарк для проверки ИИ-агентов, которые должны отвечать на вопросы по данным, разбросанным по разнородному рабочему пространству организации: базам данных, структурированным файлам, объёмным документам и медиафайлам. Авторы отмечают, что существующие бенчмарки обычно проверяют что-то одно, либо структурированные запросы к базам данных, либо поиск информации, либо открытый анализ, и не сводят вместе поиск разнородных доказательств, полные табличные ответы и строгую детерминированную проверку результата.
DataSpace содержит 410 кросс-языковых задач и 7 439 артефактов общим объёмом 15,01 ГБ в форматах CSV, JSON, SQLite, Markdown, PDF и видео. Агент получает только вопрос и рабочее пространство и должен вернуть полный запрошенный табличный результат. Бенчмарк также послужил официальной площадкой оценки для конкурса KDD Cup 2026 по сложному анализу данных ИИ-агентами.
Бенчмарк построен с помощью фреймворка DataSpace-Builder: он включает кросс-языковое преобразование данных, выборку реляционных данных с учётом ограничений, маршрутизацию по модальностям и генерацию артефактов, а также ручную проверку и доработку задач силами 11 экспертов в соответствующих областях. Проверяет ответы детерминированный оценщик: он выравнивает колонки независимо от заголовков, нормализует значения с учётом типов данных и точности чисел и сравнивает строки результата с учётом их порядка.
Авторы протестировали шесть недавно выпущенных передовых мультимодальных моделей в связке с пятью широко используемыми агентными обвязками (harness). Лучший результат, 66,34% точности. При этом сама обвязка агента, даже при фиксированной модели-основе, даёт разброс точности в 15,36 процентного пункта. Мультимодальная интеграция доказательств (когда нужно свести данные из разных типов файлов) и операции соединения данных (joins) стабильно снижают точность у всех шести моделей. Авторы делают вывод, что DataSpace далёк от насыщения, то есть задачи остаются достаточно сложными, чтобы отражать реальный прогресс агентов, и указывают на конкретные проблемы, которые ещё предстоит решить для повышения надёжности ИИ-агентов, работающих с данными.
Ключевые факты
- DataSpace, новый бенчмарк для ИИ-агентов, которые должны находить и сводить в таблицу данные из разнородных источников: баз данных, файлов, документов и видео
- 410 задач и 7 439 артефактов общим объёмом 15,01 ГБ в форматах CSV, JSON, SQLite, Markdown, PDF и видео
- Бенчмарк стал официальной оценкой конкурса KDD Cup 2026 по сложному анализу данных ИИ-агентами
- Лучшая точность среди шести мультимодальных моделей и пяти агентных обвязок, 66,34%; выбор обвязки при фиксированной модели даёт разброс в 15,36 процентного пункта
- Интеграция данных из разных модальностей и операции соединения (joins) стабильно снижают точность у всех протестированных моделей
Почему это важно
Компании всё активнее пытаются доверить ИИ-агентам аналитику по своим внутренним данным, но эти данные редко лежат аккуратно в одной таблице, они разбросаны по базам данных, файлам, документам и медиа. DataSpace впервые сводит вместе три требования сразу: поиск разнородных доказательств, полный табличный ответ (а не короткая цитата) и строгую детерминированную проверку правильности этого ответа. Это делает результаты сопоставимыми между разными агентами и моделями, а не оценкой на глаз.
Кому это важно
Разработчикам ИИ-агентов и агентных фреймворков, как ориентир, где именно теряется точность. Компаниям, которые рассматривают внедрение таких агентов для аналитики по корпоративным данным, как честная оценка текущих возможностей: даже лучшие системы сейчас решают только около двух третей задач. Организаторам и участникам KDD Cup 2026, для которых DataSpace стал официальным бенчмарком соревнования.
Как это применить
Бенчмарк и построивший его фреймворк DataSpace-Builder можно использовать как тестовый стенд при выборе или разработке агентной обвязки: тестирование показало, что сама обвязка, а не только модель-основа, сильно влияет на итоговую точность, разброс между обвязками достигает 15,36 процентного пункта при одной и той же модели. Это значит, что при внедрении ИИ-агента для анализа данных стоит тестировать сочетание модели и обвязки, а не только модель отдельно.
Можно ли доверять
Источник, научная работа с подробным описанием методологии: детерминированный оценщик (выравнивание колонок, нормализация типов и точности, сравнение строк с учётом порядка) и ручная проверка задач 11 экспертами снижают риск случайных или необъективных результатов. В самом тексте источника не указаны авторы и организации, эти данные есть только в метаданных публикации, поэтому персональную атрибуцию здесь не приводим.
Риски и подводные камни
Даже лучшая протестированная связка модели и обвязки решает только 66,34% задач, то есть треть аналитических запросов агенты выполняют неверно. Особенно страдает точность там, где нужно свести данные разных модальностей (например, таблицу и видео) или выполнить соединение данных из нескольких источников: на этих типах задач точность падает у всех шести протестированных моделей. Авторы не объясняют, почему разные агентные обвязки дают такой большой разброс результатов при одной и той же модели, это открытый вопрос.