BatchDAG: ИИ сам строит графы запросов и сокращает вызовы LLM в 47 раз

Языковые модели хорошо анализируют один документ, но «ломаются» на сквозных аналитических вопросах по большим корпоративным массивам данных: контекст переполняется, теряется привязка фактов к конкретным объектам (атрибуция), а последовательные вызовы инструментов делают ответ медленным, задержка растёт линейно с числом объектов. Авторы предлагают систему BatchDAG: вместо того чтобы модель по очереди дёргала инструменты, она один раз генерирует типизированный направленный ациклический граф (DAG) операций, SQL-запросы, семантический поиск, преобразования данных в памяти, параллельные разветвления (fan-out) и одноразовые аналитические шаги. Дальше этот граф выполняет отдельный детерминированный движок: он параллелит независимые «волны» операций по топологическому порядку и передаёт данные между шагами в структурированном JSON, а не в виде прозы.

Ключевая оптимизация, «батчинг по объектам» (entity-aware batching): перед разветвлением на параллельные под-задачи строки данных группируются по логической сущности (например, по компании или по встрече), и модель обрабатывает уже сгруппированные пакеты, а не каждую строку отдельно. Это сокращает число обращений к LLM до 47 раз по сравнению с построчной обработкой.

Авторы подчёркивают: BatchDAG не позиционируется как система, которая даёт более точные ответы, чем вручную оптимизированный пайплайн под конкретную задачу. Смысл в другом, это универсальный слой оркестрации, который заменяет набор отдельно написанных вручную workflow (рабочих процессов) одной системой, генерирующей нужную стратегию выполнения прямо из запроса на естественном языке.

В контролируемом эксперименте на 12 запросах, требующих анализа расшифровок встреч (transcript-heavy queries), качество ответов BatchDAG оценили в 3,74 из 5, это сопоставимо с экспертно спроектированным пайплайном (3,25 из 5) и статистически значимо лучше агента на архитектуре ReAct (3,09 из 5, p<0.01). При этом у BatchDAG выше «провенанс», доля ответов, подкреплённых прямой цитатой из расшифровки: 77% против 46, 60% у сравниваемых базовых подходов.

Отдельная абляция (эксперимент с отключением одного компонента) показала: если передавать данные между шагами графа в структурированном JSON, а не в виде текстового пересказа (прозы), число галлюцинаций снижается на 27%, но при выборке всего в 12 запросов этот результат статистически не значим (p=0.107 по парному t-тесту), то есть это скорее предварительное наблюдение, чем доказанный эффект.

Отдельно измерили надёжность самого планировщика: из 300 попыток построить граф на естественном языке 98,8% дали валидный DAG. В проде, у компании Brevian.ai, система обрабатывает аналитические запросы по базе из 50 000+ встреч меньше чем за 60 секунд, при этом стоимость одного запроса по опубликованным ценам GPT-5.1 составляет $0,02, $0,24.

Ключевые факты

  • BatchDAG заменяет последовательные вызовы инструментов LLM на один граф операций (SQL, семантический поиск, преобразования данных, параллельные разветвления), который выполняет отдельный детерминированный движок
  • Группировка строк данных по логической сущности перед разветвлением (entity-aware batching) сокращает число вызовов LLM до 47 раз
  • На 12 тестовых запросах по расшифровкам встреч качество BatchDAG (3,74/5) сравнимо с экспертным пайплайном (3,25/5) и значимо выше ReAct-агента (3,09/5, p<0.01); доля ответов с прямой цитатой-подтверждением, 77% против 46, 60% у аналогов
  • Передача данных между шагами в структурированном JSON снижает число галлюцинаций на 27% в абляции, но результат не достиг статистической значимости (p=0.107, выборка из 12 запросов)
  • Планировщик строит корректный граф в 98,8% из 300 попыток; в проде Brevian.ai система обрабатывает запросы по 50 000+ встреч менее чем за минуту при стоимости $0,02, $0,24 за запрос на ценах GPT-5.1

Почему это важно

Большинство LLM-инструментов сегодня анализируют один документ или отвечают на один вопрос за раз; как только нужно свести факты по тысячам объектов сразу (все встречи компании за квартал, все сделки по клиентам), система либо не помещает всё в контекст, либо теряет привязку фактов к конкретным объектам, либо становится медленной из-за череды последовательных вызовов. BatchDAG предлагает архитектурный ответ: модель один раз планирует граф операций, а дальше детерминированный движок исполняет его параллельно и предсказуемо, это не улучшение точности ради точности, а способ убрать ручную инженерию workflow (рабочих процессов) под каждую задачу.

Кому это важно

Прежде всего инженерам, которые строят ИИ-агентов и аналитические ассистенты поверх больших корпоративных массивов данных, встреч, звонков, документов, транзакций: BatchDAG избавляет их от необходимости вручную проектировать пайплайн под каждый новый тип аналитического запроса. Также это релевантно продуктовым командам B2B-сервисов с аналитикой по расшифровкам и логам: система уже работает в продакшене у Brevian.ai.

Как это применить

Практический рецепт из статьи, не заставлять LLM обрабатывать объекты по одному, а сначала сгруппировать их по логической сущности и уже пакетами передавать в модель (это и даёт основной выигрыш в 47 раз по числу вызовов); данные между этапами конвейера передавать в структурированном JSON, а не пересказом на естественном языке, это снижает риск галлюцинаций, хотя авторы честно отмечают, что на их выборке эффект не достиг статистической значимости. Полноценно система описана как production-компонент у Brevian.ai, обрабатывающий запросы по базе из 50 000+ встреч меньше чем за минуту при стоимости $0,02, $0,24 за запрос на ценах GPT-5.1.

Можно ли доверять

Работа опирается на контролируемый эксперимент, но выборка небольшая, 12 тестовых запросов для сравнения качества и той же абляции с JSON-промежуточными данными; статистическая значимость по качеству ответов подтверждена (p<0.01) в сравнении с ReAct-агентом, а вот заявленное снижение галлюцинаций на 27% статистически не значимо (p=0.107), это авторы прямо указывают сами, что говорит в пользу добросовестности отчёта. Показатель надёжности планировщика (98,8% валидных графов из 300 попыток) и данные по продакшен-использованию в Brevian.ai, более весомые, поскольку опираются на большее число наблюдений.

Риски и подводные камни

Ключевой заявленный эффект, не рост точности, а сокращение числа вызовов модели и затрат; сами авторы предупреждают, что BatchDAG не превосходит вручную оптимизированный экспертный пайплайн по качеству, а лишь приближается к нему при меньших трудозатратах на разработку. Главный статистически значимый результат по снижению галлюцинаций (27%) на деле не прошёл порог значимости при выборке в 12 запросов, так что его стоит воспринимать как предварительный сигнал, а не доказанный факт. Оценки качества (3,74 vs 3,25 vs 3,09 из 5), экспертные баллы по 12 запросам в узкой предметной области (анализ расшифровок встреч), и насколько это переносится на другие типы корпоративных данных, из текста не следует.