Synthesis Through Simulation: агент генерирует корпоративные данные без доступа к схемам БД

Авторы исходят из проблемы: агенты, вызывающие инструменты, стали центральными для корпоративного ИИ, но обучать и оценивать их в больших масштабах мешают коммерческие и юридические ограничения на корпоративные системы, данные и схемы баз данных. Очевидная альтернатива, синтез табличных данных, однако, по словам авторов, его эффективность принципиально упирается в структурную валидность и доступность схемы. Подходы на основе процедур страдают обратной слабостью: без ручной проработки под каждую предметную область им обычно не хватает точности распределений.

В ответ предложена парадигма Synthesis Through Simulation (STS), синтез данных без схемы (schema-free). Агент на базе большой языковой модели (LLM) создаёт данные, выполняя операции через API, которые обеспечивают соблюдение политик, внутри симулированных корпоративных сред. Поскольку данные порождаются в той же среде, которая определяет, что считается допустимым, STS по построению гарантирует структурную валидность. При этом обеспечение валидности отделено от моделирования распределения данных, и каждую из задач можно решать независимо.

Оставшиеся задачи, точность распределений и масштабируемость синтеза, решает Generalist Populator (GP), универсальный, не привязанный к предметной области агент STS. По данным авторов, GP достигает средней маргинальной точности (marginal fidelity) 0,88 и 100% соблюдения ограничений во всех десяти средах, не имея доступа к схемам баз данных. Статистические синтезаторы неприменимы к семи из десяти сред из-за требования исходных (seed) данных. Агенты, которым схема доступна, проваливают 82% траекторий в среде авиакомпании (airline) с тесно связанными рабочими процессами, из-за хрупкой композиции задач.

Авторы публикуют в открытом доступе весь фреймворк, все десять сред и сгенерированные наборы данных; репозиторий размещён в организации SAP на GitHub (github.com/SAP/synthesis-through-simulation).

Ключевые факты

  • STS, подход без схемы: агент на базе большой языковой модели генерирует корпоративные данные, выполняя операции через API с проверкой политик в симулированных средах.
  • Структурная валидность данных гарантируется по построению, а обеспечение валидности отделено от моделирования распределений.
  • Агент Generalist Populator достигает средней маргинальной точности 0,88 и 100% соблюдения ограничений во всех десяти средах без доступа к схемам БД.
  • Статистические синтезаторы неприменимы к семи средам из десяти из-за потребности в исходных данных; агенты со схемой проваливают 82% траекторий в среде авиакомпании.
  • Фреймворк, десять сред и сгенерированные наборы данных выложены в открытый доступ в репозитории организации SAP на GitHub.

Почему это важно

Для обучения и проверки корпоративных агентов нужны реалистичные данные, а настоящие системы, данные и схемы баз данных закрыты коммерческими и юридическими ограничениями. Работа предлагает способ получать согласованные данные, не имея схемы вообще: допустимость обеспечивает сама среда, через которую агент создаёт записи.

Кому это важно

Командам, которые разрабатывают и тестируют агентов с вызовом инструментов для корпоративных систем, а также исследователям синтетических данных. Открытые среды и наборы данных позволяют воспроизвести результаты и использовать их как основу для своих экспериментов.

Как это применить

Фреймворк, все десять сред и сгенерированные наборы данных опубликованы по адресу github.com/SAP/synthesis-through-simulation. Сведений о стоимости, времени работы и объёмах данных в описании работы нет, поэтому оценить затраты на запуск заранее нельзя.

Можно ли доверять

Это научная статья на arXiv; все цифры, собственные результаты авторов. В описании не раскрыто, как именно измеряется маргинальная точность и по какой шкале получено значение 0,88, нет и сравнительных показателей других методов, поэтому оценить масштаб преимущества по одному аннотационному тексту трудно. Не названа и языковая модель, на которой работает агент. Плюс, открытый код, среды и данные, которые можно проверить самостоятельно.

Риски и подводные камни

Неприменимость статистических синтезаторов к семи средам и провал 82% траекторий у агентов со схемой в среде авиакомпании, аргументы авторов в пользу своего подхода, но из описания не видно, на каких именно средах и в каких условиях это измерено. Результаты получены в десяти симулированных средах, и перенос на реальные корпоративные системы в описании не обсуждается.