MIT создал бенчмарк Beaver: точность text-to-SQL на реальных базах, 10, 30% против 80%+ в тестах
Авторы блога CACM, Майкл Стоунбрейкер, профессор компьютерных наук MIT и лауреат премии Тьюринга 2014 года, и Питер Бэйл Чен, аспирант лаборатории CSAIL MIT, два года тестировали технологию text-to-SQL (перевод вопроса на естественном языке в SQL-запрос) на реальных корпоративных хранилищах данных и обнаружили резкий разрыв между результатами публичных бенчмарков и практикой.
На популярных лидербордах Spider 1.0 точность LLM превышает 80%, на Bird-SQL, выше 90%, а на более новом Spider 2.0 агентные решения показывают выше 90%. Авторы указывают на четыре причины, почему эти цифры не отражают реальность: данные этих бенчмарков давно попали в обучающие выборки LLM; схемы реальных хранилищ со временем «гниют», например, в одной таблице может встретиться шесть разных столбцов «salary» с несовпадающим смыслом (один, «зарплата после налогов и комиссий», другой, «зарплата до вычетов»); в реальных данных много специфики конкретной организации (в хранилище MIT это, например, термин «J-term», январский модуль между осенним и весенним семестрами, и номера корпусов вместо названий, Stata Center официально значится как «Building 32»); наконец, реальные запросы почти всегда требуют два-три JOIN, а не один, как в учебных примерах Spider и Bird-SQL.
Чтобы измерить реальную точность, авторы собрали бенчмарк Beaver на основе Oracle-хранилища MIT (более 1400 таблиц, используется множеством подразделений, включая CSAIL) и данных ещё трёх организаций. Пары «вопрос на естественном языке, эталонный SQL» брались из реальных логов: бизнес-пользователи формулировали запрос, ИТ-специалисты переводили его в SQL, часто в диалоге друг с другом.
Результаты на Beaver: LLM без дополнительных подсказок дала точность 0%. Добавление RAG, промпт-инжиниринга и агентного ИИ подняло точность до уровня 10+%. Если же модели заранее подсказать правильные таблицы из FROM-секции эталонного запроса и точные условия JOIN, точность выросла до 30+%. Авторы подчёркивают: это более чем на 50 процентных пунктов ниже публичных бенчмарков, и в этом разница между «у технологии есть перспективы» и «технология не работает».
Авторы сделали Beaver и лидерборд по нему общедоступными и предлагают сообществу искать способы повысить точность. Собственную альтернативу они описывают в системе Rubicon. Вывод статьи: сегодняшние LLM и агентный ИИ дают хорошие результаты в text-to-SQL только на чистых схемах, простых запросах и данных без специфики конкретной организации, в остальных случаях нужен другой подход.
Ключевые факты
- Beaver построен на реальных данных: Oracle-хранилище MIT (1400+ таблиц, используется множеством подразделений, включая CSAIL) плюс данные ещё трёх организаций; запросы собраны из логов ИТ-специалистов за два года.
- На Spider 1.0 точность LLM превышает 80%, на Bird-SQL, выше 90%, на Spider 2.0 у агентных решений, выше 90%.
- На Beaver: LLM без подсказок, 0% точности; RAG + промпт-инжиниринг + агентный ИИ, около 10%; если модели заранее дать правильные таблицы и JOIN из эталонного SQL, около 30%.
- Разрыв объясняется четырьмя причинами: утечка данных публичных бенчмарков в обучающие выборки LLM; «гниющие» со временем схемы реальных хранилищ (дублирующиеся столбцы вроде шести разных «salary» с разным смыслом); специфика конкретной организации в данных (например, «J-term» и номера корпусов в MIT); более сложные реальные запросы, обычно два-три JOIN вместо одного.
- Авторы опубликовали Beaver и лидерборд в открытом доступе и предлагают собственную альтернативную систему Rubicon.
Почему это важно
Публичные лидерборды text-to-SQL годами создавали впечатление, что перевод вопросов на естественном языке в SQL-запросы, почти решённая задача: 80, 90%+ точности выглядят как готовый к внедрению продукт. Beaver показывает, что эти цифры измеряют не реальную задачу, а способность LLM запомнить обучающие данные и решать упрощённые учебные запросы. На настоящих корпоративных хранилищах с их запутанными схемами и сложными запросами точность падает в разы, это меняет оценку зрелости технологии text-to-SQL и агентного ИИ для работы с базами данных в целом.
Кому это важно
Разработчикам продуктов, которые продают или планируют внедрять NL-to-SQL интерфейсы поверх корпоративных хранилищ данных; ИТ-отделам и дата-инженерам, оценивающим готовность LLM-ассистентов заменить ручной перевод бизнес-вопросов в SQL; исследователям, которые строят и сравнивают бенчмарки для агентного ИИ и хотят более честную методологию оценки.
Как это применить
Beaver и лидерборд по нему опубликованы в открытом доступе, команды, разрабатывающие text-to-SQL решения, могут проверить их не на Spider или Bird-SQL, а на данных, приближенных к реальным корпоративным хранилищам со «сгнившими» схемами и идиосинкратическими данными. Авторы указывают, что качественный скачок точности дают заранее известные правильные таблицы и JOIN-условия, то есть системе нужна помощь в навигации по схеме, а не только в генерации SQL-синтаксиса; собственный подход к этой проблеме они описывают в системе Rubicon.
Можно ли доверять
Источник, блог Communications of the ACM, ведущего издания ACM; авторы, Майкл Стоунбрейкер, профессор MIT и лауреат премии Тьюринга 2014 года за вклад в системы управления базами данных, и Питер Бэйл Чен, аспирант CSAIL MIT, работающий с ним на стыке ИИ и систем данных. Методология описана: реальные (не синтетические) пары «вопрос, эталонный SQL» получены из логов производственных запросов к хранилищам, включая хранилище самого MIT, с участием реальных бизнес-пользователей и ИТ-специалистов; бенчмарк и лидерборд опубликованы и доступны для проверки.
Риски и подводные камни
Главный риск, переносить впечатление из публичных бенчмарков (80, 90%+ точности) на продакшн-системы, работающие с реальными корпоративными данными: разрыв в 50+ процентных пунктов означает, что решение, «работающее» на Spider или Bird-SQL, может давать почти нулевую точность на конкретном хранилище компании. «Гниение» схем и идиосинкратические данные, не временная проблема отдельных организаций, а системное свойство реальных хранилищ, которое со временем только усугубляется. Beaver построен на данных всего четырёх организаций (MIT и трёх других), насколько его результаты обобщаются на другие типы хранилищ и отраслей, в тексте не оценивается.
«Это более чем на 50 процентных пунктов ниже точности публичных бенчмарков, и в этом разница между «у технологии есть перспективы» и «технология не работает».»
— Майкл Стоунбрейкер и Питер Бэйл Чен, блог Communications of the ACM