ESQ-Bench: новый бенчмарк выявил скрытые ошибки NL2SQL-моделей на Oracle
Исследователи представили ESQ-Bench, бенчмарк для оценки NL2SQL-моделей (перевод вопроса на естественном языке в SQL-запрос), построенный вокруг Oracle и рассчитанный на несколько СУБД сразу. Повод: модели вроде GPT-4o уже показывают на устоявшихся бенчмарках Spider и BIRD точность выполнения выше 89%, но эти бенчмарки используют упрощённые учебные схемы и диалекты SQL с открытым исходным кодом, которые не отражают сложность реальных корпоративных баз данных.
Для ESQ-Bench построили шесть заполненных схем с одинаковыми исходными данными сразу на четырёх СУБД, Oracle, PostgreSQL, MySQL и SQL Server: всего 465 таблиц и 164 682 строки, ни одной пустой таблицы. Схемы разбиты на три уровня сложности. К ним добавили 550 проверенных вручную пар «вопрос, эталонный SQL-запрос» (95 на первом уровне, 228 на втором, 227 на третьем) и систему оценки из четырёх метрик, EM, EX, SR и SD.
На полном наборе из 550 вопросов подсказки с привязкой к схеме данных (schema-linked prompting) для GPT-4o дают монотонное падение точности выполнения (EX) по мере роста сложности: 79,8%, 60,3% и 57,2% на трёх уровнях (замер июня 2026 года). Показательно, что на более раннем пилотном срезе из 142 вопросов та же модель с тем же типом подсказок показывала обратную картину, рост от 75,6% через 80,4% до 95,8% с усложнением; авторы не объясняют это расхождение. Точное совпадение запроса с эталоном (EM) при этом не поднимается выше 7% ни на одном уровне сложности.
Центральный результат работы, скрытое расхождение (silent divergence): среди запросов, которые формально выполнились и прошли проверку по EX, от 73 до 99% на самом деле возвращают неверный результат. Разбор ошибок показывает, что на более сложных уровнях преобладают именно случаи с ошибочной семантикой ответа, а не синтаксические сбои.
Claude Sonnet 4.6 с теми же подсказками с привязкой к схеме показывает 87,4%, 74,9% и 68,7% EX на трёх уровнях, обгоняя GPT-4o с аналогичными подсказками на каждом из них. При этом GPT-4o в режиме zero-shot (без примеров в подсказке) точность выполнения даёт 78,7%, 73,5% и 77,8% EX, из-за более низкой доли фактически выполненных запросов и связанного с этим смещения выборки результат на втором и третьем уровнях меняет местами ранжирование по сравнению со schema-linked подходом. Локальная модель Llama 3.2 со schema-linked подсказками набирает лишь 13,3% EX по всему набору (73 правильных запроса из 550), авторы указывают на это как на разрыв между закрытыми API-моделями и открытыми базовыми моделями на корпоративных схемах Oracle.
Ключевые факты
- Бенчмарк ESQ-Bench построен на шести реальных по масштабу схемах (465 таблиц, 164 682 строки) сразу на Oracle, PostgreSQL, MySQL и SQL Server, в отличие от упрощённых схем Spider и BIRD.
- 550 проверенных пар «вопрос, SQL-запрос» разбиты на 3 уровня сложности; у GPT-4o со schema-linked подсказками точность выполнения падает с 79,8% до 57,2% при росте сложности.
- Главный вывод, скрытое расхождение: от 73 до 99% запросов, которые формально выполнились успешно, на деле возвращают неверный результат.
- Claude Sonnet 4.6 со schema-linked подсказками (87,4, 68,7% EX по уровням) обходит GPT-4o с теми же подсказками на всех трёх уровнях сложности.
- Открытая модель Llama 3.2 набирает лишь 13,3% EX по всему набору (73 из 550), авторы фиксируют разрыв с закрытыми API-моделями на корпоративных Oracle-схемах.
Почему это важно
Учебные бенчмарки NL2SQL вроде Spider и BIRD годами показывали точность выполнения выше 89%, создавая впечатление, что перевод вопросов на естественном языке в SQL уже почти решённая задача. ESQ-Bench впервые системно проверяет модели на схемах, приближённых по масштабу к корпоративным базам, да ещё сразу на четырёх СУБД с одинаковыми данными, и точность на самом сложном уровне падает более чем на 20 процентных пунктов относительно простого. Это меняет картину: разрыв между лабораторными метриками и реальной пригодностью технологии оказался куда больше, чем считалось.
Кому это важно
В первую очередь, командам, которые внедряют NL2SQL-интерфейсы поверх корпоративных Oracle-баз: аналитикам данных, разработчикам BI-инструментов и поставщикам ИИ-ассистентов для работы с базами данных. Результаты также важны исследователям, которые выбирают бенчмарк для сравнения моделей, и разработчикам самих NL2SQL-систем, которым нужно понимать, на каком типе схем их модель действительно проверена.
Как это применить
Авторы выложили в открытый доступ шесть схем с данными и 550 пар «вопрос, запрос», так что любую NL2SQL-модель можно прогнать через ESQ-Bench и получить оценку по четырём метрикам (EM, EX, SR, SD) на трёх уровнях сложности. Прежде чем полагаться на точность выполнения (EX) как на показатель качества, стоит учитывать вывод бенчмарка: сам факт успешного выполнения запроса не гарантирует, что результат совпадает с тем, что имел в виду пользователь.
Можно ли доверять
Методология описана детально, конкретный состав схем, число вопросов по уровням, четыре разные метрики и результаты нескольких моделей в сопоставимых условиях. Настораживает нестыковка: на более раннем срезе из 142 вопросов та же модель с теми же подсказками показывала рост точности с усложнением, а на полном наборе из 550, падение, и авторы не объясняют причину расхождения. В самом препринте не указаны ни авторы, ни организация, ни точное место публикации схем и вопросов, независимая проверка результатов пока затруднена.
Риски и подводные камни
Главный риск для практиков, ложное чувство надёжности: модель может успешно выполнить SQL-запрос и вернуть таблицу с данными, но при этом ответить не на тот вопрос, который задал пользователь, и это разойдётся с ожиданием в 73, 99% случаев среди формально успешных запросов. Кроме того, сравнение GPT-4o в режиме zero-shot и со schema-linked подсказками показывает, что ранжирование моделей может переворачиваться в зависимости от способа подсказки и доли реально выполненных запросов, что затрудняет прямое сопоставление цифр из разных методик.