MaP-SQL: отбор SQL-запросов памятью без дообучения обошёл R³-SQL

Системы Text-to-SQL (перевод вопроса на естественном языке в SQL-запрос) обычно работают по схеме «генерация, выполнение, отбор»: модель сначала генерирует несколько вариантов SQL-запроса, а затем отдельный отборщик выбирает из них лучший. Групповой отбор (listwise selection), при котором кандидаты сравниваются сразу все вместе, а не по одному, даёт более точный результат, но дообучение такого отборщика, дорогая операция.
Авторы предлагают MaP-SQL, отборщик, который вообще не требует дообучения. Вместо того чтобы заучивать критерии отбора в параметрах модели, метод заменяет две задачи обучения на приёмы, применяемые прямо во время инференса. Во-первых, он строит переиспользуемую структурированную память: по вопросу пользователя MaP-SQL извлекает из неё шаблоны, дистиллированные из тренировочных данных и описывающие, как формулировки на естественном языке соотносятся со схемой базы данных, операциями SQL и ожидаемым результатом. Эти шаблоны служат явными критериями при оценке кандидатов списком. Во-вторых, чтобы снизить позиционное смещение, когда порядок предъявления кандидатов влияет на выбор, метод усредняет ранжирование по нескольким перестановкам входного списка, а расход вычислений на инференс контролирует за счёт результатов выполнения запросов и более дешёвой точечной (pointwise) оценки.
На бенчмарке BIRD-dev при одинаковом наборе кандидатов MaP-SQL превзошёл предыдущий лучший метод-отборщик R³-SQL на 2,02 процентных пункта точности выполнения запросов в среднем и потратил в 2,92 раза меньше токенов. По утверждению авторов, на нескольких бенчмарках Text-to-SQL метод в целом даёт более стабильный отбор и требует меньше лишних сравнений кандидатов, чем существующие подходы. Абсолютное значение точности на BIRD-dev, авторы, аффилиация и сведения о публикации или доступности кода в тексте не приведены.
Ключевые факты
- Text-to-SQL системы генерируют несколько вариантов SQL-запроса и выбирают лучший (схема «генерация, выполнение, отбор»); групповой (listwise) отбор сравнивает кандидатов сразу, но дообучение такого отборщика дорого.
- MaP-SQL заменяет обучаемый отборщик памятью: извлекает из тренировочных данных шаблоны сопоставления вопроса со схемой базы данных, SQL-операциями и ожидаемым результатом и использует их как явные критерии оценки кандидатов.
- Чтобы снизить позиционное смещение при групповом сравнении, метод усредняет ранжирование по нескольким перестановкам кандидатов, а расход на инференс сокращает результатами выполнения запросов и точечной (pointwise) оценкой.
- На BIRD-dev при одинаковом наборе кандидатов MaP-SQL обходит предыдущий лучший метод-отборщик R³-SQL на 2,02 процентных пункта точности выполнения в среднем и тратит в 2,92 раза меньше токенов.
- По словам авторов, метод не требует дообучения и на нескольких бенчмарках Text-to-SQL даёт более стабильный отбор с меньшим числом лишних сравнений, чем существующие подходы.
Почему это важно
Групповой отбор лучшего SQL-запроса из нескольких кандидатов повышает точность Text-to-SQL систем, но обучение отдельного отборщика под эту задачу, дорогая часть пайплайна, которую приходится повторять для каждой новой модели или домена. MaP-SQL показывает, что эту роль можно закрыть без дообучения вообще: структурированной памятью, извлекаемой во время запроса, и агрегацией ранжирований вместо параметров, которые нужно было бы обучать заново.
Кому это важно
Инженерам и исследователям, которые строят или дорабатывают Text-to-SQL и NL-to-SQL системы, ассистентов для работы с базами данных, BI-инструменты с запросами на естественном языке, а также командам, использующим пайплайны «генерация, выполнение, отбор» поверх больших языковых моделей и ищущим способ повысить точность отбора без затрат на обучение отдельной модели-отборщика.
Как это применить
Метод заявлен как совместимый с уже существующими большими языковыми моделями без их дообучения: нужна лишь структурированная память, построенная из тренировочных данных задачи, и логика агрегации ранжирований по перестановкам кандидатов с контролем расхода на инференс через результаты выполнения запросов и точечную оценку. Сведений о выпуске кода, модели или сроках доступности в источнике нет.
Можно ли доверять
Материал, препринт с постраничным описанием метода и результатов, без указания авторов, аффилиации и места публикации в тексте. Заявленное улучшение, 2,02 процентных пункта точности выполнения над R³-SQL и снижение расхода токенов в 2,92 раза, приведено только как относительное значение на одном бенчмарке (BIRD-dev), при одинаковом наборе кандидатов; абсолютная точность MaP-SQL на BIRD-dev в тексте не названа. Цифры о собственном методе приводят сами авторы, независимой проверки в материале нет.
Риски и подводные камни
Количественно метод проверен и заявлен только относительно одного конкурента (R³-SQL) на одном бенчмарке (BIRD-dev); заявление о стабильности на «нескольких бенчмарках Text-to-SQL» дано лишь качественно, без цифр. Качество структурированной памяти зависит от полноты и разнообразия тренировочных данных, из которых она строится, а сведений о том, как метод ведёт себя на данных, сильно отличающихся от обучающих, в тексте нет. Отсутствие данных об авторах и публикации осложняет независимую проверку заявленных результатов.