FormulaSpin научил модели точнее писать формулы для таблиц через самоигру
Формулы в электронных таблицах, барьер для сотен миллионов пользователей, которые не умеют их писать. Обучать модели этому сложно: размеченных примеров мало, и обычное обучение с учителем (SFT) на них быстро упирается в потолок. Авторы предлагают FormulaSpin, фреймворк самоигры (self-play), который позволяет модели улучшать себя итеративно, без дополнительных размеченных данных.
Прямое применение стандартного метода самоигры SPIN к этой задаче не работает: он одинаково штрафует любой ответ, не совпавший с эталоном, хотя у формулы часто есть несколько разных, но одинаково рабочих написаний. Из-за этого один и тот же вариант формулы в одном примере засчитывается как ошибка, а в другом, как правильный эталон, и модель получает противоречивые сигналы при обучении.
FormulaSpin решает это, используя ключевую особенность формул: их можно реально выполнить и проверить результат. Такая бинарная проверяемость выполнения отделяет настоящие смысловые ошибки от просто иначе написанных, но рабочих вариантов. Обучение устроено как игра двух версий одной модели: текущая версия учится предпочитать эталонные формулы вариантам, которые сгенерировала её предыдущая версия. Обратная связь от выполнения делит ответы модели по степени "похожести" на правильные, и это задаёт адаптивную учебную программу: сначала модель учится не ошибаться по смыслу, затем, оттачивать стиль написания формул. Дополнительно авторы вводят механизм ExecVote, голосование на уровне смысла формулы, которое корректно учитывает, что одна и та же задача может иметь несколько равно правильных решений.
В экспериментах на нескольких бенчмарках FormulaSpin показал результат уровня state-of-the-art: на бенчмарке NL2FORMULA, 74,9% точных совпадений формул и 87,1% точности по итогу выполнения. Это соответствует уровню моделей, дообученных на дополнительной разметке предпочтений человеком, и превосходит как обычное SFT, так и лучшие проприетарные модели-конкуренты. Авторы отмечают, что подход в принципе применим к любым задачам с дефицитом данных, где ответ можно исполнить и проверить, и потенциально может быть расширен и на задачи без прямой исполняемости.
Ключевые факты
- FormulaSpin, фреймворк самоигры (self-play) для обучения моделей писать формулы электронных таблиц по естественноязыковому запросу без новой разметки
- Обычный метод самоигры SPIN не годится для этой задачи: он штрафует рабочие, но иначе написанные формулы как ошибки, создавая противоречивые сигналы обучения
- Решение, использовать исполняемость формулы: обратная связь от выполнения отделяет смысловые ошибки от допустимых стилистических вариантов
- Обучение построено как игра между текущей и предыдущей версией модели плюс адаптивная программа от смысловой правильности к стилю
- Механизм ExecVote голосует по смыслу выполнения; на бенчмарке NL2FORMULA получено 74,9% точных совпадений и 87,1% точности по результату выполнения, уровень SOTA, лучше SFT и проприетарных моделей-конкурентов
Почему это важно
Формулы электронных таблиц, одна из самых массовых, но при этом плохо решаемых ИИ задач: размеченных примеров мало, а у одной и той же задачи много равнозначных решений, что ломает стандартные методы дообучения. FormulaSpin показывает рабочий способ обучать модель дальше без новой разметки, опираясь на то, что формулу можно реально выполнить и проверить результат, это самый общий и надёжный вид обратной связи, какой только может быть.
Кому это важно
Разработчикам инструментов на базе ИИ для офисных приложений и таблиц (аналоги встроенных ассистентов в Excel, Google Таблицах и подобных продуктах), а также исследователям, которые обучают модели на задачах, где ответ можно программно проверить выполнением: генерация кода, SQL-запросов, скриптов и других формально проверяемых артефактов.
Как это применить
Метод описан как фреймворк обучения модели, а не готовый продукт: применить его напрямую могут команды, которые дообучают собственные модели под задачу генерации формул или похожие исполняемые задачи и хотят обойтись без сбора дополнительной разметки предпочтений человеком.
Можно ли доверять
Результаты получены на нескольких бенчмарках, включая NL2FORMULA, с конкретными измеримыми метриками (точное совпадение и точность по итогу выполнения), а не только на качественных примерах, и сопоставлены с несколькими типами альтернатив, обычным SFT, моделями с разметкой предпочтений и проприетарными конкурентами. Источник, научная статья на arXiv, независимого стороннего воспроизведения результатов на момент публикации нет.
Риски и подводные камни
Подход опирается на то, что ответ можно исполнить и однозначно проверить его корректность, для задач без такой бинарной проверяемости (например, свободный текст или творческие ответы) метод в текущем виде не применим напрямую, и авторы сами формулируют расширение за пределы исполняемых доменов как открытое направление, а не решённую задачу.