Учёные показали: языковые модели по-разному отвечают на одно и то же число, если оно записано иначе

Исследователи задались вопросом: если задача про количество сформулирована с одним и тем же числом, но записанным по-разному, как десятичная дробь, обыкновенная дробь, процент, число словами, число в экспоненциальной записи или как точно пересчитанная единица измерения, должна ли модель давать один и тот же итоговый ответ. По их исходной посылке, да, должна, ведь величина не меняется.

Чтобы это проверить, авторы сгенерировали 3600 задач с точными рациональными числами и 8600 промптов, охватывающих пять типов преобразований, которые сохраняют значение величины, но меняют её запись. На этом наборе оценили пять открытых («open-weight») языковых моделей.

После фиксированной проверки синтаксиса, которая приводит распространённые формы ответа к единому виду без привлечения LLM в роли судьи, обычная («каноническая») точность моделей оказалась высокой, от 0,969 до 0,996. Но когда авторы посмотрели не просто на точность отдельных ответов, а на то, даёт ли модель одинаковый правильный ответ на ВСЕ вариации записи одного и того же числа («орбиту»), картина изменилась: доля орбит с правильным ответом на всех вариациях («orbit correctness») упала до диапазона 0,848, 0,981, а доля орбит, где ответ хотя бы согласован между собой независимо от правильности («orbit invariance»), до 0,851, 0,981. При этом случаи, где ответ согласован, но неверен во всех вариациях, редки, не более 0,003 таких орбит.

Большая часть резкого падения точности при строгой проверке ответов, как выяснили авторы, объясняется не ошибками рассуждений моделей, а тем, что мультипликативная экспоненциальная запись числа (форма вида «a × 10^b») не была предусмотрена грамматикой разбора ответов в их собственном инструменте оценки. Это, по их выводу, показывает, как ошибки в самом инструменте проверки ответов могут маскироваться под ошибки рассуждений модели.

Отдельно был выявлен смысловой (семантический), а не технический сбой: модель Mistral Small 4 набрала всего 0,699 на задачах с пересчётом единиц измерения и допустила 265 ошибок, которые отличались от правильного ответа ровно на степень десяти, то есть модель путалась в порядке величины при переводе единиц.

В отдельном эксперименте на 9000 обращений к моделям, где на сравниваемые методы было выделено поровну обращений, авторы сравнили два способа проверки согласованности ответов моделей: через переформулировку числа в разных представлениях («representation consensus») и через переформулировку самого условия задачи другими словами («paraphrase consensus»). На подмножестве задач с низкой долей ошибок первый способ не показал преимущества перед вторым и вдобавок давал заметно больше ложных срабатываний.

Вместе с текстом статьи авторы выложили вспомогательный архив: замороженный бенчмарк, записи оценки и синтаксической проверки, сырые ответы для проверки согласованности, манифесты, код анализа и сборку статьи одной командой.

Ключевые факты

  • Бенчмарк из 3600 задач и 8600 промптов проверяет, отвечают ли языковые модели одинаково на одну и ту же величину, записанную по-разному: дробью, процентом, словами, в экспоненциальной записи или в другой единице измерения
  • Обычная точность пяти проверенных открытых моделей высокая, 0,969, 0,996, но согласованность ответов при смене формы записи числа заметно ниже: 0,848, 0,981 по правильности и 0,851, 0,981 по согласованности
  • Большая часть кажущегося провала объясняется багом в самом инструменте проверки ответов, он не распознавал экспоненциальную запись вида «a × 10^b», а не ошибками модели
  • Модель Mistral Small 4 отдельно выделяется: на задачах с пересчётом единиц измерения она набрала 0,699 и 265 раз ошиблась ровно на степень десяти
  • В эксперименте на 9000 обращений проверка согласованности через разные форматы числа не оказалась точнее проверки через переформулировку условия, и давала больше ложных срабатываний

Почему это важно

Работа проверяет предположение, которое обычно принимают на веру: раз величина не изменилась, модель должна дать один и тот же ответ независимо от того, как эту величину записали в условии. Оказалось, что это не так, при высокой точности на отдельных задачах согласованность ответов между разными записями одного и того же числа заметно ниже. То есть стандартные метрики точности могут скрывать реальную нестабильность модели: она способна путаться там, где формально задача не изменилась вовсе, а поменялась только форма числа.

Кому это важно

Разработчикам систем, где языковая модель обрабатывает числа в разных форматах, финансовые расчёты, научные и инженерные задачи, перевод единиц измерения, и тем, кто строит собственные бенчмарки и автоматические оценщики ответов моделей. Также это важно тем, кто полагается на единственную метрику точности как показатель надёжности модели: исследование показывает, что за высокой точностью может стоять скрытая непоследовательность.

Как это применить

Перед тем как доверять модели вычисления с числами, стоит проверить её не на одной формулировке задачи, а на нескольких эквивалентных, с числом в виде дроби, процента, слова, экспоненциальной записи и пересчитанной единицы измерения, и сравнить ответы между собой. Разработчикам собственных автоматических проверок ответов стоит убедиться, что их парсер распознаёт все распространённые формы записи чисел, включая экспоненциальную запись вида «a × 10^b», иначе ошибка парсера будет выглядеть как ошибка модели. При работе с пересчётом единиц измерения через Mistral Small 4 стоит отдельно проверять результат на ошибку в порядке величины. Для проверки согласованности ответов модели эксперимент авторов говорит в пользу переформулировки самого условия задачи, а не смены формата записи числа: второй способ не показал преимущества и давал больше ложных срабатываний.

Можно ли доверять

В пользу результатов говорит методология: задачи построены на точных рациональных числах (без округлений, которые могли бы смазать сравнение), проверка ответов приведена к фиксированному, воспроизводимому виду без участия языковой модели в роли судьи, а вместе со статьёй выложен полный вспомогательный архив, замороженный бенчмарк, записи оценки и аудита, сырые ответы, манифесты и код анализа с однокомандной сборкой статьи, что позволяет независимо всё перепроверить. Сама статья доступна в этом виде из выкладки на arXiv; в аннотации не указаны авторы, организации, дата подачи или площадка публикации, так что судить о статусе рецензирования по одному тексту нельзя.

Риски и подводные камни

Главный риск, принимать высокую точность модели на отдельных задачах за надёжность, не проверяя согласованность ответов при разных формулировках той же величины. Второй риск, путать ошибку собственного инструмента проверки ответов с ошибкой модели: в этой работе именно так объясняется резкое падение результатов на экспоненциальной записи чисел. Отдельно стоит иметь в виду конкретную находку про Mistral Small 4, ошибки на степень десяти при пересчёте единиц измерения могут остаться незамеченными, если проверять только итоговую точность, а не характер ошибок. Наконец, попытка проверять модель на согласованность через смену формата числа, интуитивно разумный ход, в этом эксперименте не оправдала себя как метод: он не точнее переформулировки условия и чаще ошибочно сигнализирует о проблеме там, где её нет.