Учёные нашли рецепт устойчивых промптов для ИИ: разброс качества в кодинге упал на 40,7%
Большие языковые модели (LLM) крайне чувствительны к тому, как именно сформулирован промпт: незначительное изменение формулировки при неизменном смысле запроса может резко и непропорционально повлиять на качество ответа. Чтобы разобраться, почему так происходит, авторы работы провели, по их собственному утверждению, первый крупномасштабный механистический анализ устойчивости промптов на уровне токенов (n-грамм): вместо оптимизации чёрного ящика или грубых шаблонов они собрали датасет из 132 000 вариантов промптов, перефразировок одного и того же запроса, и статистически изучили, как лексические различия между ними связаны с разбросом качества ответов модели.
Ключевой результат исследователи называют «законом масштабирования устойчивости промпта» (Scaling Law of Prompt Performance Stability): чем выше средняя эффективность промпта на задаче, тем ниже разброс результата и тем устойчивее промпт к перефразировкам. Иными словами, изначально удачно сформулированный запрос не только даёт лучший средний результат, но и меньше «плавает» в качестве при небольших изменениях формулировки.
Авторы выделяют два лингвистических фактора, которые лежат в основе этой устойчивости. Первый, точная терминология предметной области: она жёстко очерчивает смысловые границы запроса, не оставляя модели простора для двойного толкования. Второй, явные инструкции к действию, то есть чёткое указание, что именно и в каком порядке нужно сделать, которые формализуют ход рассуждений модели. Вместе эти два элемента сужают пространство возможных трактовок запроса и, по формулировке авторов, «фиксируют» более детерминированное, предсказуемое поведение модели при генерации ответа.
Опираясь на эти выводы, исследователи создали автоматического агента по доработке промптов (Prompt-Refining Agent), который систематически перестраивает исходный запрос пользователя, добавляя в него терминологию предметной области и операционные ограничения, те самые явные инструкции к действию. В эмпирической проверке на задаче генерации кода такой агент снизил разброс качества ответов на 40,7% по сравнению с исходными, недоработанными промптами, и при этом не просадил, а сохранил или даже улучшил средний результат. Иначе говоря, доработка промпта сделала ответы стабильнее, не пожертвовав их средним качеством.
Ключевые факты
- Первый крупномасштабный механистический анализ устойчивости промптов на уровне токенов: датасет из 132 000 вариантов одного и того же запроса.
- Обнаружен «закон масштабирования устойчивости промпта»: чем выше средняя эффективность промпта, тем ниже разброс качества и выше устойчивость к перефразировкам.
- За устойчивость промпта отвечают два фактора: точная терминология предметной области и явные инструкции к действию, вместе они сужают пространство трактовок запроса и делают ответ модели предсказуемее.
- На основе находок создан автоматический агент по доработке промптов (Prompt-Refining Agent), который встраивает в запрос терминологию предметной области и операционные ограничения.
- В задаче генерации кода агент снизил разброс качества ответов на 40,7%, сохранив или улучшив средний результат.
Почему это важно
Одна и та же по смыслу просьба, заданная чуть разными словами, может получить от языковой модели заметно разный по качеству ответ, и это подрывает предсказуемость систем, построенных поверх ИИ. До сих пор с этим боролись вручную: методом проб и ошибок подбирали удачные формулировки промптов, то есть занимались промпт-инжинирингом как ремеслом. Это исследование переводит проблему в механистическую плоскость: на датасете из 132 000 вариантов запроса показано, что устойчивость ответа не случайна, а объясняется двумя конкретными лингвистическими факторами, точной терминологией предметной области и явными инструкциями к действию. Это даёт статистически обоснованную, а не интуитивную основу для того, чтобы формулировать промпты предсказуемо, а не наугад.
Кому это важно
В первую очередь, тем, кто строит продукты поверх языковых моделей: разработчикам чат-ботов, ИИ-ассистентов для кода и других приложений на базе LLM, где нестабильное качество ответа на чуть разные формулировки одного и того же запроса напрямую портит опыт пользователя. Также это важно для инженеров, которые занимаются промпт-инжинирингом на потоке, там, где промпты пишут и правят множество людей, для исследователей интерпретируемости и надёжности ИИ-систем и для тех, кто разрабатывает инструменты автоматической доработки промптов: работа даёт механистическое, а не чисто эмпирическое обоснование того, что именно нужно менять в запросе.
Как это применить
Из работы следует практическое правило для тех, кто пишет промпты: заменять расплывчатые общие формулировки точными терминами предметной области и добавлять явные инструкции к действию, то есть прямо указывать, что именно нужно сделать и в каком порядке рассуждать, а не оставлять модели простор для домысливания. Авторы показывают это не только в теории, но и на практике: их автоматический агент по доработке промптов (Prompt-Refining Agent) делает ровно это, встраивает в исходный запрос терминологию предметной области и операционные ограничения, и на задаче генерации кода снижает разброс качества ответов на 40,7%, не теряя в среднем результате. Тот же приём, точные термины плюс чёткие инструкции к действию, можно применять и вручную, без отдельного агента, просто как правило при формулировке промпта.
Можно ли доверять
Работа выложена на arXiv в августе 2026 года как препринт, то есть на момент публикации без подтверждённого прохождения полноценного рецензирования. В самой аннотации не названы ни авторы, ни организация, что не позволяет независимо оценить их репутацию или возможный конфликт интересов. Также не указано, на какой именно языковой модели (или моделях) проводился эксперимент и на каком бенчмарке и языке программирования измерялся результат по генерации кода, это ограничивает возможность независимой проверки методики. При этом сам масштаб эксперимента, 132 000 вариантов промптов, говорит в пользу статистически обоснованных, а не единичных анекдотических выводов.
Риски и подводные камни
В тексте аннотации не названа конкретная языковая модель, на которой проверялся эффект, неясно, насколько находки переносятся на другие модели и архитектуры. Цифра в 40,7% получена только на одной задаче, генерации кода; не указаны ни бенчмарк, ни язык программирования, на которых её измеряли, и неизвестно, сохраняется ли эффект на других типах задач. Приведено только относительное снижение разброса (на 40,7%), но не абсолютные значения дисперсии до и после доработки промпта, поэтому неясно, насколько «шумным» был результат изначально и какой абсолютный выигрыш в стабильности это даёт на практике. Наконец, в аннотации не раскрыт сам механизм: как именно агент по доработке промптов определяет, какие термины предметной области и операционные ограничения добавлять в конкретный запрос.