Управление языком в LLM: почему прилагательные работают по-разному на разных моделях

Управление языком в LLM: почему прилагательные работают по-разному на разных моделях

Как управлять LLM через язык (prompt engineering) остаётся черным ящиком. Авторы предложили строгий фреймворк через Shapley-значения для количественного измерения влияния отдельных прилагательных на производительность модели. Тестировали 100 прилагательных на 5 архитектурах (o3, gpt-4o-mini, phi-3, llama-3-70b, deepseek-r1) на MMLU-бенчмарке. Ключевые находки: (1) малое подмножество прилагательных работает как мощные "рычаги" управления; (2) эффект не универсален, модели одной линии (e.g., семейство GPT) реагируют коррелированно, архитектурно разные модели независимо; (3) направление эффекта зависит от синтаксического места в промпте; (4) в больших моделях (o3, gpt-4o) появляются неаддитивные взаимодействия, где одно прилагательное может усилить, ослабить или обратить эффект другого.

Ключевые факты

  • Тестировали 100 прилагательных через Shapley-значения на 5 моделях разных архитектур
  • Найдены мощные "управляющие" прилагательные, эффект которых не универсален
  • Модели одного семейства (например, GPT) показывают коррелированную чувствительность к одним словам
  • Разные архитектуры реагируют независимо, опровергая идею one-size-fits-all prompting
  • В больших моделях типичны нелинейные взаимодействия: комбинация прилагательных может менять эффект друг друга

Почему это важно

Prompt engineering часто полагается на анекдотичные хвосты ("be precise", "think step-by-step"). Эта работа впервые количественно измеряет эффект и обнаруживает, что управление языком сложнее, чем считалось. Одно слово в GPT-4 может иметь совсем другой эффект в Claude. Это объясняет, почему один промпт работает в одной модели, но не в другой.

Кому это важно

Авторам prompt-инженеров (System 1 или приватные системы); исследователям AI alignment (попытки контролировать поведение); авторам LLM-фреймворков (LangChain, LlamaIndex); компаниям, деплоящим несколько моделей одновременно.

Как это применить

Если вы используете несколько моделей (Claude, GPT, Llama), проверяйте промпты на каждой, один не подойдёт для всех. Для сложных задач избегайте ставить в один промпт конфликтующие прилагательные ("be precise" + "be creative"). Для каждой модели подготавливайте переменные версии промпта, особенно если результаты критичны. Если вы обучаете RLHF, помните, что Language steering compositional только для больших моделей, маленькие модели интерпретируют слова более буквально.

Можно ли доверять

arXiv-статья с rigorous фреймворком (Shapley-значения) и множественными бенчмарками. Результаты тестированы на популярных моделях (o3, GPT-4o, Llama-70b, DeepSeek). Метод хорошо объясняется. Однако эта работа ещё не в конференции, и масштаб тестов (100 прилагательных на одном бенчмарке MMLU) может не полностью отражать поведение на других задачах.

Риски и подводные камни

Shapley-значения вычислительно дорогие, могут быть шумные на малых выборках. Эффекты, найденные на MMLU (тесты на знания), могут не переноситься на генерацию текста или code. Формулировка прилагательного ("be precise" vs "precisely") может сильно менять эффект. Большие модели быстро обновляются, и промпты, спроектированные сегодня, могут не работать на следующей версии.

«As models scale, their interpretation of prompts becomes more sophisticated but also less predictable, posing a significant challenge for robustly steering model behavior.»

— Авторы статьи