Модели на 0,6, 1 млрд параметров догоняют 70-миллиардную в тестах поведения человека

Модели на 0,6, 1 млрд параметров догоняют 70-миллиардную в тестах поведения человека

Исследователи проверили, можно ли заменить большие языковые модели маленькими в роли «когнитивных заменителей» человека, систем, предсказывающих выбор людей в психологических экспериментах. Для этого они обучили четырнадцать моделей размером от 135 млн до 14 млрд параметров, из четырёх разных архитектурных семейств, на датасете Psych-101, 10,7 млн решений, принятых людьми в ходе 160 экспериментов.

На задачах того же типа, что были в обучении (in-distribution), размер модели почти не влияет на качество: все модели укладываются в узкий диапазон результатов, как будто упираясь в потолок. Моделей на 0,6, 1 млрд параметров достаточно, чтобы сравняться с моделью на 70 млрд параметров при предсказании поведения новых, ранее не виденных участников, если сама структура задачи модели знакома.

Когда же задача устроена по-новому (out-of-distribution), картина меняется: узкий диапазон результатов расходится в заметно более крутой рост качества с размером модели, и крупные модели получают явное преимущество в обобщении на незнакомые типы задач.

Чтобы понять, на какую именно информацию опираются модели, понимают ли они структуру задачи или используют статистические обходные пути, авторы провели два диагностических теста на 27 экспериментах. В первом они по очереди убирали из подсказки четыре канала информации: инструкции к задаче, содержание предъявляемых стимулов, обратную связь о результатах и историю прошлых выборов. Маскирование содержания стимулов и обратной связи уничтожило 75,7% усвоенной моделью информации и опустило качество предсказаний ниже уровня случайного угадывания, это показывает, что одной лишь истории прошлых выборов моделям недостаточно для хорошего результата. Во втором тесте порядок испытаний перемешивали: на задачах с независимыми друг от друга испытаниями это ничего не меняло, но на задачах, где порядок определяется предыдущими ответами участника, качество предсказаний падало.

Вывод авторов: небольшие, дообученные на психологических данных модели могут служить оценкой «потолка шума», верхней границы того, насколько вообще предсказуемо поведение человека в конкретном эксперименте с учётом присущей ему случайности. Но применимость этого подхода ограничена теми типами задач, которые модель видела при обучении.

Ключевые факты

  • 14 языковых моделей от 135 млн до 14 млрд параметров, четыре архитектурных семейства, обучены на Psych-101, 10,7 млн решений людей из 160 экспериментов
  • На знакомых типах задач (in-distribution) модели на 0,6, 1 млрд параметров не уступают модели на 70 млрд параметров
  • На новых типах задач (out-of-distribution) преимущество крупных моделей резко растёт, рост качества с размером становится значительно круче
  • Маскирование стимулов и обратной связи в подсказке уничтожает 75,7% усвоенной моделью информации и опускает точность ниже случайного угадывания
  • Перемешивание порядка испытаний не влияет на задачи с независимыми испытаниями, но снижает качество там, где порядок определяется предыдущими ответами

Почему это важно

Результат ломает интуицию «чем больше модель, тем лучше»: на знакомых типах психологических задач разница между моделью на 1 млрд и на 70 млрд параметров почти исчезает, но эта же разница резко возвращается, как только задача устроена по-новому. Это показывает, что масштаб языковой модели даёт разную отдачу в зависимости от того, экстраполирует модель или интерполирует внутри уже виденного распределения задач.

Кому это важно

Прежде всего, исследователям, которые используют языковые модели как заменители человека в психологических экспериментах и хотят сэкономить на вычислениях: работа показывает, для каких типов задач маленькая модель даёт результат не хуже большой, а для каких, нет. Полезно это и тем, кто изучает законы масштабирования языковых моделей в целом: работа даёт конкретный пример, где закономерность роста качества с размером резко меняется в зависимости от того, знакома ли модели структура задачи.

Как это применить

Для экспериментов того же типа, что уже представлены в Psych-101, авторы показывают, что вместо модели на 70 млрд параметров можно использовать модель на 0,6, 1 млрд параметров без потери качества предсказаний, это заметная экономия вычислений. Для новых типов задач такая замена не работает: там нужна модель покрупнее. Сам метод диагностики, поочерёдное отключение каналов информации в подсказке и перемешивание порядка испытаний, авторы предлагают как инструмент, позволяющий проверить для любой подобной модели, опирается ли она на структуру задачи или на статистические обходные пути.

Можно ли доверять

В доступном тексте статьи выводы подкреплены количественными диагностиками, двумя независимыми тестами на 27 экспериментах, с конкретной цифрой (75,7% уничтоженной информации при маскировании). Текст не называет авторов и организации, стоящие за работой, и не приводит статус публикации (рецензирование, конференция и т.п.), эти детали проверить по имеющемуся материалу нельзя.

Риски и подводные камни

Авторы сами оговаривают главное ограничение: область применения маленьких моделей ограничена парадигмами задач, которые они видели при обучении, за пределами этих парадигм полагаться на них небезопасно, что и подтверждает резкое падение качества на новых типах задач. Тест с маскированием стимулов и обратной связи показывает и обратную сторону: без содержания задачи (одной лишь истории выборов) точность моделей падает ниже случайного угадывания, то есть часть их успеха держится на конкретной информации в подсказке, а не на устойчивом понимании структуры задачи.

«Вне выборки этот узкий диапазон раскрывается в заметно более крутой градиент масштабирования, и более крупные модели получают явное преимущество в обобщении на новые типы задач.»

— авторы статьи