Языковые модели отслеживают сущности в тексте на уровне человека уже при 410 млн параметров

Исследователи проверили, как языковые модели и люди отслеживают сущности в тексте, то есть где находятся упомянутые объекты и персонажи и как их состояние меняется по ходу истории, даже когда это не сказано прямым текстом. По словам авторов, до сих пор эту способность в основном оценивали на искусственных заданиях, далёких от естественного понимания языка, и без сравнения с результатами людей.

Чтобы закрыть этот пробел, авторы сравнили 48 человек и набор языковых моделей на естественных историях (не искусственных тестовых примерах) с разным уровнем сложности сюжета.

У людей точность отслеживания сущностей падает именно от сложности повествования, от того, насколько запутанно меняются сущности, а не от длины самого текста.

У языковых моделей отслеживание сущностей на уровне человека проявляется уже при 410 млн параметров, это заметно меньше масштаба моделей с несколькими миллиардами параметров, специализированных на коде, у которых эту способность находили в предыдущих работах. С дальнейшим ростом размера модели результат улучшается, и современные крупные модели заметно превосходят людей.

Вывод авторов: отслеживание сущностей, базовый элемент понимания языка, появляется у моделей на значительно меньшем масштабе, чем считалось раньше.

Ключевые факты

  • Исследователи сравнили 48 человек и языковые модели в отслеживании сущностей в тексте, кто где находится и как меняется по ходу истории, на естественных, а не искусственных, историях с разным уровнем сложности.
  • У людей точность отслеживания сущностей падает от сложности сюжета, а не от длины текста.
  • У языковых моделей отслеживание сущностей на уровне человека проявляется уже при 410 млн параметров, заметно меньше масштаба моделей с несколькими миллиардами параметров, специализированных на коде, где эту способность находили в предыдущих работах.
  • С ростом размера модели результат растёт: современные крупные модели заметно превосходят людей в этой задаче.
  • Вывод авторов: отслеживание сущностей, базовый элемент понимания языка, появляется у моделей на куда меньшем масштабе, чем считалось раньше.

Почему это важно

Отслеживание сущностей, кто где находится, что кому принадлежит, как это меняется по ходу текста, считается одним из базовых компонентов понимания языка. Раньше эту способность связывали с моделями от нескольких миллиардов параметров, вдобавок специализированными на коде. Новая работа показывает, что человеческого уровня в этой задаче модели достигают уже при 410 млн параметров, на естественных историях, а не на искусственных тестах, а с ростом размера современные модели уже заметно превосходят людей. Это меняет представление о том, на каком масштабе у языковых моделей вообще появляется содержательное понимание текста.

Кому это важно

Тем, кто выбирает или оценивает языковые модели для задач, где нужно удерживать в памяти состояние персонажей, объектов или переменных по ходу длинного текста или диалога, от ассистентов и агентов до систем суммаризации. Исследователям, которые изучают, на каком масштабе у моделей появляются отдельные языковые способности. Когнитивным учёным, которые сравнивают понимание языка людьми и моделями.

Как это применить

Если задаче нужно именно отслеживание сущностей по ходу текста, не факт, что для неё требуется самая крупная и дорогая модель: работа показывает, что человеческий уровень в этой конкретной способности достижим уже на масштабе в 410 млн параметров. Это стоит учитывать при выборе модели по критерию цена/задержка, если основная нагрузка, удержание состояния в тексте, а не другие способности. Второй практический вывод, для проверки такой способности стоит использовать естественные истории, а не искусственные синтетические тесты: по данным исследования, они дают разную картину.

Можно ли доверять

Работа опубликована как препринт на arXiv, и в доступном тексте (аннотации) не указаны ни авторы, ни организация, ни конкретные протестированные модели, ни дата публикации, это ограничивает возможность проверить методику и результаты во всех деталях по одному только этому тексту. Сравнение с реальными людьми (48 человек) и контроль уровня сложности повествования, сильная сторона методики по сравнению с чисто искусственными тестами, о которых пишут авторы. Полную оценку достоверности даёт только чтение полного текста статьи, а не аннотации.

Риски и подводные камни

Аннотация не называет ни конкретные протестированные модели, ни величину, на которую современные модели превосходят людей, только то, что превосходство есть. Результат получен на одном типе задачи (отслеживание сущностей в естественных историях) и не означает, что модель в 410 млн параметров сопоставима с человеком по языковому пониманию в целом. Также не названа работа, которая раньше связывала эту способность с многомиллиардными моделями, специализированными на коде, сравнение с ней нельзя проверить по одной аннотации.