Дети учат язык, используя в 100 000 раз меньше слов, чем ИИ

Дети учат язык, используя в 100 000 раз меньше слов, чем ИИ

Люди разговаривают друг с другом как минимум 100 000 лет, и всё это время единственным, кто мог освоить человеческий язык в совершенстве, был человеческий ребёнок. Теперь, по формулировке MIT Technology Review, такое существо не одно: спустя всего четыре года после выхода ChatGPT многие уже воспринимают как должное, что можно естественно разговаривать с телефоном или компьютером. Языковые модели вроде Claude, DeepSeek и GPT от OpenAI достаточно бегло и гибко владеют языком, чтобы правдоподобно сходить за человека. Но за этим сходством скрывается серьёзная разница: чтобы научиться пользоваться языком, компьютеру всё ещё нужно нечеловеческое количество данных. По расчётам издания, языковая модель может обработать в 100 000 раз больше слов, чем человек успевает услышать, осваивая родной язык, и куда больше, чем ребёнок слышит вообще к своему первому дню рождения, когда обычно начинает схватывать язык. Это расхождение в статье называют «разрывом в данных» (data efficiency gap).

Масштаб разрыва подтверждают цифры. «Прогресс в последнее время поразительный, говорит когнитивист Стэнфордского университета Майкл Фрэнк о языковых моделях., Но нам всё ещё приходится сжигать лес и соскребать всю сумму человеческих знаний, чтобы воссоздать эту веху, которая в наших гостиных происходит за один год». Модель Llama 3.1 с открытыми весами от Meta, выпущенная два года назад, в ходе предобучения обработала 15 триллионов токенов (словоподобных фрагментов языка). По оценке когнитивиста и лингвиста Джорджтаунского университета Итана Уилкокса, передовые модели, возможно, обучаются на объёме данных в 10 раз большем, чем Llama 3.1, но лёгкодоступного текста в интернете не бесконечно много: по оценке издания, уже к 2030-м годам его запасы могут иссякнуть.

Дети показывают, что учиться меньшим, причём совсем небольшим, объёмом данных в принципе возможно. Ребёнок, выросший в семье с богатой языковой средой, к подростковому возрасту может услышать порядка 100 миллионов слов; если добавить чтение, счёт может дорасти примерно до 300 миллионов слов к 20 годам. Масштаб различия проще всего показать на аналогии: «Claude увидел объём языка, с которым целый город столкнётся за одно поколение», говорит Уилкокс. Если распечатать на бумаге все слова, на которых обучена современная языковая модель, стопка получится выше Международной космической станции. Стопка же из 100 миллионов слов, услышанных ребёнком-подростком, поднимется всего на 20 метров. Разгадав, как это удаётся детям, учёные надеются создать более экономные по данным модели ИИ, например, для обучения на видео или для чат-ботов, обслуживающих небольшие языковые сообщества; заодно проверка этих гипотез на моделях способна закрыть и старые вопросы когнитивной науки, рождаемся ли мы с врождённым языковым инстинктом или ребёнок способен освоить язык исключительно из опыта, и является ли то, как мы обрабатываем язык, особенностью нашей биологии или отражает универсальные ограничения, свойственные любому языку.

Сложность языка большинство из нас замечает, только когда пытается выучить новый язык во взрослом возрасте: сложные времена, раскатистые «р», носовые гласные, родительный падеж, фразовые глаголы, грамматический род у существительных то и дело мучают взрослого ученика. При этом освоение родного языка обычно даётся без усилий: малыши, как правило, начинают строить грамматически правильные предложения, услышав порядка 10 миллионов слов, а на верхней границе, 30 миллионов. «Это просто настоящее чудо, говорит Фрэнк., Если обучить GPT-2 на 30 миллионах слов, получится генератор бессмыслицы, а не ребёнок». Как именно младенцам это удаётся, загадка: синтаксис человеческого языка, правила соединения слов в предложения, включает рекурсивные, вложенные структуры, которые позволяют выразить практически бесконечное число идей конечным набором слов. Ребёнок застаёт лишь мелководье этого океана языка, но каким-то образом ему хватает и такой малой пробы, чтобы восстановить всю глубину.

Один из ответов на этот вопрос предложил в 1950-х лингвист Массачусетского технологического института (MIT) Ноам Хомский: по его мнению, дети рождаются со встроенным знанием грамматики. Хомский спорил с психологом Б. Ф. Скиннером, который считал усвоение языка полностью средовым явлением, язык, по Скиннеру, осваивается через обусловливание и подкрепление, так же как собака учится сидеть или давать лапу за лакомство. Хомский возражал, ссылаясь на «бедность стимула»: язык, особенно синтаксис, слишком сложен, а речь, которую слышат дети, слишком «обеднена», чтобы выучить его исключительно из опыта. «Его коронный довод, по сути, был в том, что язык невозможно освоить исключительно на основе статистики», поясняет лингвист и когнитивист Калифорнийского университета в Ирвайне Ричард Футрелл, описывая аргументацию Хомского. Хомский настаивал, что язык строится на наборе логических правил и что детям нужно врождённое знание этих правил, чтобы вывести грамматику своего языка из обрывков услышанной речи. Этот взгляд десятилетиями господствовал в лингвистике США под именем «порождающая грамматика» и заметно повлиял на информатику 1950, 60-х годов, когда ИИ переживал первый бум, а границы между лингвистикой и обработкой естественного языка стирались на фоне обильного военного финансирования, Пентагону нужны были компьютеры, понимающие английский и переводящие с русского. Несмотря на ранние успехи простых нейросетей, которые учились распознавать и воспроизводить статистические закономерности, американские исследователи ИИ под влиянием идей Хомского в основном пошли по пути, основанному на явных правилах: они пытались обучить компьютеры языку, закладывая правила прямо в программы, это было больше похоже на урок грамматики, чем на погружение в языковую среду. Такой подход, часть более широкого течения символьного ИИ, господствовал десятилетиями, но так и не дал моделей, способных по-настоящему работать с человеческим языком в большом масштабе. Интерес к обработке естественного языка охладел в «зиме ИИ», начавшейся в 1970-х.

Затем нейросети начали возвращаться, но лишь в 2010-х, когда компьютерное оборудование подешевело и стало мощнее, а интернет разросся, их результаты начали привлекать внимание. К 2018, 2019 годам модели BERT и GPT-2, построенные на новой архитектуре, трансформере, и обученные на миллиардах токенов, дали специалистам понять: обучение на огромном массиве данных способно работать и для языка. А в 2022 году, после прорывного успеха чат-бота ChatGPT от OpenAI, это стало ясно уже всем. Языковые модели, не мозг: это мощные статистические системы обучения, распознающие закономерности, без каких-либо эволюционных особенностей, встроенных в человеческую кору мозга. Иными словами, это ровно то, что генеративный лингвист двадцать лет назад счёл бы неспособным освоить язык, и тем не менее вот они, пишут правдоподобные сонеты и сдают тесты по грамматике. «Как бы скептично вы ни относились к ИИ, есть то, что по-настоящему впечатлило всех: эти системы усваивают синтаксис, говорит психолог развития из Калифорнийского университета в Беркли Элисон Гопник., Я не думала, что это окажется правдой. И, думаю, большинство не думало, что можно просто посмотреть на статистику большого массива языка и вывести из неё грамматику».

А что насчёт обучения на маленькой, «детского» размера выборке языка? Алекс Уорстадт, лингвист и специалист по данным из Калифорнийского университета в Сан-Диего, вспоминает годы выхода BERT и GPT-2 как горячее время: в 2019 году он ещё учился в аспирантуре по лингвистике в Нью-Йоркском университете и наблюдал, как на его глазах меняется вся область. Сам факт, что языковые модели способны выучить английский, перемалывая тексты, бросал вызов хомскианским идеям, но многие лингвисты по-прежнему сомневались, что языковые модели способны что-либо рассказать о том, как язык осваивают люди. «Мне вечно возражали по одному конкретному поводу, по размеру обучающих выборок модели, говорит Уорстадт., Никогда не было такого, чтобы языковые модели обучали в человеческом масштабе и это кого-то впечатляло». Но Уорстадт видел в языковых моделях потенциал: научная модель не обязана быть идеальной, чтобы быть полезной, а языковые модели явно были мощной симуляцией того, как люди используют язык. В августе 2022 года Уорстадт опубликовал тред в Twitter с аргументом, что нейросети могут быть полезной моделью для изучения освоения языка; после обсуждения в комментариях с исследователем ИИ Лешемом Хошеном родилась идея, из которой вырос BabyLM, ежегодный конкурс, который Уорстадт, Хошен и ещё несколько исследователей организуют для обучения моделей на маленьких массивах данных.

С тех пор прошло четыре года. За это время у BabyLM появились сопутствующие семинары, а конкурс вдохновил похожие проекты, например, аналогичное соревнование для моделей, обучаемых на китайском языке. Основной трек конкурса предлагает обучить языковую модель на «правдоподобном с точки зрения детского развития» корпусе всего в 100 миллионов слов (а для трека «уровня малыша», 10 миллионов), составленном из детских книжек, диалогов, субтитров к фильмам, «Простой английской Википедии», обычной Википедии и реальных расшифровок речи, обращённой к детям. Готовые модели проверяют теми же грамматическими тестами, что психолингвисты используют с людьми, рассказывает Уилкокс, один из организаторов конкурса. Один из типов тестов предлагает испытуемым, людям или машинам, предложения и смотрит, не возникает ли у них замешательства при неграмматичных конструкциях: например, тест может сравнить «The keys to the cabinet are on the table» (ключи от шкафа, на столе, с верной формой глагола) и ту же фразу с ошибочной формой «is» вместо «are». «Когда люди видят is, они как бы: что? тут не должно быть is», поясняет Уилкокс. У человека такое удивление можно отследить по движению глаз; для языковых моделей исследователи используют метрику под названием surprisal («неожиданность»), она показывает, насколько маловероятным модель считает предложение или его часть.

Конкурс уже поставил под сомнение некоторые расхожие допущения, например, об эффективности «обучения по нарастающей сложности» (curriculum learning), при котором модель сперва получает простые данные и лишь потом переходит к более сложным, что-то вроде того, чтобы начать с сюсюканья и постепенно наращивать сложность речи. По словам Уорстадта, именно этот подход был самым популярным среди участников в первом раунде BabyLM, но сработал он хуже, чем ожидалось; статья не раскрывает, почему.

Ключевые факты

  • Языковая модель обрабатывает примерно в 100 000 раз больше слов, чем нужно человеку для освоения родного языка; модель Llama 3.1 с открытыми весами от Meta обучена на 15 триллионах токенов, а передовые модели, по оценке когнитивиста Итана Уилкокса, возможно, используют данных ещё в 10 раз больше.
  • Ребёнок в языково богатой семье к подростковому возрасту слышит порядка 100 миллионов слов (до 300 миллионов, к 20 годам, с учётом чтения); для первых грамматически правильных предложений малышам обычно хватает 10, 30 миллионов слов, тогда как GPT-2, обученная на 30 миллионах слов, по словам когнитивиста Майкла Фрэнка, выдаёт лишь бессмыслицу.
  • Спор восходит к 1950-м: лингвист MIT Ноам Хомский настаивал на врождённом знании грамматики («бедность стимула»), психолог Б. Ф. Скиннер, на чисто средовом обучении через подкрепление; статистическое обучение взяло верх после успеха BERT, GPT-2 (2018, 2019) и ChatGPT (2022).
  • В августе 2022 года лингвист Алекс Уорстадт вместе с исследователем ИИ Лешемом Хошеном положил начало ежегодному конкурсу BabyLM: модели обучают на корпусе из книжек, диалогов, субтитров и Википедии объёмом 100 миллионов слов (10 миллионов, в «малышовом» треке), затем проверяют теми же грамматическими тестами, что применяют к людям.
  • Первые раунды BabyLM поставили под сомнение «обучение по нарастающей сложности» (curriculum learning), самый популярный у участников подход в итоге сработал хуже, чем ожидалось.

Почему это важно

Материал MIT Technology Review формулирует вопрос иначе, чем принято в индустрии ИИ, не «насколько велика модель», а «почему ребёнку хватает так мало данных». По расчётам издания, языковая модель обрабатывает примерно в 100 000 раз больше слов, чем требуется человеку для освоения родного языка: модель Llama 3.1 с открытыми весами от Meta обучена на 15 триллионах токенов, а передовые модели, по оценке когнитивиста Итана Уилкокса, возможно, используют данных ещё в 10 раз больше. У вопроса есть практическая сторона: лёгкодоступный текст в интернете не бесконечен, и, по оценке издания, уже к 2030-м годам его запасы могут иссякнуть, то есть дальнейший рост языковых моделей может упереться не в вычислительные мощности, а именно в нехватку данных. Одновременно вопрос затрагивает старый спор когнитивной науки, рождается ли человек с врождённым знанием грамматики (аргумент Ноама Хомского) или язык можно освоить целиком из опыта (позиция в духе Б. Ф. Скиннера), и конкурс BabyLM, где модели специально обучают на «детском» объёме данных, впервые даёт способ проверять эти гипотезы не только на людях, но и на машинах.

Кому это важно

Когнитивным учёным и лингвистам, материал напрямую касается многолетнего спора о врождённости языка и даёт новый инструмент для его проверки: конкурс BabyLM, где гипотезы об усвоении языка можно закладывать прямо в модель и тестировать теми же грамматическими задачами, что применяют к детям. Разработчикам ИИ, «разрыв в данных» напрямую связан с пределом роста языковых моделей: если лёгкодоступный текст в интернете закончится к 2030-м, преимущество получат те, кто научится обучать модели данными эффективнее, с прицелом, среди прочего, на обучение на видео и на чат-ботов для языков с ограниченным объёмом текста в сети. Читателям, которые следят за спором о том, «понимают» ли языковые модели язык или просто имитируют его, материал даёт содержательный аргумент от нескольких независимых учёных: языковые модели действительно усваивают синтаксис (это признаёт даже скептически настроенная Элисон Гопник), но делают это статистически и совершенно не так экономно, как ребёнок.

Как это применить

Прямого продукта или сервиса материал не описывает, это разбор научной проблемы, но у него есть измеримая структура. Конкурс BabyLM ежегодно предлагает исследователям обучить языковую модель на корпусе из детских книжек, диалогов, субтитров, «Простой английской Википедии», обычной Википедии и расшифровок реальной речи, обращённой к детям, 100 миллионов слов в основном треке и 10 миллионов в «малышовом» треке (для сравнения: GPT-2, обученная на 30 миллионах слов, по словам когнитивиста Майкла Фрэнка, выдаёт лишь бессмыслицу). Готовые модели проверяют тестами на грамматичность, например, ловят ли они ошибку согласования вроде «ключи от шкафа находится на столе», и метрикой surprisal («неожиданность»), которая показывает, насколько предложение неожиданно для модели. Практический вывод, который формулирует статья: реверс-инжиниринг детского способа учить язык может подсказать, как обучать модели эффективнее по данным, для работы с видео и для чат-ботов, обслуживающих языки с малым объёмом текста в интернете.

Можно ли доверять

Источник, MIT Technology Review, авторитетное научно-техническое издание, а не корпоративный релиз или блог одной компании. Материал построен на прямых цитатах нескольких независимых учёных с именем и институциональной принадлежностью, Стэнфорд, Джорджтаун, Калифорнийские университеты в Ирвайне, Беркли и Сан-Диего, что снижает риск одностороннего изложения. При этом часть цифр в статье, сознательно приблизительные оценки, а не точные измерения: издание пишет «порядка 100 миллионов слов», «может дорасти примерно до 300 миллионов», а оценку в 10 раз больше данных у передовых моделей приводит как личное мнение одного учёного, Итана Уилкокса, а не как измерение или консенсус индустрии. Материал, научно-популярный разбор, который сводит воедино результаты разных научных школ, а не отчёт о новом отдельном эксперименте.

Риски и подводные камни

Главный риск, принять открытый научный вопрос за решённый: статья прямо говорит, что учёные до сих пор не знают, почему детям хватает так мало данных, и приводит две конкурирующие, не примирённые до конца позиции, врождённую грамматику Хомского и средовое обучение в духе Скиннера, не отдавая явного предпочтения ни одной. Даже целенаправленная попытка воспроизвести детское обучение, конкурс BabyLM, пока даёт неоднозначные результаты: самый популярный в первом раунде подход, «обучение по нарастающей сложности», сработал хуже, чем рассчитывали организаторы, а почему, статья не раскрывает. Сама метафора «дети против ИИ» может вводить в заблуждение: языковые модели, по формулировке материала, не мозг, а статистические системы без биологических особенностей человеческого мышления, так что совпадение или различие в объёме данных не обязательно говорит о сравнимости самих механизмов обучения. Наконец, часть чисел в статье, заведомые оценки («порядка», «может быть»), и делать из них точные далеко идущие выводы не стоит.

«Это просто настоящее чудо. Если обучить GPT-2 на 30 миллионах слов, получится генератор бессмыслицы, а не ребёнок.»

— Майкл Фрэнк, когнитивист, Стэнфордский университет

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.