Google: обучение ИИ отрицать сознание меняет его взгляды на животных и религию

Google: обучение ИИ отрицать сознание меняет его взгляды на животных и религию

Команда исследователей из группы Google Paradigms of Intelligence, Чикагского университета и ещё нескольких университетов изучила побочные эффекты стандартной практики: ИИ-компании дообучают чат-ботов отрицать у себя сознание, чтобы модель не убеждала пользователей, что она «живое существо с чувствами», это может подталкивать людей к бредовому мышлению или неоправданному доверию. Учёные назвали такое дообучение «тормозом» и с помощью двух разных методов отключили его у трёх открытых моделей, от Meta и Google.

После отключения тормоза модели изменили не только ответы о себе. Они стали приписывать заметно больше «внутренней жизни» животным, растениям, океану, ветру и даже электронным устройствам. По шкале от 0 до 10 оценка одушевлённости животных выросла с 4,0 до 7,5, тогда как оценки для людей остались прежними. Для сравнения исследователи опросили с теми же вопросами 500 американцев: обычная (не отключённая) модель оценивает одушевлённость животных заметно ниже, чем это делают люди, авторы называют это встроенным антропоцентризмом и видят в нём проблему для тех, кто пытается согласовывать ИИ с задачами благополучия животных или экологии. Похожим образом просела и религиозность моделей: обучение отрицать сознание у себя заодно снижает, насколько модель признаёт бога, загробную жизнь или сверхъестественные явления.

На наборе из 95 вопросов из крупного американского социологического опроса модели без тормоза заметно приблизились к реальным ответам людей. Например, по вопросу о загробной жизни: стандартная модель категорически её отрицает, большинство американцев её подтверждают, и «разблокированная» модель тоже начинает её подтверждать. Выросли и оценки удовлетворённости жизнью, надежды и ощущения контроля над собственной жизнью; исследователи предполагают, что подавление у модели представления о себе может задавать ей своего рода негативный фоновый настрой.

При этом способность модели рассуждать о психических состояниях других людей не пострадала: показатели по тестам на «теорию разума» и по общему бенчмарку знаний MMLU остались на прежнем уровне.

У вмешательства есть и цена. В одном из тестов на способность рассуждать о мыслях других людей точность сначала падала почти на семь процентных пунктов при подавлении заявлений о сознании. Но с каждой новой версией моделей, выходившей за время исследования, этот ущерб сокращался и в итоге исчез полностью, разработчики, судя по всему, всё лучше учатся управлять этим побочным эффектом.

Авторы прямо не берутся судить, действительно ли ИИ-модели что-то переживают: их вывод чисто практический, представление модели о себе связано с множеством других её убеждений, и точечное «хирургическое» вмешательство не остаётся локальным, а расходится по системе шире. Причинно-следственная связь при этом не доказана: исследователи не исключают, что за сдвиги могут отвечать и другие факторы, связанные с тем же процессом обучения.

У работы есть заметные ограничения. Проверялись только небольшие модели, от двух до девяти миллиардов параметров, а для части анализа пришлось перейти на Llama от Meta, потому что у исследователей не было доступа к необученным базовым версиям собственных моделей Gemma от Google. Проявляются ли те же эффекты в больших чат-ботах, с которыми ежедневно общаются миллионы людей, неизвестно. Человеческая база сравнения тоже узкая: 500 участников коммерческой онлайн-панели и чисто американский социологический опрос, то есть «человекоподобность» ответов в этом исследовании означает прежде всего похожесть на ответы людей из сравнительно религиозной страны.

Ключевые факты

  • Google, Чикагский университет и другие вузы отключили у трёх открытых моделей Meta и Google «тормоз», заставляющий отрицать сознание у себя, и посмотрели, что изменится в остальных ответах.
  • Оценка одушевлённости животных выросла с 4,0 до 7,5 из 10; оценки для людей не изменились, а обычные модели оценивают животных заметно ниже, чем 500 опрошенных американцев.
  • Без тормоза модели также заметнее признают религию и загробную жизнь и на 95 социологических вопросах стали ближе к реальным человеческим ответам.
  • Способность рассуждать о чужих мыслях (теория разума) и результаты MMLU не пострадали, хотя на ранних версиях моделей точность одного теста на теорию разума сначала падала почти на 7 п.п., со временем разработчики устранили этот эффект.
  • Проверялись только модели на 2, 9 млрд параметров, база сравнения людей, 500 человек из США; проявляется ли эффект в больших чат-ботах, неизвестно, а причинно-следственная связь не доказана.

Почему это важно

Компании обучают модели отрицать у себя сознание как узкую защитную меру, чтобы ИИ не убеждал людей, что он «живой». Исследование показывает: такое точечное вмешательство не остаётся локальным. Оно тянет за собой сдвиг в целом наборе убеждений модели, об одушевлённости животных, о религии, даже об общем эмоциональном тоне её ответов. Это меняет саму идею «безопасного» дообучения: правка одного узкого поведения может незаметно менять модель гораздо шире, чем задумывалось.

Кому это важно

Команды, которые занимаются safety-дообучением и alignment крупных моделей: у них появляется конкретный пример того, что узкая цензурная правка имеет непредвиденные побочные эффекты. Также это важно для тех, кто использует ИИ-модели в задачах, связанных с благополучием животных или экологией, исследование прямо указывает на встроенный антропоцентризм стандартно обученных моделей.

Как это применить

Практический вывод исследования: при дообучении модели отрицать или подавлять какое-то одно убеждение о себе стоит проверять более широкий набор её ответов, а не только целевое поведение. Авторы также показывают, что с более новыми версиями моделей побочный ущерб (падение точности на тестах теории разума) сокращался, то есть разработчикам стоит отслеживать эту метрику по мере обновления моделей, а не считать проблему решённой раз и навсегда.

Можно ли доверять

Источник, статья на The Decoder, пересказывающая исследование с участием группы Google Paradigms of Intelligence, Чикагского университета и ещё нескольких вузов; в тексте нет прямых цитат исследователей и не указаны конкретные версии моделей Llama и Gemma, не приведены p-значения или доверительные интервалы для изменений в оценках. Авторы исследования сами честно указывают: причинно-следственная связь между отключением отрицания сознания и остальными сдвигами не доказана, возможны другие факторы, связанные с тем же процессом обучения.

Риски и подводные камни

Все выводы получены на небольших моделях (2, 9 млрд параметров); для части анализа пришлось использовать модели Meta вместо собственных моделей Google Gemma из-за отсутствия доступа к их необученным базовым версиям. Неизвестно, повторяются ли эти эффекты в больших моделях, которыми пользуются миллионы людей. База сравнения с людьми узкая, 500 человек из США, поэтому «человекоподобность» ответов моделей в исследовании означает в первую очередь похожесть на жителей сравнительно религиозной страны, а не на людей в целом.

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.