Исследование: доступ к ИИ почти отбивает у людей желание сказать «не знаю»

Исследование: доступ к ИИ почти отбивает у людей желание сказать «не знаю»

Учёные провели пять экспериментов с участием 3132 человек, чтобы проверить, как доступ к языковой модели влияет на готовность людей признавать неуверенность. Для теста намеренно выбрали модель Step 3.5 Flash и вопросы, на которых она почти всегда ошибалась, о мелких визуальных деталях фильмов, например о цвете формы команды в фильме «Играй, как Бекхэм». По словам авторов, такие детали редко встречаются в текстах в интернете, поэтому именно на них модели чаще всего галлюцинируют. Другие модели, GPT-5.5, Claude 4.6 Sonnet и Gemini 3.5 Flash, верно отвечали на большинство остальных вопросов, но тоже ошибались на самых сложных.

В первых двух экспериментах (1a и 1b) участники сами решали, спрашивать ли совета у ИИ. Без доступа к нейросети они воздерживались от ответа в 36% и 44% случаев; с доступом к ИИ доля таких отказов упала до 6% и 3%. В третьем эксперименте измерили уверенность участников: без финансовых стимулов уверенность при наличии ИИ достигала 75,9 балла из 100 против 29,6 балла без ИИ, примерно в два с половиной раза выше. При этом доля правильных ответов упала с 27,6% до 10,0%: люди были куда увереннее, но куда чаще ошибались. По всем экспериментам без стимулов участники с доступом к ИИ давали верный ответ лишь в 9,2% случаев против 27,5% без ИИ.

В экспериментах 2, 4 добавили денежные стимулы: 10 центов за правильный ответ, минус 10 центов за неправильный и ноль за «не знаю». Исследователи заранее предполагали, что стимулы усилят готовность воздерживаться от ответа, а доступ к ИИ будет этот эффект ослаблять, но ни в одном из трёх экспериментов статистически значимого взаимодействия между стимулами и доступом к ИИ не нашли. Стимулы просто снижали число обращений к ИИ (4,53 против 5,27 из шести возможных в третьем эксперименте) и немного повышали точность ответов при наличии ИИ.

В четвёртом эксперименте ответ модели показывали автоматически, без запроса, по аналогии с тем, как поисковики сейчас сами выводят ИИ-сводки. Эффект почти не изменился: без стимулов доля отказов от ответа упала с 35% до 1%, со стимулами, примерно с 39% до 7%.

Авторы описывают находку через концепцию «эпистемии», склонности принимать ответы ИИ, потому что они звучат убедительно, а не потому что их проверили. Языковая модель всегда выдаёт какой-то ответ и никогда не «замолкает», даже не зная ответа, и, по мнению авторов, передавая ей суждение, люди перенимают эту же неспособность остановиться. Это противоречит прежним данным об использовании чужих советов: обычно люди учитывают лишь около трети позиции советчика, а здесь произошло обратное. Исследователи также заключают, что доступ к ИИ превратил часть верных ответов участников в ошибочные: в условиях без стимулов группа с ИИ отвечала на больше вопросов, но давала меньше правильных ответов, чем контрольная группа.

Авторы связывают находку с другими работами о влиянии ИИ на мышление. В отдельном исследовании Swiss Business School с 666 участниками обнаружена сильная отрицательная связь между использованием ИИ и критическим мышлением: чем больше люди доверяют ИИ, тем чаще перекладывают на него мыслительные задачи, что ещё сильнее ослабляет критическое мышление. Другие эксперименты показали, что уже 10, 15 минут работы с ИИ-ассистентом заметно снижают способность решать задачи и настойчивость в последующих задачах без ИИ, тогда как использование ИИ только для объяснений не давало такого эффекта. Исследование Microsoft, в свою очередь, показало, что использование ИИ предъявляет высокие требования к метакогниции, способности отслеживать и направлять собственное мышление, и что более высокий уровень образования выступает защитным фактором.

Ключевые факты

  • Пять экспериментов с 3132 участниками: доступ к языковой модели резко снижает готовность людей признавать неуверенность
  • Модель для теста подобрали намеренно ошибающуюся (Step 3.5 Flash на мелких деталях фильмов); отказ от ответа упал с 36, 44% до 3, 6%
  • Уверенность при наличии ИИ выросла в 2,5 раза (с 29,6 до 75,9 балла из 100), а доля правильных ответов упала с 27,6% до 10,0%
  • Денежные стимулы (10 центов за верный ответ) снижали число обращений к ИИ, но не устраняли эффект избыточной уверенности
  • Даже при автоматическом показе ответа ИИ без запроса эффект сохранялся: отказ от ответа падал с 35% до 1%

Почему это важно

Исследование впервые в контролируемых условиях и на большой выборке показывает системный эффект: сам факт доступа к ИИ, а не его правильность, меняет поведение людей, они почти перестают признавать неуверенность, даже когда модель ошибается чаще, чем угадывает. Это важно для понимания рисков массового внедрения ИИ-подсказок в поиск, письмо и принятие решений.

Кому это важно

Разработчикам продуктов с ИИ-подсказками (поисковики, ассистенты, редакторы), исследователям человеко-машинного взаимодействия, а также специалистам в областях, где цена ошибки высока, образовании, медицине, юриспруденции, где излишняя уверенность пользователя, подпитанная ИИ, может привести к неверным решениям.

Как это применить

Если разрабатывается интерфейс с ИИ-советами, стоит закладывать явные механизмы, поощряющие пользователя проверять ответ и признавать неуверенность, а не полагаться на то, что финансовые стимулы или образование сами решат проблему: в исследовании ни то ни другое эффект полностью не устранило.

Можно ли доверять

Это крупное контролируемое исследование (5 экспериментов, свыше 3 тысяч участников, часть с денежными стимулами и пред-регистрацией гипотез), но в источнике не указаны авторы, дата публикации, журнал или организация, проводившая работу, что не позволяет проверить её напрямую. Эффект показан только на вопросах о мелких деталях фильмов; распространяется ли он на другие темы, открытый вопрос, который признают и сами исследователи.

Риски и подводные камни

Главный риск, что готовность людей говорить «не знаю» окажется одной из первых жертв повсеместного распространения ИИ-ответов, особенно там, где они появляются без запроса (как в поисковых сводках). Денежные стимулы и статус образования смягчают, но не устраняют эффект, а причины, по которым более крупные или репутационные стимулы могли бы сработать иначе, в исследовании не выяснены.

«Доступ к ИИ превратил часть ответов, которые были бы правильными, в ошибочные.»

— авторы исследования