Слепота к багам: почему люди не замечают очевидные проблемы в продуктах, которые любят

Технический блогер, автор эссе «Bug Blindness» на сайте danluu.com, рассказывает: он давно заметил, что видит на порядки больше багов и явных недостатков в продуктах и сервисах, чем большинство людей вокруг, по его оценке, сотни, а то и тысячи багов в неделю. Долгое время он думал, что дело в особенностях его собственного взаимодействия с компьютером, но со временем пришёл к выводу: остальные люди сталкиваются ровно с теми же багами, просто не обращают на них внимания. Для обычного пользователя, считает автор, не замечать баги, возможно, и лучший способ жить, но для программиста умение видеть подобные проблемы полезно; он сам не раз помогал друзьям и знакомым развить эту способность, просто указывая им на конкретные баги, и через несколько недель люди, склонные к этому, начинали замечать баги самостоятельно.

Из-за этой особенности его периодически зовут директора, вице-президенты и другие руководители компаний, чтобы получить непредвзятое мнение от человека, который действительно способен заметить проблему (и, если нужно, исправить её или добиться исправления). Иногда он не находит ничего серьёзного, видимо, есть баги, которые не попадают в поле его внимания. Чаще находит нечто «от лёгкого до умеренного», а иногда, по-настоящему серьёзные изъяны, вплоть до того, что продукт, по сути, не работает. Именно эту последнюю категорию автор называет загадочной: он видел немало случаев, когда внутренняя переписка вокруг продукта полна уверений «всё отлично, всё работает», а на практике продукт запускается только через набор неочевидных обходных путей, и обычный пользователь либо вообще не сможет им воспользоваться, либо получит настолько плохой опыт, что расскажет об этом друзьям. Долгое время автор сомневался, не провоцирует ли он сам странное поведение продукта необычными действиями, но, по его словам, всё больше случаев, когда продукт с треском проваливается на рынке именно из-за тех проблем, которые он предсказывал заранее, убедили его в обратном. Сейчас он использует ещё один способ проверки: заставляет большие языковые модели (LLM) вести себя как обычные пользователи в разных сценариях, и подтверждает, что найденные проблемы воспроизводятся снова и снова.

Один из примеров, веб-поиск. Ранее автор публиковал результаты собственных поисковых запросов и показал, что Google, Bing и Kagi одинаково плохо справляются с частью запросов: страницы результатов забиты низкокачественным SEO-спамом, а среди них попадаются откровенно мошеннические сайты. По его собственной шкале это «умеренная», а не «серьёзная» проблема, «серьёзная» означала бы, например, что поисковик в половине случаев отдаёт ошибку 500 или что большинство результатов, мошенничество, то есть обычный пользователь вообще не может пользоваться сервисом, а не просто получает неприятный опыт. Претензии к оценке Google и Bing почти никто не оспаривал, а вот про Kagi ему стали писать, что он неправ, и присылать свои собственные результаты поиска как доказательство. Но, по словам автора, ни в одном из присланных случаев поиск не показал хорошего результата, например, по сезонному прогнозу погоды поиск не смог найти актуальный прогноз, и выдача снова была забита SEO-спамом. Единственное исключение, пользователь, который закрепил GitHub в топе своих результатов; это помогало только с запросами про скачивание софта, размещённого на GitHub, и совершенно не работало для остальных запросов из его исходного поста.

Похожая картина, по мнению автора, наблюдается на форумах владельцев Volvo. Сам он купил Volvo, увидев её результаты в независимых краш-тестах, и с тех пор иногда ищет ответы на свои вопросы на профильных форумах. По его словам, данные о надёжности, которые, как он считает, подтверждаются и опытом автомехаников, обслуживающих Volvo, уже больше десяти лет показывают, что надёжность марки посредственная или низкая. Но форумы владельцев полны сообщений в духе «Volvo, одна из самых надёжных марок, а статистика просто врёт».

Ещё один пример, университетская платформа для управления курсами Blackboard. Пока она была основным инструментом такого рода в вузах, её массово не любили и студенты, и преподаватели; по данным статьи в Википедии о компании, Blackboard стала «одной из наиболее нелюбимых, вплоть до ненависти, компаний в сфере образования», а в декабре 2011 года издание Fast Company сообщило, что 93% участников опроса потребительских мнений Amplicate заявили, что «ненавидят» компанию. Тем не менее, когда автор, будучи моложе, спросил у случайно встреченного сотрудника Blackboard что-то вроде «каково это, работать над софтом, который столько людей терпеть не может», собеседник не обиделся, но искренне растерялся: он был уверен, что софт, наоборот, широко и заслуженно любят пользователи.

Схожий случай, форумный движок Discourse: сотрудники компании, по словам автора, были убеждены, что производительность их сайтов на его основе отличная. Но автор обнаружил, что в коде Discourse была специальная логика, которая намеренно замедляла реальную загрузку страниц ради того, чтобы обмануть показатель LCP (Largest Contentful Paint, метрика скорости загрузки веб-страниц), то есть речь шла не просто о «подгонке под бенчмарк», а о прямом обмане метрики, который не давал пользователю никакой пользы, а только ухудшал реальный опыт.

В качестве примера вне разработки ПО автор приводит баскетболиста, которого болельщики субъективно считают самым «грязным» игроком своей эпохи: НБА официально не ведёт статистику «грязной игры», но, по мнению автора, этот игрок наверняка держит неофициальный рекорд XXI века по числу ударов соперникам в пах, с поправкой на эпоху рекорд, по мнению автора, должен быть за ним, а вот абсолютный рекорд без поправки, возможно, и не за ним, из-за игроков 1980-х и 1990-х, когда игра в целом была грубее. Фанаты его команды, по наблюдению автора, отшучиваются словосочетаниями вроде «естественное движение при подборе» или «естественное движение при броске», оправдывая эти эпизоды. Из этого автор делает более общий вывод: в среднем люди склонны в упор не замечать недостатки того, чем они восхищаются, включая, и особенно, собственную работу или работу своей компании. Себя автор не считает полностью свободным от слепых пятен, но полагает, что менее подвержен именно этому конкретному искажению, чем большинство: он специально ищет людей, способных найти изъяны в его рассуждениях, и в целом считает, что почти всё, что он делал, полно серьёзных недостатков.

В разделе «Привычные компенсации» автор вспоминает случай из детства: друг, попытавшись воспользоваться его компьютером, не смог управлять курсором мыши, потому что движения казались почти случайными, а сам автор пользовался той же мышью без проблем. Оказалось, что грязь, скопившаяся внутри механического шарика мыши, заставляла курсор дёргаться, и он сам, не замечая этого, годами компенсировал это резкими, «дёргаными» движениями руки. Этот случай заставляет автора регулярно задумываться, не совершает ли он подобные неосознанные компенсации и сегодня, применительно к другим вещам. Доступный для пересказа фрагмент эссе обрывается на полуслове в начале описания следующей такой компенсации (при открытии нового документа Google Docs), поэтому дальнейшие примеры и итоговый вывод автора в этот пересказ не вошли.

Ключевые факты

  • Автор эссе на danluu.com утверждает, что лично замечает «сотни, а то и тысячи» багов в неделю, по его наблюдению, почти все остальные люди сталкиваются с теми же багами, но просто не обращают внимания.
  • Из-за этой особенности его периодически приглашают директора и вице-президенты компаний оценить продукт со стороны; находки варьируются от «ничего серьёзного» до случаев, когда продукт, по сути, не работает без набора неочевидных обходных путей.
  • На примере поиска Google, Bing и Kagi автор показывает, что все три сервиса выдают результаты, забитые SEO-спамом и мошенническими сайтами; когда пользователи Kagi присылали ему свои реальные поисковые выдачи как доказательство обратного, хорошего результата не нашлось ни в одном случае.
  • Форумы владельцев Volvo, по словам автора, годами отрицают данные о посредственной надёжности марки; сотрудник Blackboard был искренне удивлён, узнав, что софт массово ненавидят, по данным Fast Company (декабрь 2011 года), 93% участников опроса Amplicate заявили, что «ненавидят» компанию; а форумный движок Discourse, как утверждает автор, содержал код, специально замедлявший загрузку страниц ради обмана метрики LCP.
  • Общий вывод автора: люди в среднем не замечают недостатков того, чем восхищаются, включая собственную работу; себя он считает менее подверженным этой слепоте, поскольку сознательно ищет критику своих текстов.

Почему это важно

Эссе описывает механизм, из-за которого откровенно сломанные продукты и сервисы могут годами существовать без исправлений: люди, которые их используют, делают или защищают, фанаты, сотрудники компании, участники профильных форумов, искренне не замечают тех же самых проблем, которые сразу видит сторонний наблюдатель. Автор показывает, что внутренние заверения «всё работает отлично» и хвалебные отзывы фан-сообщества сами по себе не доказывают качество продукта: за ними может стоять не обман, а настоящая психологическая слепота к недостаткам.

Кому это важно

Тем, кто оценивает чужой продукт со стороны, разработчикам, консультантам, менеджерам, которых просят дать непредвзятое мнение о софте или сервисе компании; руководителям, которые полагаются на внутренние отчёты «всё в порядке»; и просто читателям, которые доверяют форумным «единодушным» оценкам продукта или марки, от поисковиков до автомобилей.

Как это применить

Автор советует не принимать всеобщую похвалу продукту (внутри компании или на фанатском форуме) за доказательство его качества и специально искать свежий, незамутнённый взгляд со стороны, в том числе используя LLM, которые имитируют поведение обычного пользователя в разных сценариях, чтобы проверить, воспроизводится ли найденная проблема. Он также предлагает чёткую шкалу серьёзности: «умеренная» проблема, это плохой опыт, а «серьёзная», это когда обычный пользователь в принципе не может пользоваться продуктом; и советует скептически относиться даже к «доказательствам» защитников продукта, как в случае с Kagi, где присланные в подтверждение качества результаты поиска сами оказывались забиты спамом.

Можно ли доверять

Это личное эссе на блоге danluu.com, а не журналистское расследование или исследование с методологией: большинство примеров, Volvo, Blackboard, Discourse, поисковики, баскетболист, опираются на собственные наблюдения, память и переписку автора, без независимой проверки. Из документально подтверждённого в тексте, цитата из Википедии о репутации Blackboard и цифра Fast Company (93% участников опроса Amplicate заявили, что «ненавидят» компанию, декабрь 2011 года), но и они пересказаны автором, а не проверены заново. Доступный для этого пересказа фрагмент эссе обрывается на полуслове перед разделом с дальнейшими примерами и выводом, так что итоговая аргументация автора и часть иллюстраций сюда не попали.

Риски и подводные камни

Аргумент строится на анекдотах и личном опыте одного человека, а не на систематических данных: сотрудник Blackboard и «самый грязный баскетболист» остаются безымянными, а число людей, приславших автору результаты поиска в Kagi, и доля запросов с проблемами нигде не указаны. Логику эссе легко довести до крайности и любой чужой положительный отзыв о продукте списывать на «слепоту фаната», хотя сам автор предупреждает: иногда, оценивая продукт, он не находит вообще никаких проблем.

«Если продукт кажется мне серьёзно дефектным, когда я им пользуюсь, скорее всего, так и есть.»

— автор эссе «Bug Blindness» на danluu.com