Сайты, которые цитирует Perplexity, сгенерировали 215 000 страниц для ИИ, а не для людей

trellner.com проверил, на какие источники опираются модели Perplexity sonar и sonar-pro (через OpenRouter), когда отвечают на вопросы о выборе софта. 2 сентября 2026 года авторы отправили моделям 380 покупательских категорий ПО, от «CRM-систем» до «ПО для управления коллекциями музеев», по одному запросу на категорию на модель, всего 760 вызовов; список категорий был составлен заранее и не менялся по ходу теста. Обе модели прямо показывают, на какие URL они опирались, поэтому выбраны именно они. Google в тест не включили: на OpenRouter Gemini подключается через собственный веб-поиск OpenRouter, а не через поиск Google, так что результат описывал бы этот плагин, а не саму Google, выводы касаются только Perplexity.

Всего собрали 7534 цитируемые ссылки на 2055 разных доменов (3800 позиций-рекомендаций, 1807 разных продуктов). 59,8% из этих 7534 ссылок ведут на домены за пределами топ-100 000 сайтов по рейтингу Tranco, а 23,4%, на домены, которых нет и в топ-миллионе вообще. Медианный ранг Tranco среди процитированных ранжируемых доменов, 71 611-е место; десять самых цитируемых доменов забирают лишь 17,3% ссылок, то есть дело не в горстке известных сайтов. 751 из 2055 процитированных доменов (36,5%) вообще не входят в топ-миллион, и они моложе: медианный год первой архивной копии в Wayback Machine, 2020-й против 2011-го у ранжируемых доменов, а доля впервые заархивированных уже в 2025-м или позже, 16,6% против 1,6%.

Третий по цитируемости источник во всём исследовании, блог guideflow.com, сервиса интерактивных демо-роликов для продуктов. Он не обзорный сайт, не каталог и не конкурирует ни в одной из проверенных категорий, но его блог процитировали в сумме 194 раза в 96 из 380 категорий, это больше, чем у Gartner. За этими 194 упоминаниями стоят 96 разных URL блога, по одному на категорию (шесть из них, эстонская копия одного и того же поста), а всего в карте сайта 3351 адрес блога, из них 2176 уникальных постов.

Отдельно авторы выделили три сайта: wifitalents.com (71 цитата, 27 категорий), worldmetrics.org (60, 22) и gitnux.org (50, 23), вместе 181 цитата (2,4% от общего числа) в 41 категории. Все три зарегистрированы через NameCheap в декабре 2023, мае 2024 года, делегируют DNS на одну и ту же пару Cloudflare-серверов (pam.ns.cloudflare.com и sean.ns.cloudflare.com), используют одинаковый шаблон страниц и навигацию и ведут ровно по шесть постов в блоге, все восемнадцать постов о двух других брендах из этого же набора плюс о четвёртом, zipdo.co, на тех же серверах. В картах сайтов у них 103 578, 107 083 и 105 541 адрес соответственно, из которых 70 731, 71 684 и 72 713, сгенерированные страницы вида /best/<категория>-software/: в сумме 215 128 таких страниц «лучшее ПО» против всего шести настоящих постов в блоге у каждого сайта. У worldmetrics.org и gitnux.org в HTML-заголовке страницы стоит «<Бренд>, Facts & Grounding Page» («Страница фактов и грундинга», grounding здесь тот самый этап поиска источников, который выполняют модели), а мета-описание почти дословно совпадает у обоих (см. цитату). Там же worldmetrics.org продаёт заказные исследования «от €5000», готовые отчёты «от €499» и подбор поставщика «от €2500», прямо рядом с таксономией сгенерированных списков «лучшего ПО», которые и цитируют модели.

На одной и той же категории, «ПО для оценки проектов», все три сайта дают разные ответы: победитель Gitnux вообще не попадает в пятёрку лучших у Worldmetrics. На каждой странице указаны трое штатных сотрудников: у Worldmetrics, Кэтрин Блейк, Александр Шмидт и Виктория Марш, у Gitnux, Диана Ривз, Хелена Ковальчик и Оливия Торнтон, у WifiTalents, Райан Галлахер, Изабелла Росси и Наташа Иванова, девять разных имён на один и тот же вопрос. Gitnux помечает свой результат как «AI-verified · Expert reviewed» («проверено ИИ, проверено экспертом»). На всех трёх страницах в строке с датой публикации стоит неотрендеренная шаблонная переменная, «Within the next 26 days» на двух из них и «Within the next 40 days» на третьей (то есть «в течение следующих 26/40 дней»).

Авторы также проверили 1502 адреса сайтов-производителей, которые модели указывали как официальные домашние страницы продуктов, дважды: напрямую и через ротируемый прокси, засчитывая сайт живым, если ответила хотя бы одна попытка. Десять из 1502 вообще не резолвятся (восемь даже не делегированы ни на один DNS-сервер), среди них graphiql.com (предложен как сайт GraphiQL, у которого такого домена нет), todo.com (предложен для Microsoft To Do) и aquasecurity.io (предложен для Trivy). Ещё четыре резолвятся, но не отвечают. Вместе с реальными 404-ми не работают или недоступны 17 доменов (1,1%), а 92 (6,1%) ведут редиректом на другой домен. Два случая, особенно показательны: для «платформ управления исследовательскими данными» обе модели назвали Dryad, но sonar-pro дал верный адрес datadryad.org, а sonar, dryad.co, который редиректит на индонезийский гэмблинг-портал с заголовком «BIGSLOT288 | Portal Game Online». Для «инструментов контроля качества данных» обе модели назвали Monte Carlo: sonar дал верный montecarlodata.com, а sonar-pro, montecarlo.com, который ведёт на казино-группу Monte-Carlo Société des Bains de Mer в Монако.

Сами авторы оговаривают границы измерения. sonar и sonar-pro, не два независимых замера: в 289 из 380 категорий они вернули побайтово идентичные списки цитат, пересечение множеств URL по Джаккару, 0,898, а один и тот же товар на первом месте оба тира назвали в 290 из 380 категорий, это факт про общий поисковый слой обеих версий Perplexity, а не про совпадение независимых систем. Измерили только Perplexity, ChatGPT, Gemini, Copilot и AI Mode от Google не проверялись, и переносить выводы на них нет оснований. 380 категорий, собственный список авторов, а не выборка реальных запросов покупателей; замер, снимок одного дня по постоянно меняющемуся поисковому индексу; формулировка запроса и число повторов, по одному разу, без повторной выборки. Авторы прямо пишут, что не проверяли, изменились бы рекомендации при исключении этих источников, и не знают, кто на самом деле управляет тремя связанными брендами, общий контроль выведен только из общей инфраструктуры и совпадающего шаблона. Полный датасет, все цитаты, все рекомендации, проверки Tranco и Wayback, проверки доступности сайтов, и скрипты, которыми получена каждая цифра, опубликованы под лицензией CC BY 4.0.

Ключевые факты

  • 59,8% из 7534 ссылок, на которые опираются рекомендации Perplexity, ведут на домены за пределами топ-100 000 сайтов по рейтингу Tranco, а 23,4%, на домены вне топ-миллиона вовсе.
  • Три связанных сайта, wifitalents.com, worldmetrics.org и gitnux.org, зарегистрированные в 2023, 2024 годах через NameCheap на одних Cloudflare-серверах, вместе сгенерировали 215 128 страниц «лучшее ПО» против всего шести настоящих постов в блоге у каждого.
  • worldmetrics.org и gitnux.org сами называют свою домашнюю страницу «Facts & Grounding Page» в HTML-заголовке, адресуясь не к читателям, а к моделям, которые их индексируют.
  • Блог сервиса демо-роликов guideflow.com, не конкурирующий ни в одной из 380 проверенных категорий, процитирован 194 раза, это третий по цитируемости источник во всём исследовании, обгоняющий Gartner.
  • В двух категориях по одной из двух моделей Perplexity дала адрес, который на деле ведёт на казино или гэмблинг: sonar перепутал Dryad с индонезийским гэмблинг-порталом, sonar-pro, Monte Carlo с казино-группой в Монако; вторая модель в каждой паре назвала верный адрес.

Почему это важно

Когда ИИ-поисковик вроде Perplexity отвечает на вопрос, он сначала находит документы (это и называется grounding, «заземление» ответа на источники), а потом строит ответ на их основе. Это исследование впервые системно показало, что заметная часть таких документов, не независимые обзоры и не сайты производителей, а контент, который написан по шаблону и адресован именно поисковому слою модели, а не читателю. 59,8% из 7534 собранных ссылок ведут на малопосещаемые домены, а 215 128 страниц «лучшее ПО» на трёх связанных сайтах существуют почти исключительно ради того, чтобы их подобрала модель, при том что реальных категорий, под которые они якобы написаны, столько нет.

Кому это важно

AI-компаниям вроде Perplexity, чья репутация зависит от качества источников в ответах; покупателям ПО, которые полагаются на рекомендации ИИ-поиска при выборе инструмента; независимым обзорным изданиям и аналитикам вроде Gartner, которых по цитируемости в отдельных категориях обходит блог сервиса демо-роликов guideflow.com; и владельцам сайтов, для которых это готовый пример, как выглядит контент, рассчитанный именно на подбор моделью, а не на живого читателя.

Как это применить

Тем, кто использует ИИ-поиск для выбора софта, стоит проверять, на что реально ссылается ответ, особенно если рекомендация касается нишевой категории, в отчёте прямо показаны случаи, когда указанный «официальный сайт» продукта на деле редиректит на казино или гэмблинг-портал. Полный датасет и скрипты, которыми получена каждая цифра отчёта, опубликованы под лицензией CC BY 4.0, это готовая методика перепроверить то же самое для другой выборки категорий или другого поискового движка.

Можно ли доверять

Методология подробно описана: 380 категорий составлены заранее и не менялись по итогам, каждый домен сверен и с рейтингом Tranco, и с Wayback Machine, а доступность 1502 адресов производителей проверена дважды, напрямую и через прокси, чтобы не засчитать живой сайт мёртвым из-за случайной блокировки. Отчёт честно фиксирует границы: sonar и sonar-pro, не независимые замеры (289 из 380 категорий дали побайтово одинаковый список цитат), измерена только Perplexity, а не ChatGPT, Gemini, Copilot или Google AI Mode, срез, снимок одного дня, а общий контроль над тремя связанными брендами, вывод из совпадающей инфраструктуры, а не подтверждённый факт. Такая прозрачность про то, чего отчёт не показывает, вместе с открытым датасетом и скриптами, сильная сторона именно этой методики.

Риски и подводные камни

Отчёт не доказывает, что рекомендации Perplexity из-за этих источников стали хуже, авторы прямо пишут, что не проверяли, изменились бы советы при исключении найденных сайтов, и что сами эти сайты вполне могут называть разумные продукты. Общий контроль над wifitalents.com, worldmetrics.org и gitnux.org выведен только из общих Cloudflare-серверов и одинакового шаблона, это сильная косвенная улика, но не подтверждённое владение, и ни один из трёх сайтов не называет владельца. Выводы касаются только Perplexity и только одного дня работы её поискового индекса, который постоянно меняется, переносить их на другие ИИ-поисковики или на будущие ответы Perplexity нельзя. При этом уже подтверждённый факт, что минимум для двух реальных категорий сам ИИ-поиск указал на казино вместо продукта, показывает, что цена ошибки для покупателя, который доверится такому ответу не глядя, может быть прямой.

«Проверенные факты о Gitnux: независимая исследовательская компания, публикующая отраслевую статистику, кастомные исследования и списки лучшего ПО. Сведения о компании, юридические данные, методология и комплаенс, в одной машиночитаемой записи.»

— мета-описание сайта gitnux.org (у worldmetrics.org, тот же текст, с заменой названия бренда)