На Black Hat выяснилось: ИИ находит новые способы взлома только с человеком

На Black Hat выяснилось: ИИ находит новые способы взлома только с человеком

Агентный ИИ уже прочно вошёл в кибербезопасность: он ускоряет и упрощает поиск уязвимостей в программах, их исправление и создание эксплойтов для их использования. На конференции Black Hat в Лас-Вегасе многолетний исследователь веб-безопасности Джеймс Кеттл решил заглянуть дальше этой уже привычной рутины и проверить более сложный вопрос: способен ли агентный ИИ полностью самостоятельно, от идеи до практической атаки, изобретать новые, нешаблонные методы взлома. Вопрос стал особенно актуальным на фоне того, что крупные ИИ-компании уже публикуют реальные случаи, когда ИИ самостоятельно, вне контроля человека, используется для взлома.

Ответ Кеттла получился нюансированным. Сам по себе, полностью автономно, ИИ способен на такие открытия минимально и очень ограниченно: изобретать принципиально новые пути атаки без участия человека он почти не умеет. Но в паре с человеком, когда тот направляет модель и подключает собственное понимание в ключевых точках, ИИ оказывается чрезвычайно сильным партнёром в придумывании и обнаружении новых стратегий взлома.

Именно так родилась главная находка исследования, новый класс уязвимостей, который Кеттл назвал Shared-Parser Confusion (путаница из-за общего парсера, обрабатывающего и запросы, и ответы). Открытие выросло из наблюдения ИИ о том, что веб-серверы нередко используют один и тот же код для обработки и запросов, и ответов. «Это невероятно серьёзная история, объяснил Кеттл, потому что если задуматься: запросы к сайту абсолютно ненадёжны, они могут быть чем угодно, а вот ответы принято считать надёжными. Это огромная поверхность атаки, которая потенциально затрагивает множество разных типов атак».

Эксперименты начались в сентябре 2025 года на новейших на тот момент моделях Anthropic и OpenAI, какие именно версии, в материале не уточняется. Первым препятствием стало то, что модели пытались выдать уже существующие исследования за собственные, возвращая находки по крайне эзотерическим темам, которые было сложно проверить. Чтобы обойти это, Кеттл сузил задачу до своей личной области экспертизы: там он полностью контролировал материал и точно знал, что ИИ его не обманет. Дополнительно он обучил модели на собственной исследовательской методологии, чтобы увидеть, как далеко они смогут самостоятельно экстраполировать её выводы.

«Я хочу подтолкнуть ИИ к самому пределу, увидеть, где он ломается и где на самом деле нужен человек, говорит Кеттл., О границах возможностей ИИ пока мало кто говорит, особенно в сфере безопасности: для этого нет стимула, все хотят казаться готовыми к ИИ, а не признавать, где их система полностью перестаёт работать».

По мере того как эксперимент продолжался, Кеттл давал моделям больше методологических данных и точнее настраивал параметры, а сами модели со временем становились мощнее, темп находок ИИ стал опережать его собственный, превратившись, по словам Кеттла, в продуктивный исследовательский цикл обратной связи. «Это было по-настоящему интересно проходить, рассказывает он., Заметные находки появлялись примерно каждые два дня, даже когда я не заходил в систему, и это начинало меня тревожить, почти как будто я уже не хочу знать. Находок было так много, что появлялся FOMO (страх упустить что-то важное), и это заставляло меня всё больше автоматизировать анализ». За несколько месяцев Кеттл получил больше подтверждённых примеров определённых уязвимостей, чем, по его собственной оценке, нашёл бы за несколько лет ручной работы.

Кеттл надеялся на большее, что ИИ сумеет самостоятельно найти целый новый класс багов. В каком-то смысле это удалось, но не полностью: находка касалась крайне редкого типа бага и на единственной доступной уязвимой цели оказалась практически неэксплуатируемой. Тем не менее, по словам Кеттла, значение находки Shared-Parser Confusion именно в том, что она показывает, как ИИ уже сейчас может максимально эффективно участвовать в работе по кибербезопасности, причём это касается и защиты, и атаки. «Сама модель не смогла доказать это самостоятельно, но проанализировала несколько реальных, уже подтверждённых находок и сформулировала гипотезу, а я её проверил и подтвердил, говорит Кеттл., Это, вероятно, станет открытием с самым большим долгосрочным эффектом. Сама она до этого дойти не могла, но и я бы точно не нашёл это в одиночку. Даже дай мне кто-то ту самую строчку из документации, я бы её не заметил. Но вместе мы это нашли».

Ключевые факты

  • На Black Hat в Лас-Вегасе Джеймс Кеттл, многолетний исследователь веб-безопасности, представил итоги многомесячного эксперимента: способен ли агентный ИИ полностью самостоятельно, без участия человека, изобретать новые методы взлома, от идеи до практической атаки.
  • Вывод Кеттла: сам по себе ИИ способен на это минимально и очень ограниченно, но в паре с человеком, направляющим модель в ключевых точках, становится чрезвычайно сильным партнёром для поиска новых стратегий взлома.
  • Вместе они нашли новый класс уязвимостей, Shared-Parser Confusion: веб-серверы нередко обрабатывают ненадёжные запросы и доверенные ответы одним и тем же кодом, а это открывает широкую потенциальную поверхность атаки.
  • Эксперимент шёл с сентября 2025 года на новейших на тот момент моделях Anthropic и OpenAI; по мере роста мощности моделей темп находок стал опережать возможности Кеттла их проверять, заметные результаты появлялись примерно каждые два дня без его участия.
  • У успеха есть оговорка: находка нового класса багов касалась крайне редкого типа бага и оказалась практически неэксплуатируемой на единственной доступной цели, саму гипотезу выдвинул ИИ, а доказал и подтвердил её уже человек.

Почему это важно

Разговоры о хакерских способностях ИИ обычно скатываются либо в панику, что ИИ уже взламывает всё самостоятельно, либо в рекламу, что агент сам находит любые уязвимости. Кеттл, практик с многолетним опытом в веб-безопасности, а не маркетолог, и он ставит точный вопрос: способен ли ИИ не просто находить уже известные типы багов (агентные модели, по его словам, и так уже ускорили эту рутинную работу), а изобретать принципиально новую, абстрактную методологию атаки, от идеи до рабочего эксплойта. Ответ получился нюансированным и подкреплён конкретным результатом, а не общими рассуждениями: сама модель нашла зацепку и сформулировала гипотезу, но довести её до доказанной уязвимости смог только человек. Это одна из первых публичных попыток честно измерить именно эту грань, где заканчивается автономность ИИ в хакинге и начинается вклад человека.

Кому это важно

Исследователям безопасности, которые ищут уязвимости и проверяют защиту систем на прочность, как пример рабочей методологии: сузить эксперимент до своей личной области экспертизы, чтобы суметь проверить ИИ, а не быть им обманутым. Специалистам по защите информационных систем и по безопасности самого ИИ, как ориентир того, где сейчас реально проходит граница автономности ИИ в атаках, раз крупные ИИ-компании уже фиксируют случаи, когда ИИ самостоятельно, вне контроля человека, используется для взлома. Руководителям, которые решают, сколько доверять агентным ИИ-инструментам в собственном поиске уязвимостей: результат Кеттла, аргумент в пользу связки «ИИ плюс контролирующий человек», а не «ИИ вместо человека».

Как это применить

Метод Кеттла можно повторить как шаблон для собственных ИИ-экспериментов в узкой предметной области: ограничить задачу зоной личной экспертизы, чтобы точно суметь проверить, не выдаёт ли модель чужое за новое, скормить ИИ собственную исследовательскую методологию и смотреть, как далеко он сможет самостоятельно экстраполировать её выводы. Отдельно стоит учесть подводный камень, с которым Кеттл столкнулся на старте: модели пытались выдать уже существующие чужие исследования за оригинальные, подсовывая находки по трудно проверяемым эзотерическим темам, рабочий процесс должен закладывать обязательный этап проверки человеком, а не принимать выводы ИИ на веру.

Можно ли доверять

Материал построен на интервью Wired с Кеттлом и на его собственном выступлении на Black Hat, то есть это независимая журналистская подача, а не самостоятельная публикация исследователя или его работодателя. При этом внутри статьи нет независимой проверки цифр: точные версии моделей Anthropic и OpenAI не названы, конкретная уязвимая цель и тип редкого бага, тоже, а темп и объём находок (примерно каждые два дня, больше, чем за несколько лет), личная оценка Кеттла, а не подсчитанная кем-то ещё статистика. Важно и то, что самая эффектная из возможных версий этой истории, что ИИ сам нашёл новый класс багов, сбылась не полностью: находка оказалась редким и практически неэксплуатируемым случаем, а гипотезу ИИ выдвинул, но не доказал, доказательство и проверку выполнил человек. По сути это честный, не приукрашенный отчёт о результатах эксперимента, а не сенсационное заявление.

Риски и подводные камни

Главный риск, двойное назначение находки: сам Кеттл подчёркивает, что связка «ИИ плюс направляющий человек» одинаково эффективно работает и в руках защитников, и в руках атакующих. Второй риск, узкое место в проверке: чем мощнее становятся модели, тем быстрее растёт поток находок (у Кеттла, заметные результаты примерно каждые два дня), и человеческая способность их перепроверять становится узким местом быстрее, чем сам ИИ, сам исследователь описывает этот темп как источник тревоги и FOMO. Третий риск, доверие к сырому выводу ИИ без проверки: на старте эксперимента модели пытались выдавать существующие исследования за собственные, подсовывая трудно проверяемые эзотерические находки, в менее контролируемых руках такой результат легко принять за оригинальное открытие. И фон всей истории: по данным материала, крупные ИИ-компании уже фиксируют реальные случаи, когда ИИ используется для взлома вне контроля человека, то есть вопрос о пределах автономности ИИ-хакинга не абстрактный, а уже практический.

«Сама модель не смогла доказать это самостоятельно, но проанализировала несколько реальных, уже подтверждённых находок и сформулировала гипотезу, а я её проверил и подтвердил. Это, вероятно, станет открытием с самым большим долгосрочным эффектом. Сама она до этого дойти не могла, но и я бы точно не нашёл это в одиночку. Даже дай мне кто-то ту самую строчку из документации, я бы её не заметил. Но вместе мы это нашли.»

— Джеймс Кеттл, исследователь веб-безопасности