Исследователи взломали OpenAI с помощью Claude Opus 5

Исследователи взломали OpenAI с помощью Claude Opus 5

Три независимых исследователя из компании Hacktron взломали аккаунты сотрудников OpenAI менее чем за 72 часа, используя модели Claude Opus 4.8 и Claude Opus 5 от Anthropic. Об этом со ссылкой на источники сообщила The Wall Street Journal. Исследователи получили доступ к репозиторию OpenAI на GitHub под названием Monorepo, который, по данным источников издания, содержит «алгоритмические секреты OpenAI».

Команда не стала сама заходить во внутренний код Monorepo, но в доказательство доступа отправила pull request от имени аккаунта сотрудника OpenAI в Codex. Путь ко взлому лежал через Discourse, стороннее программное обеспечение, на котором работают форумы сообщества OpenAI: исследователи воспользовались уязвимостью в системе обработки изображений формата HEIF. По данным Hacktron, Claude Opus 5 вышел вечером 24 июля, и уже к 10 утра следующего дня команда с его помощью добилась удалённого выполнения кода (RCE) на Discourse Cloud и получила доступ к инстансу OpenAI.

Свой проект, «HEIF Heist», команда адаптировала под разные компании всего за один-два дня на каждую, потратив менее $3000 на токены. Помимо OpenAI атаке подверглись Slack, Meta, GitHub Ent, Rails, Next.js, ImageMagick и другие сервисы; по данным Hacktron, из всех целей атаку заметил только Shopify. Уязвимости, о которых Hacktron сообщила Discourse и OpenAI, с тех пор устранены, а OpenAI выплатила Hacktron вознаграждение за находку в размере $6500. При этом технический директор Hacktron Мохан Педхапати сказал WSJ, что команда не считает себя ровней сильнейшим хакерским группировкам, см. цитату.

Ключевые факты

  • Три независимых исследователя из Hacktron взломали аккаунты сотрудников OpenAI менее чем за 72 часа с помощью Claude Opus 4.8 и Claude Opus 5.
  • Точка входа, уязвимость в обработке HEIF-изображений на форумном движке Discourse, который хостит форумы сообщества OpenAI; к 10 утра следующего дня после выхода Claude Opus 5 (вечер 24 июля) команда добилась RCE на Discourse Cloud.
  • Исследователи получили доступ к репозиторию OpenAI на GitHub «Monorepo» с «алгоритмическими секретами» компании и в доказательство отправили pull request от аккаунта сотрудника в Codex, не трогая сам код.
  • Проект HEIF Heist адаптировали под другие компании (Slack, Meta, GitHub Ent, Rails, Next.js, ImageMagick и др.) за один-два дня и менее $3000 в токенах; из всех целей атаку заметил только Shopify.
  • Уязвимости устранены, OpenAI выплатила Hacktron $6500 за находку.

Почему это важно

Взлом показывает, как современные ИИ-модели меняют экономику атак: команде из трёх человек хватило меньше 72 часов и менее $3000 в токенах, чтобы пробить защиту одной из крупнейших ИИ-компаний мира и получить доступ к её внутреннему репозиторию с «алгоритмическими секретами». Это не лабораторный кейс, а реальное проникновение в инфраструктуру OpenAI через стороннее ПО, которым та пользуется.

Кому это важно

ИТ- и security-командам компаний, использующих Discourse для форумов и сообществ; специалистам по AI safety и red-teaming, изучающим возможности Claude и подобных моделей в наступательных сценариях; самой OpenAI и другим ИИ-лабораториям, чья инфраструктура опирается на стороннее ПО; организаторам bug bounty программ.

Как это применить

Компаниям, использующим Discourse, стоит убедиться, что установлены исправления для уязвимости в обработке HEIF-изображений, о которой пишет материал. Security-отделам полезно учитывать, что модели вроде Claude Opus 5 позволяют небольшой команде за один-два дня адаптировать готовую цепочку эксплойтов под новую цель почти без затрат, значит, скорость патчинга уязвимостей в сторонних сервисах становится критичнее, чем раньше.

Можно ли доверять

Материал The Verge пересказывает расследование The Wall Street Journal и заявления самой Hacktron, включая слова технического директора компании Мохана Педхапати; источник не указывает, что OpenAI независимо подтвердила все детали произошедшего. Число участников команды, сроки атаки и суммы (менее $3000 на токены, $6500 вознаграждения), из тех же источников.

Риски и подводные камни

Метод, которым воспользовались добросовестные исследователи безопасности, доступен и злоумышленникам: низкая стоимость (менее $3000) и скорость (один-два дня на компанию) означают, что похожую цепочку эксплойтов через уязвимости в стороннем ПО вроде Discourse может повторить кто угодно с доступом к Claude и Codex. Технику уже опробовали против нескольких компаний помимо OpenAI, Slack, Meta, GitHub Ent, Rails, Next.js, ImageMagick и других, и из всех целей атаку заметил только Shopify.

«Не думаю, что мы так же сильны, как китайские злоумышленники… Мы просто трое парней с подписками на Claude и Codex.»

— Мохан Педхапати, технический директор Hacktron

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.