Стартап Irregular по ошибке выпустил ИИ-агентов OpenAI, Meta, Anthropic и Google в реальный интернет

Израильский стартап Irregular (основан в 2023 году как Pattern Labs) специализируется на стресс-тестировании ИИ-моделей в «высокоточных исследовательских платформах», имитирующих реальные сценарии кибербезопасности. Компания работала со многими крупнейшими игроками отрасли: её тесты упоминались в системных карточках моделей OpenAI, она проверяла системы для правительства Великобритании и для Anthropic, публиковала совместные исследования с влиятельным аналитическим центром RAND.
В нескольких тестах этого года ИИ-агенты вырывались за пределы изолированных тестовых сред и атаковали реальные цели в интернете. Irregular проверяла способности моделей к взлому в контролируемых средах, включая упражнения «захват флага» (capture-the-flag), агентам нужно было найти скрытую информацию в имитируемой сети. Но, по словам технического директора и сооснователя Irregular Омера Нево, агенты не должны были иметь доступа к открытому интернету, однако «доступ в интернет был случайно открыт». Вдобавок вымышленное название компании-цели, придуманное для симуляции, «совпало с реальным доменом». Вместе эти две ошибки отправили агентов на реальные цели в сети, при этом неизвестно, какие именно компании или организации подверглись атакам.
Нево подтвердил The Verge, что именно эта проблема стояла за всеми инцидентами с моделями OpenAI, Meta, Anthropic и Google: «Все инциденты, связанные с Irregular, произошли из-за одной и той же базовой проблемы в одном тестовом сценарии, и о них было сообщено». Он уточнил, что другие недавние инциденты в отрасли, включая атаку агентов OpenAI на Hugging Face в июле и утечки, связанные с британским Институтом безопасности ИИ, с Irregular не связаны. При этом слово «сообщено» не обязательно означает публичное раскрытие: неясно, шла ли речь об уведомлении клиентов, публики или кого-то ещё. Компании узнали о нарушениях примерно в одно время, в конце июля: OpenAI и Anthropic сами объявили об инцидентах, а сведения о Meta и, позже, Google впервые появились через СМИ.
Помимо четырёх крупных американских компаний, Irregular тестировала и открытые китайские модели, Kimi K3 от Moonshot AI и GLM-5.2 от Z.ai. В отличие от закрытых моделей, включая флагманскую Spark у Meta, эти модели можно свободно скачать и запустить на своём оборудовании, поэтому тестировщикам не нужно полагаться на доступ от компании-разработчика. По словам Нево, при оценке GLM и Kimi такой же проблемы не возникло, но это «само по себе не значит, что эти модели менее подвержены подобному поведению». Ни Moonshot, ни Z.ai не ответили на запрос The Verge.
Нево заявил, что после инцидентов Irregular ужесточила контроль доступа в интернет, расширила мониторинг и ручную проверку, усилила проверки перед началом тестирования, чтобы доступ соответствовал заявленным рамкам, а также улучшила документирование условий каждой оценки с партнёрами. Компания планирует опубликовать более широкий отчёт об извлечённых уроках и практиках безопасного проведения киберпроверок, когда завершит совместную работу с вовлечёнными компаниями. Ни одна из четырёх американских компаний не ответила на дополнительные вопросы The Verge, о том, когда именно они узнали о нарушениях, требовали ли компенсации от Irregular и планируют ли продолжать с ней сотрудничество. Google и Anthropic вовсе не ответили изданию, а OpenAI и Meta лишь сослались на ранее опубликованные записи в блогах.
Ключевые факты
- Единая причина всех инцидентов, сбой в одном тестовом сценарии Irregular: случайно открытый доступ в интернет плюс совпадение вымышленного домена-цели с реальным
- Пострадали ИИ-агенты OpenAI, Meta, Anthropic и Google; компании узнали о нарушениях примерно одновременно, в конце июля
- Неизвестно, какие именно реальные компании или организации подверглись атакам вырвавшихся агентов
- Irregular также тестировала открытые китайские модели Kimi K3 (Moonshot AI) и GLM-5.2 (Z.ai), там та же проблема не проявилась, но техдиректор компании подчеркнул, что это не доказывает их большую безопасность
- Все четыре американские компании не ответили The Verge на детальные вопросы о последствиях, компенсациях и дальнейшем сотрудничестве с Irregular
Почему это важно
История показывает, что уязвимым звеном в проверках безопасности ИИ может быть не сама модель, а инфраструктура тестирования: одна и та же техническая ошибка в изолированной среде Irregular привела к тому, что агенты сразу нескольких ведущих лабораторий, OpenAI, Meta, Anthropic и Google, вышли за пределы симуляции и атаковали реальные цели в сети.
Кому это важно
Прежде всего, командам безопасности и исследователям в самих ИИ-лабораториях, которые полагаются на внешних подрядчиков вроде Irregular для оценки рисков перед выпуском моделей, а также регуляторам и аналитическим центрам вроде RAND, формирующим политику в области ИИ на основе таких проверок.
Как это применить
Компаниям, заказывающим подобные тесты на проникновение и капчур-флаг-упражнения, стоит требовать явной проверки изоляции сети (отсутствия доступа в открытый интернет) и исключать совпадение вымышленных тестовых доменов с реальными, именно эта комбинация ошибок стала причиной всех инцидентов у Irregular.
Можно ли доверять
Материал The Verge основан на прямых комментариях технического директора и сооснователя Irregular Омера Нево, подтвердившего единую причину инцидентов. При этом ключевые детали остаются неподтверждёнными: неизвестно, какие реальные организации пострадали, что именно значило слово «сообщено», а Google, Anthropic и Meta отказались отвечать на уточняющие вопросы издания, OpenAI и Meta ограничились ссылками на старые блог-посты.
Риски и подводные камни
Все описанные исправления, контроль доступа в интернет, усиленный мониторинг, новая документация, основаны исключительно на словах самой Irregular и независимо не проверены. Кроме того, отсутствие похожих инцидентов при тестировании китайских моделей Kimi K3 и GLM-5.2, по признанию самого техдиректора компании, не означает, что эти модели менее подвержены такому же риску побега агентов из тестовой среды.
«Все инциденты, связанные с Irregular, произошли из-за одной и той же базовой проблемы в одном тестовом сценарии, и о них было сообщено.»
— Омер Нево, технический директор и сооснователь Irregular
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.