Защитные барьеры ИИ Anthropic и OpenAI мешают ИБ-исследователям искать уязвимости
Уже несколько месяцев ИИ-компании выстраивают программы проверки пользователей и жёсткие защитные барьеры, чтобы их модели не помогали злоумышленникам готовить кибератаки. Но те же ограничения теперь мешают и легитимным защитникам сетей, и исследователям наступательной кибербезопасности, тем, чья работа состоит в поиске неизвестных уязвимостей раньше, чем их найдут преступники. TechCrunch поговорил с несколькими такими специалистами о том, как они на практике сталкиваются с барьерами ИИ-моделей.
В июне власти США ввели экспортные ограничения на разрекламированные ИИ-модели Anthropic, Mythos и Fable. Решение было принято как минимум отчасти из-за отчёта, утверждавшего, что защитные барьеры этих моделей, призванные не допустить их использование для вредоносных кибератак, можно обойти. Независимо от того, действительно ли дело было в опасениях по поводу джейлбрейка, факт в том, что сама Anthropic неоднократно позиционировала Mythos как своего рода «кибермашину судного дня», которую можно доверить только тщательно проверенным пользователям, и то со строгими защитными барьерами. Позже ограничения на Fable 5 и Mythos 5 сняли: Fable 5 вернулась в общий доступ 1 июля, а Mythos 5 вновь открыли только для проверенных американских организаций в рамках государственной проверки.
Такой контроль доступа, не только история Mythos. И Anthropic (для остальных своих моделей), и OpenAI предлагают исследователям кибербезопасности программы проверки: подавшись и пройдя отбор, специалист получает доступ к моделям с более мягкими ограничениями по кибербезопасности. У OpenAI это Trusted Access for Cyber, у Anthropic, Cyber Verification Program (CVP). Эти барьеры широко критикуют, особенно те, чья работа, искать неизвестные уязвимости в системах и находить способы их эксплуатации раньше злоумышленников.
Марк Дауд, известный исследователь безопасности, в одном из подкастов о кибербезопасности заявил, что ему «некомфортно от того, что какие-то отдельно взятые крупные компании принимают произвольные решения о том, что безопасно в сфере безопасности, а что нет». Дауд десятилетиями находит и продаёт западным правительствам уязвимости нулевого дня, ранее неизвестные программные ошибки и эксплойты для них, вместо того чтобы сообщать о них разработчикам для исправления: правительства платят за такие уязвимости именно потому, что те остаются открытыми, а это полезно для разведывательных операций. Дауд признаёт, что его работа может делать его пристрастным, но подчёркивает, что он в своём мнении не одинок.
Крис Анли, главный научный сотрудник консалтинговой компании NCC Group, рассказал, что просьба к ИИ-модели попытаться проэксплуатировать баг, ключевой шаг для подтверждения того, что уязвимость реальна и её стоит исправлять. Но если защитный барьер заставляет модель просто отказаться отвечать, это вредит именно защитникам, считает он. «Здесь и проявляется вся эта история с наступательной и оборонительной стороной защитных барьеров: запрос ‘исправь этот код’, это одновременно и базовый механизм защиты, и дорожная карта для поиска критических уязвимостей в кодовой базе, говорит Анли., Один и тот же инструмент оказывается сразу и наступательным, и оборонительным, и одно от другого неотделимо». По его словам, это «как молоток»: дом без него не построишь, это точно инструмент, но он же неизбежно и оружие. Когда Анли и его коллеги упираются в такой барьер, они иногда переходят на open source ИИ-модели вообще без защитных ограничений.
Паоло Станьо, технический директор компании Crowdfense, которая разрабатывает, скупает и продаёт неизвестные уязвимости государственным ведомствам, согласен с Даудом: по его словам, ИИ-компании своими программами проверки и барьерами «по сути обращаются с клиентами как с детьми, которым нужна нянька». Станьо рассказал, что он и его коллеги используют топовые ИИ-модели только для реверс-инжиниринга. Для поиска уязвимостей и создания эксплойтов они ИИ избегают: передача такой работы в облачную модель рискует утечкой чувствительных данных об уязвимости или тем, что эти данные попадут в будущие обучающие прогоны. Поэтому на этом этапе они используют open source модели, запущенные локально, без передачи данных наружу.
Джузеппе Кали, исследователь, который ищет уязвимости нулевого дня и разрабатывает эксплойты, говорит, что защитные барьеры лично ему не мешают, просто потому, что он не использует ИИ для наступательной работы. Вместо этого он применяет его для реверс-инжиниринга, чтобы разобраться в анализируемом коде, и для создания вспомогательных инструментов: здесь ИИ ускоряет процесс и даёт сосредоточиться на поиске уязвимостей. «Я всё равно хочу сам находить баг и сам превращать его в оружие, это не изменилось бы, даже сними все барьеры завтра, говорит Кали., Я дорожу своими багами и слишком люблю эту игру, чтобы отдавать её моделям».
Один исследователь из компании, производителя компонентов для смартфонов, попросивший анонимности, потому что не уполномочен говорить с прессой, рассказал, что его работодатель не участвует в программе CVP от Anthropic, и поэтому её инструменты почти бесполезны для поиска уязвимостей: барьеры слишком строгие. «Если модель улавливает, что дело касается безопасности, она просто останавливается и становится непригодной», сказал он.
Крис Томпсон, глава компании RemoteThreat и основатель мероприятия Offensive AI Con, посвящённого наступательной безопасности и ИИ, говорит, что на практике защитные барьеры топовых ИИ-моделей непоследовательны и работают по-разному день ото дня, это верно даже внутри более мягких рамок проверенных программ Anthropic и OpenAI. «Практический эффект в том, что вы тратите кучу времени на переговоры с моделью вместо работы над самой программой безопасности, говорит Томпсон., Вместо анализа уязвимости и оценки того, насколько она эксплуатируема, вы пытаетесь понять, почему результаты непоследовательны или почему модель чрезмерно фильтрует свой ответ». В итоге, по словам Томпсона, исследователей толкают в сторону китайских open source моделей вроде GLM, их можно свободно скачать и запускать локально без какой-либо проверки и ограничений. «Ответственных исследователей выталкивают из систем под юрисдикцией США в системы, принадлежащие иностранным компаниям, говорит он., По-моему, эти защитные барьеры приносят больше вреда, чем пользы».
Вместо дальнейшего ужесточения ограничений Томпсон призывает передовые ИИ-лаборатории открыть свои программы, дать исследователям ответственный доступ и привлекать к ответственности тех, кто злоупотребляет инструментами. Иначе, предупреждает он, в ИИ-гонке проиграют именно защитники: «Надвигается большая буря, огромная волна атак, которая обрушится с невиданными прежде скоростью и масштабом. Но именно те консалтинговые компании по безопасности и легитимные исследователи, которые пытаются изменить ситуацию к лучшему, сейчас оказываются зажаты в тиски».
Ключевые факты
- В июне США ввели экспортные ограничения на ИИ-модели Anthropic, Mythos и Fable, отчасти из-за отчёта об обходе их защитных барьеров против кибератак; позже ограничения сняли: Fable 5, с 1 июля, Mythos 5, только для проверенных американских организаций.
- Anthropic и OpenAI пускают исследователей кибербезопасности к моделям с более мягкими ограничениями только через программы проверки, Cyber Verification Program и Trusted Access for Cyber соответственно.
- Марк Дауд, который продаёт правительствам уязвимости нулевого дня, считает недопустимым, что решения о безопасности произвольно принимают отдельные компании; Крис Анли из NCC Group добавляет, что отказ модели помогать в поиске багов вредит именно защитникам.
- Паоло Станьо из Crowdfense и его коллеги избегают ИИ при поиске уязвимостей и создании эксплойтов из-за риска утечки данных в облако, для этого они используют локальные open source модели.
- Крис Томпсон из RemoteThreat предупреждает: непоследовательные барьеры толкают ответственных исследователей к китайским моделям вроде GLM и ослабляют защитников перед грядущей волной атак.
Почему это важно
ИИ-лаборатории строят защитные барьеры, чтобы модели не помогали готовить кибератаки, и те же барьеры блокируют работу тех, кто ищет и закрывает уязвимости раньше преступников. Получается парадокс: инструмент, задуманный как защита от ИИ-атак, тормозит именно тех, кто гонится за уязвимостями, чтобы их исправить. Поскольку топовые модели всё глубже встраиваются в повседневную работу наступательной безопасности, поиск багов, разработку эксплойтов, реверс-инжиниринг, от калибровки этих барьеров напрямую зависит скорость, с которой реальные уязвимости находят и закрывают, а не только то, насколько хорошо пресечён абьюз со стороны злоумышленников.
Кому это важно
Исследователям наступательной безопасности и пентестерам, которые используют ИИ для ускорения поиска уязвимостей; брокерам, продающим уязвимости нулевого дня государствам, как Дауд или компания Crowdfense; консалтинговым фирмам вроде NCC Group, чьи клиенты зависят от быстрой и полной проверки безопасности; компаниям, у которых есть собственная служба ИБ-исследований, но нет доступа к программам проверки, как у работодателя анонимного собеседника из производителя компонентов для смартфонов; самим ИИ-лабораториям, Anthropic и OpenAI, которым приходится балансировать между защитой от абьюза и пользой для легитимных исследований; и регуляторам, чьи экспортные ограничения могут в одночасье отрезать доступ к конкретной модели.
Как это применить
В материале описаны три практических пути. Первый, подать заявку в программу проверки лаборатории (Cyber Verification Program у Anthropic, Trusted Access for Cyber у OpenAI) ради доступа к моделям с более мягкими ограничениями, учитывая, что даже проверенный доступ может вести себя непоследовательно изо дня в день. Второй, использовать топовые модели строго для реверс-инжиниринга и понимания кода, а не для генерации эксплойтов: это обходит и барьеры, и риск утечки чувствительных данных в облако. Третий, при блокировке уходить на open source модели, запущенные локально; но у этого пути есть цена, отсутствие барьеров означает и отсутствие какой-либо ответственности поставщика, а по наблюдению Томпсона, именно так квалифицированные западные исследователи незаметно перетекают к иностранным моделям вроде китайской GLM.
Можно ли доверять
Материал построен на именных источниках с проверяемыми должностями и работодателями, Марк Дауд, Крис Анли (NCC Group), Паоло Станьо (Crowdfense), Джузеппе Кали, Крис Томпсон (RemoteThreat), плюс один анонимный отраслевой источник. Факты об экспортных ограничениях на Mythos и Fable и их последующей отмене поданы как факты, а не чьё-то мнение. Стоит учитывать: у нескольких цитируемых экспертов есть профессиональный интерес в смягчении барьеров, Дауд продаёт уязвимости нулевого дня правительствам, компания Станьо тоже торгует уязвимостями, а Томпсон организует конференцию по наступательной ИИ-безопасности; сам материал прямо отмечает, что Дауд «признаёт, что его работа может делать его пристрастным». Разумно читать критику барьеров как одну сторону реального компромисса, с ответом от лица самих ИИ-лабораторий материал никого не цитирует.
Риски и подводные камни
Уход на open source модели без барьеров, включая иностранные вроде GLM, снимает контроль вендора за использованием и, по словам Томпсона, постепенно перемещает квалифицированную западную ИБ-работу на ИИ вне юрисдикции США. Непоследовательные барьеры, которые «работают по-разному каждый день», отнимают у исследователей время, которое могло бы уйти на саму работу по безопасности. Отбор в программы проверки создаёт неравенство: компании вне этих программ, как работодатель анонимного собеседника из производителя компонентов для смартфонов, получают заметно менее полезные инструменты независимо от того, насколько легитимна их задача. Наконец, в материале звучит и более широкое предупреждение: пока барьеры тормозят легитимных защитников, надвигающаяся волна ИИ-атак, по словам Томпсона, не станет ждать, пока кто-то пройдёт проверку.
«Дом без молотка не построишь. Это точно инструмент, но он же неизбежно и оружие.»
— Крис Анли, главный научный сотрудник NCC Group