Фильтр биооружия Anthropic был неактивен почти год: без него прошли 133 млн чатов подрядчиков

Anthropic раскрыла в собственном отчёте по безопасности, что классификаторы, которые должны блокировать попытки извлечь из её ИИ-моделей опасные знания о химическом или биологическом оружии, были неактивны с мая 2025 года по апрель 2026 года, почти год. Отключение затронуло не всех пользователей моделей, а весь трафик от внешних подрядчиков, которые оценивают и размечают ответы моделей: их переписка с моделями проходила без проверки этими классификаторами.
Затронутая группа, около 50 тысяч человек, которые суммарно провели с моделями порядка 133 млн чатов за время, пока классификаторы не работали. По словам Anthropic, этих подрядчиков отбирали только сторонние компании-поставщики, чьи процедуры проверки часто оказывались недостаточно строгими; насколько именно, Anthropic не уточняет.
Внутреннее расследование Anthropic не нашло случаев реального злоупотребления этой лазейкой, то есть компания ничего не обнаружила, а не то, что злоупотреблений точно не было. С тех пор Anthropic ужесточила требования к подрядчикам; какие именно требования изменились, не уточняется.
История выглядит особенно чувствительной на фоне публичной позиции гендиректора Anthropic, который называет содействие ИИ разработке химического и биологического оружия угрозой серьёзнее кибератак, именно от такого сценария и должны были защищать почти год отключённые классификаторы. Отдельно Anthropic сообщила, что позже ослабила похожие классификаторы у модели Fable 5, после того как исследователи пожаловались, что фильтры были чрезмерно строгими и блокировали легитимную научную работу; как это решение связано с описанным выше почти годовым пробелом, источник не поясняет.
Ключевые факты
- Классификаторы Anthropic, которые должны блокировать попытки извлечь из её ИИ-моделей опасные знания о химическом и биологическом оружии, были неактивны с мая 2025 года по апрель 2026 года, почти год.
- Всё это время без проверки этими классификаторами работал трафик около 50 тысяч внешних подрядчиков, которые оценивают ответы моделей; суммарно они провели с моделями порядка 133 млн чатов.
- По данным Anthropic, этих подрядчиков отбирали только внешние компании-поставщики, чьи процедуры проверки часто были недостаточно строгими.
- Внутреннее расследование Anthropic не обнаружило случаев реального злоупотребления этой лазейкой; с тех пор компания ужесточила требования к подрядчикам, не раскрывая деталей.
- Гендиректор Anthropic публично называет содействие ИИ разработке химического и биологического оружия угрозой серьёзнее кибератак, именно от такого риска почти год не была защищена крупная группа подрядчиков.
Почему это важно
Anthropic, компания, чей гендиректор публично называет содействие ИИ разработке химического и биологического оружия угрозой серьёзнее кибератак. При этом ровно тот механизм защиты, который должен был перекрывать именно такой риск, почти год не работал для целого класса пользователей, внешних подрядчиков, размечающих ответы моделей. Расхождение между декларируемым приоритетом безопасности и тем, что происходило на практике, и делает историю значимой: сбой случился не во второстепенной, а в самой чувствительной части системы защиты компании.
Кому это важно
Это важно для регуляторов и исследователей ИИ-безопасности, которые оценивают, насколько можно доверять тому, как компании сами отчитываются о контроле рисков. Это важно для других лабораторий, использующих похожие схемы с внешними подрядчиками для оценки ответов моделей: инцидент показывает, что уязвимым звеном может быть не сама модель, а инфраструктура вокруг неё, доступ через подрядчиков. И это важно для самих подрядчиков и агентств, которые их нанимают: именно к их отбору у Anthropic оказались претензии.
Как это применить
Для компаний, которые выстраивают похожие процессы с внешними подрядчиками для обучения и оценки моделей, история, практический урок: недостаточно один раз спроектировать защитный механизм, нужен независимый постоянный контроль того, что он действительно работает, а не только на момент проверки. Anthropic описывает исправление узко, ужесточение требований к отбору подрядчиков; как именно теперь проверяется, что классификаторы не отключатся снова, источник не описывает. Для читателя, оценивающего заявления ИИ-компаний о безопасности, вывод практичнее: подобные отчёты стоит читать как признание конкретного прошлого сбоя, а не как гарантию того, что защита работает сейчас.
Можно ли доверять
Доверие здесь двустороннее. С одной стороны, сам факт раскрытия говорит в пользу компании: Anthropic не скрыла промах, а описала его в собственном отчёте по безопасности, указав точные даты и приблизительный масштаб, около 50 тысяч подрядчиков и порядка 133 млн чатов. С другой стороны, расследование, не нашедшее следов злоупотребления, было внутренним, а не независимым: оно показывает лишь то, что Anthropic ничего не обнаружила, а не то, что ничего не произошло. Источник также не объясняет, из-за чего классификаторы вообще оказались отключены почти на год, это может быть техническая ошибка, недосмотр или другая причина, и какая именно, не сообщается.
Риски и подводные камни
Главный риск уже реализовался: около 133 млн чатов прошли без проверки на попытки извлечь опасные знания о химическом и биологическом оружии, и оценить, сколько из них были потенциально опасными, невозможно, Anthropic заявляет только, что не нашла свидетельств злоупотреблений. Отдельный риск, то, что отбор около 50 тысяч подрядчиков был отдан на откуп внешним компаниям-поставщикам с неполной проверкой; ни степень недостаточности этой проверки, ни названия этих компаний источник не раскрывает. Наконец, соседняя новость о том, что Anthropic ослабила похожие классификаторы у модели Fable 5 из-за жалоб исследователей на чрезмерную строгость фильтров, показывает более широкую проблему: подобрать баланс между блокировкой легитимных запросов и пропуском опасных непросто, и оба типа сбоев у Anthropic уже случались.