Anthropic: GLM-5.3 полностью перехватывает управление в 4% попыток

Заметка в блоге от 29 сентября 2026 года приводит фрагмент материала Anthropic Frontier Red Team «GLM-5.3 and the spread of advanced cyber capabilities» («GLM-5.3 и распространение продвинутых кибервозможностей»).

Команда оценила несколько моделей на 100 задачах, выбранных случайным образом из внутреннего бенчмарка Binary Exploitation (бинарная эксплуатация). Результат: GLM-5.3 разрабатывает полноценные перехваты потока управления (control flow hijack) в 4% испытаний, а Claude Mythos Preview, в 6%.

Авторы отмечают, что хотя здесь GLM-5.3 уступает Claude Mythos Preview, значимый порог явно пройден: более ранние модели, такие как Claude Opus 4.6 и GLM-5.2, не справились ни с одной из этих задач.

Итак, ключевая картина: у прежних моделей из сравнения результат нулевой, у двух новых, небольшой, но ненулевой (4% и 6%). Из фрагмента не видно, сколько попыток приходилось на каждую задачу и как именно засчитывается успех.

Ключевые факты

  • Anthropic Frontier Red Team оценила несколько моделей на 100 задачах, случайно выбранных из внутреннего бенчмарка Binary Exploitation.
  • GLM-5.3 разрабатывает полные перехваты потока управления в 4% испытаний, Claude Mythos Preview, в 6%.
  • Claude Opus 4.6 и GLM-5.2 не справились ни с одной из этих задач.
  • По оценке команды, значимый порог явно пройден, хотя GLM-5.3 здесь уступает Claude Mythos Preview.

Почему это важно

По данным Anthropic Frontier Red Team, на одном и том же наборе из 100 задач более ранние модели (Claude Opus 4.6 и GLM-5.2) не решают ничего, а GLM-5.3 и Claude Mythos Preview уже получают полные перехваты потока управления, в 4% и 6% испытаний соответственно. Сама команда называет это пройденным значимым порогом.

Кому это важно

Прежде всего тем, кто следит за кибервозможностями нейросетей и оценивает связанные с ними риски: специалистам по безопасности и исследователям, которые сравнивают модели по способности к эксплуатации уязвимостей.

Как это применить

Это короткая цитата, а не инструкция или инструмент. Практический вывод один: результаты внутреннего бенчмарка можно использовать как ориентир при сравнении поколений моделей, но сам набор задач в приведённом фрагменте не раскрыт. Полный материал команды называется «GLM-5.3 and the spread of advanced cyber capabilities».

Можно ли доверять

Цифры принадлежат самой Anthropic Frontier Red Team и получены на внутреннем бенчмарке. Число попыток на задачу не указано, описания бенчмарка и способа оценки успеха во фрагменте нет; сведений о независимой проверке или воспроизведении результатов тоже нет. Источник здесь, блог-заметка с цитатой, а не сам исходный материал.

Риски и подводные камни

Доли 4% и 6%, абсолютные показатели успеха на одном внутреннем наборе из 100 задач, их не стоит переносить на реальные условия. Во фрагменте названы результаты только четырёх моделей, хотя оценивали «несколько». Утверждение о «пройденном пороге», вывод команды Anthropic, а не независимая оценка.

«Хотя GLM-5.3 здесь уступает Claude Mythos Preview, значимый порог явно пройден: более ранние модели, такие как Claude Opus 4.6 и GLM-5.2, не справляются ни с одной из них.»

— Anthropic Frontier Red Team, «GLM-5.3 and the spread of advanced cyber capabilities»