Zhipu заявила: GLM-5.3 находит уязвимости лучше моделей Anthropic и OpenAI

Zhipu заявила: GLM-5.3 находит уязвимости лучше моделей Anthropic и OpenAI

Китайская компания Zhipu на прошлой неделе выпустила модель GLM-5.3 и заявила, что та не уступает американским моделям в поиске уязвимостей. В собственном анонсе компания привела данные бенчмарка CyberGym (тест способности модели решать реальные задачи по кибербезопасности), по которым GLM-5.3 обходит Fable 5 (модель Anthropic) и GPT-5.6 Sol (модель OpenAI). Точных цифр отрыва, процентов или баллов, компания не назвала, только сам факт превосходства.

Zhipu процитировала своё заявление: «По мере масштабирования пост-тренинга киберспособности модели развились быстрее, чем мы ожидали. GLM-5.3 задаёт стандарт на CyberGym для поиска уязвимостей, и наибольший прирост, на более поздних этапах цепочки эксплойта». Компания также написала, что модель «не просто научилась лучше находить отдельные изъяны: она начала рассуждать сразу о нескольких этапах эксплуатации, выстраивая цельные планы полных цепочек эксплойтов».

Zhipu протестировала модель вместе с китайскими компаниями на реальных кодовых базах и сообщила, что GLM-5.3 нашла 2436 уязвимостей в 269 проектах, из них 1097, средней или высокой степени опасности. Находки затронули ядра систем, операционные системы, движки браузеров, инфраструктуру с открытым кодом, веб-приложения и сетевые протоколы. По словам компании, «многие оставались незамеченными годами, а то и десятилетиями, самая старая, примерно 40 лет». Названий китайских компаний-партнёров по тестированию, а также сведений о том, были ли найденные уязвимости раскрыты, устранены или получили номера CVE, в анонсе нет.

При этом на других бенчмарках безопасности и кода (без указания конкретных названий) GLM-5.3 показала себя хуже западных моделей. Обозреватель The Register Саймон Шарвуд считает: сам факт, что модель настолько сильна именно в поиске багов, говорит, что Китай не сильно отстаёт в способности искать дыры в софте конкурентов, и что эту способность он развил очень быстро после дебюта модели Anthropic Mythos. По мнению автора, преимущество, которое, как казалось, было у США как у родины Anthropic, из-за этого сошло на нет.

Ключевые факты

  • Zhipu выпустила модель GLM-5.3 и заявила о превосходстве над Fable 5 (Anthropic) и GPT-5.6 Sol (OpenAI) на бенчмарке CyberGym для поиска уязвимостей, без указания точных цифр отрыва
  • При тестах с китайскими компаниями на реальном коде GLM-5.3 нашла 2436 уязвимостей в 269 проектах, из них 1097, средней или высокой опасности
  • Самая старая из найденных уязвимостей не замечалась около 40 лет
  • На других бенчмарках безопасности и кода GLM-5.3 уступила западным моделям
  • Обозреватель The Register делает вывод: Китай быстро догнал возможности Anthropic в поиске уязвимостей после дебюта модели Mythos

Почему это важно

Поиск уязвимостей в коде с помощью ИИ, одна из самых чувствительных областей: те же способности, что помогают защитникам находить и чинить дыры, помогают и атакующим их эксплуатировать. Заявление Zhipu, сигнал, что китайские модели быстро подтягиваются к возможностям Anthropic и OpenAI именно в этой узкой, но критичной нише, а не только в общих способностях к кодингу.

Кому это важно

Специалистам по безопасности и разработчикам, которые оценивают ИИ-инструменты для поиска уязвимостей (SAST/багхантинг); аналитикам, следящим за гонкой китайских и западных лабораторий в области ИИ; компаниям, чей код может стать объектом сканирования такими моделями, как для защиты, так и для атаки.

Как это применить

Цифры и претензии в статье, это данные из собственного анонса Zhipu, не независимая верификация: ни точный отрыв на CyberGym, ни названия сравнительных бенчмарков, на которых GLM-5.3 уступила западным моделям, не раскрыты. Прежде чем делать выводы о реальном уровне модели, стоит дождаться независимых замеров или публикации самого бенчмарка CyberGym с результатами.

Можно ли доверять

Данные исходят от самой Zhipu, заинтересованной стороны, это не сторонняя оценка. Автор статьи Саймон Шарвуд из The Register прямо отмечает, что на других тестах безопасности и кода GLM-5.3 показала результат хуже западных моделей, то есть превосходство ограничено конкретным бенчмарком CyberGym, а не общее.

Риски и подводные камни

Модель, которая эффективно находит уязвимости, по своей природе двулика: то же умение годится и для защиты (патчинг), и для атаки (эксплуатация). Статья не сообщает, устранены ли найденные 2436 уязвимостей и присвоены ли им CVE-номера, то есть неясно, стали ли эти находки полезнее для защиты или остаются точкой уязвимости, пока не закрыты.

«По мере масштабирования пост-тренинга киберспособности модели развились быстрее, чем мы ожидали. GLM-5.3 задаёт стандарт на CyberGym для поиска уязвимостей, и наибольший прирост, на более поздних этапах цепочки эксплойта»

— Zhipu, из анонса GLM-5.3