Claude Opus 5 усилила защиту от внедрения инструкций

Борис Черни обратил внимание на раздел system card для Opus 5 на странице 73. Он назвал защиту от prompt injection более важным для него результатом, чем приведённые оценки модели.

По его словам, Opus 5, наименее поддающаяся успешному внедрению инструкций модель Anthropic на сегодняшний день. Черни утверждает, что по проверкам на prompt injection и тестам с имитацией атак провести такую атаку против Opus 5 очень трудно. Само упоминание этой характеристики, по его словам, оказалось не на виду в system card.

Ключевые факты

  • Борис Черни назвал устойчивость Opus 5 к prompt injection особенно важным результатом, помимо оценок модели.
  • Он заявил, что Opus 5, наименее поддающаяся prompt injection модель Anthropic.
  • По словам Черни, проверки на prompt injection и тесты с имитацией атак показывают, что успешно атаковать Opus 5 таким способом очень трудно.
  • Описание этой характеристики находится в разделе system card для Opus 5 на странице 73.

Почему это важно

Prompt injection, один из способов заставить ИИ нарушить ожидаемые инструкции. Черни выделил устойчивость Opus 5 к таким атакам как более значимый для него результат, чем оценки модели.

Кому это важно

Это важно пользователям Opus 5, которым нужна защита от попыток внедрить в запрос нежелательные инструкции, а также тем, кто оценивает безопасность модели.

Как это применить

При оценке Opus 5 стоит изучить раздел system card на странице 73: там, согласно сообщению, приведены результаты проверок на prompt injection и тестов с имитацией атак.

Можно ли доверять

Заявление принадлежит Борису Черни и отсылает к разделу system card для Opus 5. В исходном сообщении не приведены конкретные показатели этих проверок.

Риски и подводные камни

Черни говорит, что успешная prompt injection против Opus 5 очень трудна, а не что она невозможна. Без конкретных результатов проверок из system card нельзя самостоятельно сравнить степень защиты с другими моделями.

«Больше любых этих оценок меня особенно радует другое: Opus 5, наша модель, которую пока труднее всего атаковать с помощью prompt injection. Это немного спрятано в system card, но по проверкам на внедрение инструкций и тестам с имитацией атак успешно провести prompt injection против Opus 5 очень трудно.»

— Борис Черни