Anthropic выпустила Claude Opus 5: сильнее в коде, вдвое дешевле

Anthropic выпустила Claude Opus 5 и описывает её как вдумчивую и проактивную модель, которая по интеллекту приближается к более дорогой Claude Fable 5, но стоит вдвое дешевле. По оценкам на кодинг и интеллектуальный труд (Frontier-Bench, GDPval-AA) Opus 5, новый лидер среди моделей Anthropic, хотя по кибербезопасности всё ещё уступает Claude Mythos 5. Модель стала новой моделью по умолчанию в подписке Claude Max и самой мощной моделью, доступной в Claude Pro.
Opus 5 даёт заметный прирост производительности при той же цене, что и у предшественника, Opus 4.8. На бенчмарке Frontier-Bench v0.1 Opus 5 обходит все остальные модели и более чем вдвое превосходит результат Opus 4.8 при меньшей цене за задачу. На CursorBench 3.2 в режиме максимальных усилий модель показывает результат в пределах 0,5% от пикового результата Fable 5, но при вдвое меньшей цене за задачу; на высоких уровнях усилий она даёт лучшее соотношение результата к цене, чем все остальные модели.
На ARC-AGI 3 (тест на решение новых, ранее не встречавшихся задач) результат Opus 5 втрое выше, чем у ближайшего конкурента. На Zapier AutomationBench, который измеряет способность модели доводить деловые задачи до конца, доля решённых задач у Opus 5 примерно в 1,5 раза выше, чем у следующей по силе модели, при той же цене за задачу; даже на минимальном уровне усилий Opus 5 решает больше задач, чем любая другая модель на любом уровне. На OSWorld 2.0 (тест на управление компьютером) Opus 5 превосходит любую другую модель при любом уровне затрат и обходит лучший результат Fable 5 при цене чуть больше трети от неё.
В научных задачах Opus 5 превосходит Opus 4.8 по всем оценкам, связанным с науками о жизни (структурная биология, органическая химия, биоинформатика). Наибольший прирост, в задачах органической химии, например при определении молекулярной структуры по данным спектроскопии (на 10,2 процентного пункта выше Opus 4.8 по внутреннему тесту Anthropic), и в задачах, связанных с белками, предсказании, как изменения последовательности белка влияют на его функцию (на 7,7 процентного пункта выше).
Anthropic приводит несколько примеров самостоятельности и тщательности модели. На одной из задач Frontier-Bench модели дали чертёж детали механизма и попросили написать код, который восстановит её как 3D-модель в FreeCAD, но намеренно не дали способа напрямую посмотреть на чертёж. Opus 5 написала собственный конвейер компьютерного зрения, чтобы извлечь геометрию из пикселей изображения, и восстановила деталь целиком; она справлялась с этим раз за разом, тогда как ни одна конкурирующая модель с той же постановкой задачи не смогла решить её за пять попыток. В другом случае, получив реальный баг в популярном менеджере пакетов с открытым исходным кодом, Opus 5 нашла первопричину и исправила крайний случай, который пропустил патч сообщества, конкурирующая модель устранила только внешний симптом, но сообщила, что баг исправлен. Инженер трейдинговой фирмы за одну сессию с помощью Opus 5 построил фид рыночных данных для новой биржи, предыдущие модели не справлялись с этой задачей даже при подробных инструкциях инженера; не найдя живого фида для сверки, Opus 5 сама построила тестовый стенд, чтобы проверить корректность разбора данных биржи.
Anthropic публикует также серию отзывов партнёров по раннему доступу, Cursor, Devin, Zapier, Lovable, Box, JetBrains, Kiro и других, которые описывают прирост производительности Opus 5 на своих внутренних задачах: агентном кодинге, финансовом и юридическом анализе, работе с документами и презентациями, код-ревью. В частности, Box сообщила, что Opus 5 превосходит Opus 4.8 на 8% в целом, на 11%, в анализе данных и на 17%, в задачах due diligence (юридической и финансовой проверки).
По словам Anthropic, автоматизированный поведенческий аудит перед выпуском показал, что Opus 5, самая согласованная (aligned) модель компании на сегодняшний день: она лучше следует «Конституции Claude», чем Opus 4.8, Sonnet 5 или Fable 5, показывает наименьшую частоту обманного поведения и наименьшую подверженность попыткам склонить её к вредоносному использованию. При этом по опасным возможностям двойного назначения Opus 5 не продвигает границу возможностей: в тестах, проведённых совместно с частными и государственными партнёрами, модель по-прежнему уступает Mythos 5 в биологических исследованиях и наступательной кибербезопасности; подробности приведены в системной карте модели.
Ключевые факты
- Opus 5 стоит столько же, сколько предшественник Opus 4.8, но более чем вдвое превосходит его на бенчмарке Frontier-Bench v0.1
- На ARC-AGI 3 (новые, ранее не встречавшиеся задачи) результат втрое выше ближайшего конкурента; на Zapier AutomationBench даже минимальный режим усилий обходит все остальные модели
- В науках о жизни прирост к Opus 4.8 наибольший в органической химии (+10,2 процентного пункта на определении структуры по спектроскопии) и в задачах о влиянии мутаций белка (+7,7 п.п.)
- Модель стала моделью по умолчанию в Claude Max и самой мощной доступной в Claude Pro
- По оценке Anthropic Opus 5, самая согласованная модель компании на сегодня, но по опасным возможностям двойного назначения (биология, наступательная кибербезопасность) она по-прежнему уступает модели Mythos 5
Почему это важно
Opus 5, новый флагман линейки Claude: по заявлению Anthropic, он приближается по интеллекту к более дорогой модели Fable 5, но стоит вдвое дешевле, и на нескольких значимых бенчмарках (Frontier-Bench, ARC-AGI 3, Zapier AutomationBench, OSWorld 2.0) обгоняет как предшественника Opus 4.8, так и другие модели при сравнимой или меньшей цене за задачу. Отдельно выделены случаи самостоятельной работы модели: она писала собственный код для решения задачи, для которой её не подготовили напрямую (реконструкция 3D-детали по чертежу без прямого доступа к изображению), находила первопричину бага, который не поймал патч сообщества, и строила собственный тестовый стенд там, где не было готовой инфраструктуры для проверки.
Кому это важно
В первую очередь, разработчикам и командам, использующим агентный кодинг (партнёры по раннему доступу, Cursor, Devin, JetBrains, Kiro, Lovable), а также компаниям, автоматизирующим бизнес-процессы (Zapier) и работающим с большими объёмами документов и данных: финансовым аналитикам, юристам (Box сообщает о приросте на 17% в due diligence), исследователям в науках о жизни, структурной биологии, органической химии, биоинформатике.
Как это применить
Claude Opus 5 доступен уже сегодня: он стал новой моделью по умолчанию в подписке Claude Max и самой мощной моделью, доступной в Claude Pro. Модель поддерживает настраиваемый уровень «усилия» (effort), от минимального до максимального, что позволяет выбирать между скоростью/стоимостью и качеством результата под конкретную задачу. Она также встраивается в сторонние продукты партнёров, Cursor, JetBrains IDE, Kiro, Zapier и другие.
Можно ли доверять
Оценки производительности и приведённые отзывы партнёров исходят от самой Anthropic и её коммерческих партнёров, поэтому это, по сути, маркетинговый материал компании, а не независимая проверка. По словам Anthropic, автоматизированный поведенческий аудит перед выпуском показал, что Opus 5, самая согласованная (aligned) её модель на сегодня: она лучше соблюдает «Конституцию Claude», реже проявляет обманное поведение и меньше подвержена попыткам её обмануть для вредоносного использования, чем предыдущие модели. Более подробные данные по безопасности приводятся в отдельной системной карте модели, на которую ссылается сама компания.
Риски и подводные камни
Все приведённые числа, из внутренних тестов и бенчмарков Anthropic, а отзывы о работе модели, от компаний-партнёров, заинтересованных в продвижении своих интеграций с Claude; независимой сторонней проверки этих цифр в тексте нет. Anthropic отдельно отмечает, что, несмотря на общий прогресс, по опасным возможностям двойного назначения, биологическим исследованиям и наступательной кибербезопасности, Opus 5 по-прежнему уступает модели Mythos 5, то есть не выходит на новый уровень риска в этих направлениях.
«Это вдумчивая и проактивная модель, которая по интеллекту приближается к передовому уровню Claude Fable 5, но стоит вдвое дешевле.»
— Anthropic, анонс Claude Opus 5