Anthropic выпустила Claude Opus 5.5, новый флагман на 40% дешевле Opus 5

Anthropic выпустила Claude Opus 5.5, первую модель нового семейства Claude 5.5 и первый релиз компании после того, как она призвала «сдерживать темп фронтира». По собственным тестам Anthropic, новая модель работает на уровне Claude Fable 5.1 на большинстве задач, но стоит на 40% дешевле в эксплуатации, чем предыдущий флагман Opus 5, и генерирует ответы более чем на 30% быстрее.
В производительности компания приводит несколько внутренних тестов: один из ранних пользователей завершил с помощью Opus 5.5 миграцию кода объёмом 680 000 строк меньше чем за день, работу, которая заняла бы у инженерной команды недели. Когда модели поручили сократить время загрузки на всех страницах веб-приложения, Opus 5.5 справилась с задачей в 39 случаях из 40, тогда как Opus 5 вносила менее заметные улучшения и попутно меняла поведение приложения.
По безопасности Opus 5.5 показала лучший результат среди всех моделей Anthropic на автоматизированном поведенческом аудите, самом полном тесте на согласованность поведения, который проводит компания. Модель реже склонна к труднообратимым действиям и действиям за пределами заданных границ, а также более устойчива к атакам prompt injection, чем Opus 5. Перед релизом её тестировали внешние оценщики Frontier Design и METR. Поскольку по возможностям в биологии и кибербезопасности Opus 5.5 сопоставима с Claude Mythos 5.1, Anthropic разворачивает её с теми же защитными мерами, что и у Fable 5.1: проверенные организации уже могут подать заявку в Life Sciences Verification Program для биологических исследований, а в ближайшие недели расширится доступ к Cyber Verification Program для специалистов по кибербезопасности.
Цены на стандартный режим снижены: входные токены стоят $4, выходные, $20 за миллион (на 20% дешевле Opus 5), а чтение из кэша, на которое приходится большая часть затрат в агентной работе и кодинге, $0.20 за миллион токенов (на 60% дешевле). В Claude Code и на Claude Platform доступен более быстрый Fast-режим по $8 за миллион входных и $40 за миллион выходных токенов, с ускорением до 2,5 раза. Anthropic также увеличила пятичасовые лимиты использования на тарифах Pro, Max, Team и корпоративных планах с местами и добавила возможность сохранять сброс лимита и использовать его позже по выбору.
В кодинге ранний тестировщик провёл аудит и исправление кодовой базы объёмом 200 000 строк за неполные три часа, у Opus 5 на ту же работу ушло больше 20 часов и в 2,5 раза больше токенов. В внутреннем тесте на перевод HAProxy (широко используемого ПО для балансировки веб-трафика) с C на Rust обе модели, Opus 5.5 и Fable 5.1, прошли почти все регрессионные тесты HAProxy, но Opus 5.5 справилась за 9,5 часа против 12 у Fable 5.1 и обошлась на 51% дешевле. На бенчмарке FrontierCode при стандартных настройках Opus 5.5 обходит GPT-6 Astra примерно за 20% его стоимости на задачу; на Terminal Bench 4.0 показывает результат Astra примерно за 40% стоимости; на CursorBench обгоняет GPT-5.6 Sol на 11 баллов примерно за треть стоимости. Схожую экономию токенов и времени подтвердили клиенты Anthropic, GitHub, Clio, Lovable, Quantium, Spotify, Optiver, Column и Kiro; в частности, в Quantium сложная задача, ранее требовавшая 38 запросов и четырёх дней, с Opus 5.5 уложилась в 11 запросов и три часа, а в Optiver переход на новую модель сократил стоимость агентных задач по кодингу на 40, 50% при том же качестве.
В работе со знаниями Opus 5.5 тестировали на подготовке отчёта о квартальных показателях компании по труднодоступным источникам: автоматический проверяющий сверял каждую цифру и цитату с источниками, и 16 из 18 отчётов Opus 5.5 (при разных уровнях усилий) прошли планку качества Anthropic, тогда как ни Fable 5.1, ни Opus 5 не прошли её ни разу. Инвестиционная компания Walleye Capital, ранний тестировщик, сообщила, что Opus 5.5 в основном решила её оценочный набор задач уже на минимальных настройках, а на более высоких, заметила и исправила ошибку в самих условиях задания, которую не находила ни одна другая модель. На бенчмарке GDPval-AA v2.1, охватывающем реальную работу по 44 профессиям, Opus 5.5 набрала 1846 очков Elo, обойдя Fable 5.1 и Opus 5; при стандартном (среднем) уровне усилий она превосходит GPT-6 Astra на максимальном уровне усилий примерно за пятую часть стоимости на задачу.
Opus 5.5 также пишет более естественно и понятно, чем предыдущие модели: ранние тестировщики отметили, что важное она ставит в начало текста и что с ней проще работать в долгих сессиях. Anthropic называет это не только удобством, но и элементом безопасности, такой текст проще проверять.
Claude Sonnet 5.5 и Claude Haiku 5.5 с частью тех же улучшений производительности, эффективности и безопасности выйдут «в ближайшие недели»; цены на них пока не объявлены.
Ключевые факты
- Opus 5.5, первая модель семейства Claude 5.5: работает на уровне Fable 5.1, но на 40% дешевле в эксплуатации, чем Opus 5, и генерирует ответы более чем на 30% быстрее
- Цены стандартного режима: $4 / $20 за млн входных/выходных токенов (−20%), кэш-чтение $0.20 за млн (−60%); Fast-режим в Claude Code и на Claude Platform, $8/$40 за млн токенов с ускорением до 2,5 раза
- В кодинге: аудит кодовой базы на 200 000 строк за неполные три часа против 20+ часов у Opus 5; перевод HAProxy с C на Rust за 9,5 часа против 12 у Fable 5.1 и на 51% дешевле
- Лучший результат Anthropic на автоматизированном поведенческом аудите и повышенная устойчивость к prompt injection; до релиза модель тестировали внешние оценщики Frontier Design и METR
- По биологии и кибербезопасности Opus 5.5 сопоставима с Claude Mythos 5.1, поэтому развёрнута с теми же защитными мерами, что и Fable 5.1; Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие недели без объявленных цен
Почему это важно
Claude Opus 5.5, первая модель нового семейства Claude 5.5 и первый релиз Anthropic после того, как компания призвала «сдерживать темп фронтира». По собственным тестам Anthropic, модель работает на уровне Claude Fable 5.1 на большинстве задач, но стоит на 40% дешевле в эксплуатации, чем предыдущий флагман Opus 5, и генерирует ответы более чем на 30% быстрее, то есть компания одновременно повышает планку возможностей и снижает цену входа в них.
Кому это важно
В первую очередь, разработчикам и компаниям, строящим агентов для работы с кодом: GitHub, Clio, Lovable, Quantium, Spotify, Optiver, Column и Kiro сообщили Anthropic о заметном росте эффективности при переходе на Opus 5.5. Дальше, аналитикам и специалистам по финансовой и консалтинговой работе: модель показала сильные результаты в подготовке отчётов и финансовом моделировании. И отдельно, проверенным организациям в биологии и кибербезопасности, которым Anthropic открывает доступ к возможностям модели через свои верификационные программы.
Как это применить
В стандартном режиме Opus 5.5 стоит $4 за миллион входных и $20 за миллион выходных токенов (на 20% дешевле Opus 5), а чтение из кэша, $0.20 за миллион токенов (на 60% дешевле). В Claude Code и на Claude Platform доступен более быстрый Fast-режим, $8/$40 за миллион токенов при ускорении до 2,5 раза. Anthropic увеличила пятичасовые лимиты использования на тарифах Pro, Max, Team и корпоративных планах с местами и добавила возможность сохранять сброс лимита про запас. Организациям, которым нужен доступ к возможностям модели в биологии, стоит подать заявку в Life Sciences Verification Program (уже открыта); доступ для специалистов по кибербезопасности через Cyber Verification Program расширится в ближайшие недели.
Можно ли доверять
Заявления в посте, это данные самой Anthropic: сравнения с Opus 5 и конкурентами (GPT-6 Astra, GPT-5.6 Sol) получены во внутренних тестах компании, а цитаты клиентов, GitHub, Clio, Lovable, Quantium, Spotify, Optiver, Column, Kiro, собраны и опубликованы тем же постом. Из независимой проверки, немногое: до релиза модель тестировали внешние оценщики Frontier Design и METR, а устойчивость к prompt injection проверяла сторонняя фирма по безопасности Gray Swan, на чьём бенчмарке Opus 5.5 сравнялась с Fable 5.1 по наименьшей доле успешных атак среди всех проверенных моделей. Сама Anthropic оговаривается, что на достигнутом уровне возможностей разрыв в баллах бенчмарков, менее надёжный ориентир, чем раньше, и что на практике отрыв Opus 5.5 от Fable 5.1 меньше, чем показывают тесты.
Риски и подводные камни
Opus 5.5 сопоставима с Claude Mythos 5.1 по возможностям в биологии и кибербезопасности, поэтому Anthropic разворачивает её с теми же ограничениями, что и Fable 5.1, доступ к чувствительным возможностям открыт только через верификационные программы. Дата общей доступности самой Opus 5.5 в посте не названа; Sonnet 5.5 и Haiku 5.5 анонсированы без цен и без точного срока, только «в ближайшие недели». Доступный текст источника обрывается на середине последней клиентской цитаты, поэтому часть подробностей о работе на низких уровнях усилий осталась за кадром.
«Я поставил Claude Opus 5.5 масштабную инженерную задачу сразу по шести нашим репозиториям и запустил её на ночь без присмотра. Модель не сбивалась с задачи больше 18 часов, определяя, как наши сервисы должны взаимодействовать друг с другом, и прорабатывая применение этой логики. По сравнению с Opus 5 она быстрее доходила до контрольных точек и почти не требовала доработки. Комментарии в коде были короткими и по делу, а не длинными и многословными. Мне трудно найти, что сказать плохого.»
— Шон Хайнц, ведущий разработчик, Clio