В GitHub запустили livenerf: проверку, не ухудшили ли Claude Opus 5.5

В GitHub запустили livenerf: проверку, не ухудшили ли Claude Opus 5.5

В репозитории livenerf на GitHub (аккаунт ninjahawk) идёт долгосрочный бенчмарк с заранее зарегистрированным протоколом. Он отвечает на один вопрос: становится ли модель хуже после выхода. Автор README напоминает, что месяцами ходят слухи, будто Anthropic «ухудшает» модели через дни или недели после релиза. Возможные механизмы, которые он перечисляет: квантизация, более маленькая модель под тем же названием, сниженный уровень усилия (effort) или изменения маршрутизации. Не исключено и то, что ничего не менялось, а люди принимают шум за закономерность. Чистого замера «нулевого дня» раньше ни у кого не было, поэтому споры сводились к впечатлениям против впечатлений.

Claude Opus 5.5 вышла 2026-09-22, и это шанс запустить отсчёт с первого дня. Первый прогон состоялся 2026-09-24 в 22:10 UTC, примерно через 2,5 суток после релиза. Серия идёт раз в день 30 дней: дни 1, 10, базовый уровень, затем два 10-дневных окна. Первый возможный вывод, около 2026-10-24, первая строка результатов появится после 20-го дня. Состояние на 2026-09-29: собрано 6 дней из 30 (базовых 6 из 10), пропусков нет. Каждый день делается полные 90 прогонов на одной и той же версии тестового обвеса (хеш 461391b6fce64167) и зафиксированной версии Claude Code CLI 2.1.280. В день 5 один раз был принудительно отключён ограничитель бюджета. Данных о дрейфе качества пока нет.

Модели нельзя сделать детерминированными: параметры сэмплирования убраны, а размышление отключить нельзя. Поэтому livenerf фиксирует всё остальное (замороженные промпты, закреплённый CLI, точные проверяющие функции, сырые логи навсегда) и измеряет дрейф статистически. Сейчас v0 работает на подписке Claude Max через headless-режим Claude Code (claude -p), без API-ключа. Проект построен на Inspect, открытом фреймворке оценки от UK AI Security Institute, а статистика следует материалу Anthropic «Adding Error Bars to Evals».

Набор вопросов (панель) отбирали так: 2 336 вопросов из GPQA Diamond, MMLU-Pro, соревновательной математики и AIME 2025, 26 прогнали по 4 раза. Opus 5.5 с первой попытки отвечает верно примерно на 93%, а 97% вопросов оказались «всегда верно» или «всегда неверно». Только 78 вопросов модель решает иногда, они и составляют панель, потому что только на них можно заметить падение. Из-за такого отбора вопросы кажутся ближе к 50/50, чем есть: на новых прогонах доля верных ответов по ним выросла с 54,7% до 62,0%, и расчёт мощности использует новые значения. Один прогон всей панели в день позволяет заметить изменение точности около 7,5 пункта за 10-дневное окно и тратит около 3,6% недельного лимита плана.

Валидация прошла заранее заданный критерий. Известную деградацию прибор видит: эффорт low даёт −62% выходных токенов и −8,3 ± 4,5 пункта точности, эффорт medium, −26% токенов и −4,2 ± 3,9 пункта. Замена на Opus 5 при уровне 99% неотличима от Opus 5.5 (−3,8 ± 6,3 пункта, −23% токенов). Автор прямо пишет: прибор не способен заметить такую подмену модели того же семейства на объёме выборки одной валидации; в 10-дневном окне выборка примерно в 2,5 раза больше, но достаточность этого пока не показана.

Аудит 78 вопросов (вместе с двумя позже исключёнными) нашёл 8 ответов в ключе, которые выглядят неверными, и 30 неоднозначных вопросов. Ничего не убирали, зато заранее зарегистрирован анализ чувствительности без них. Классификатор безопасности иногда отвечает моделью Opus 5 или отказывается отвечать на вопросы по биологии и часть вопросов по математике: такие образцы отбраковываются и считаются, а затронутые вопросы исключаются.

Главная метрика, парная разница баллов по каждому вопросу относительно базового уровня с кластеризованными стандартными ошибками. Второй по важности сигнал, число выходных токенов на образец: если модель тихо начинает «думать» меньше, это может проявиться раньше падения точности. Решающее правило: изменение должно выйти за 99%-й интервал в обоих следующих 10-дневных окнах, составить не менее 3 пунктов и не проявиться в контрольной ветке. Контрольная ветка, модель claude-opus-5, которой ежедневно дают GPQA-вопросы панели через тот же обвес. Если двигаются обе модели, значит изменились обвес или платформа, а не Opus 5.5. Правило применяется механически модулем livenerf.analysis.

Автор оговаривает ограничения. Измеряется Opus 5.5 в том виде, как её отдаёт Claude Code по подписке, а не сырая модель через API. Базовая неделя запуска, точка отсчёта, а не истина: она может оказаться худшей неделей. Инциденты качества 2025 года, по словам автора, оказались инфраструктурными багами, а не намеренным ухудшением, поэтому livenerf проверяет изменения в обе стороны и не предполагает механизма. Дальше в README описаны установка, закрепление CLI, бюджеты в процентах недельного лимита и запуск по расписанию: попытка пропускается, если недельный счётчик плана не меньше 75% или пятичасовой не меньше 60%; повтор идёт каждый час.

Ключевые факты

  • livenerf, публичный бенчмарк с заранее зарегистрированным протоколом: раз в день 30 дней гоняет Claude Opus 5.5 по фиксированной панели из 78 «иногда решаемых» вопросов (GPQA Diamond, MMLU-Pro, математика, AIME).
  • Серия стартовала 2026-09-24, через ~2,5 суток после релиза 2026-09-22; на 2026-09-29 собрано 6 дней из 30, все базовые, выводов о дрейфе пока нет, первый возможный вердикт, около 2026-10-24.
  • Чувствительность: около 7,5 пункта точности за 10-дневное окно; валидация показала −8,3 ± 4,5 пункта при effort low, но подмену на Opus 5 (−3,8 ± 6,3) при 99% не отличила.
  • Правило решения: сдвиг должен выйти за 99%-й интервал в двух 10-дневных окнах подряд, быть не менее 3 пунктов и не повториться у контрольной модели claude-opus-5.
  • Замеряется Opus 5.5 через Claude Code по подписке Max, а не сырой API; базовая неделя запуска сама может быть худшей.

Почему это важно

Слухи о том, что Anthropic тихо «ухудшает» модели через дни или недели после выхода, ходят давно, но, как пишет автор README, чистого замера первого дня ни у кого не было, и споры шли на уровне впечатлений. livenerf пытается заменить их статистикой: замороженные задания, закреплённая версия CLI, точная проверка ответов без LLM-судьи и сырые логи. Ценность в том, что отсчёт начат почти с момента релиза Opus 5.5 и протокол опубликован заранее: публичная отметка времени в git придаёт предварительной регистрации смысл.

Кому это важно

Разработчикам и командам, которые строят продукты на Claude и хотят понимать, меняется ли качество модели без объявления. Исследователям оценки моделей, как пример дизайна с парными повторяющимися вопросами, кластеризованными ошибками и контрольной ветвью. Всем, кто следит за спорами о «нерфе» моделей: проект обещает проверяемые числа, а не мнения, но первые числа о дрейфе появятся не раньше конца октября.

Как это применить

Репозиторий открыт: нужны Python 3.11+, uv и залогиненный Claude Code; v0 рассчитан на подписку Max, но подойдёт всё, где работает claude -p. Установка, git clone и uv sync. CLI нужно закрепить (отключить автообновление, записать версию в файл) и сохранить копию нужного бинарника. Бюджет задаётся в пунктах недельного счётчика плана, а ежедневный запуск настраивается через cron или задачу Windows. Позже можно перейти на API, сменив только строку модели. Следить за результатами можно в таблице Results в репозитории; вопросы автор просит задавать в Discussions или issues.

Можно ли доверять

Методология описана подробно и заранее: используются Inspect от UK AI Security Institute и подход из статьи Anthropic об ошибках в оценках, протокол зафиксирован до серии. Автор честно указывает слабости: прибор не отличил подмену на Opus 5 на объёме одной валидации, 8 ответов в ключе выглядят неверными, а 30 вопросов неоднозначны. Но это самоописание одного проекта: README не называет автора, а единственный идентификатор, аккаунт ninjahawk на GitHub. Независимых оценок и реакции Anthropic в материале нет. Вывод о «нерфе» делать рано: собраны только базовые дни.

Риски и подводные камни

Во-первых, панель маленькая (78 вопросов), а отбор «иногда верных» вопросов даёт смещение, которое автор измерил сам (54,7% против 62,0% на новых прогонах). Во-вторых, измеряется модель в связке с Claude Code и подпиской, а не чистый API; смена обвеса выглядит как смена модели, поэтому версия CLI зафиксирована. В-третьих, неделя запуска может быть нетипично плохой, так что дельта относительно неё не равна истине. В-четвёртых, классификатор безопасности иногда подменяет ответ Opus 5 или отказывается отвечать, и такие образцы приходится отбраковывать. Наконец, ограничитель бюджета в день 5 один раз был принудительно переопределён, это отражено в журнале отклонений.

«Неделя запуска вполне может оказаться худшей неделей: новая инфраструктура обслуживания, нехватка мощностей, ошибки запуска.»

— README проекта livenerf