Arena.ai: у Claude Fable 5.1 меньше штампов и оговорок, чем у Fable 5

Arena.ai: у Claude Fable 5.1 меньше штампов и оговорок, чем у Fable 5

Аналитическая компания Arena.ai сравнила, как изменился стиль письма Claude при переходе с версии Fable 5 на Fable 5.1 у Anthropic. Основа анализа, десятки тысяч ответов модели на сложные, требующие развёрнутых рассуждений запросы платформы Text Arena.

Главный вывод: в ответах Fable 5.1 реже встречаются типовые фразы-согласия в начале реплики, реже используется тире и слова-уверения вроде «honestly» и «frankly» (откровенно, честно говоря), при этом сами ответы стали длиннее. Медиана длины ответа выросла на 30%: с 319 слов у Fable 5 до 414 слов у Fable 5.1. Это всё равно на 21% короче медианных 525 слов у старшей модели Anthropic, Opus 5.

По конкретным категориям языка: частота шаблонных оборотов, в разборе как пример приведено само словосочетание «load-bearing», буквально «несущий», «опорный», упала на 20% на 1000 слов. Частота слов-оговорок вроде «perhaps» и «arguably» (возможно, пожалуй) снизилась на 36%. Хвалебные и одобрительные формулировки, то, что авторы разбора называют validation, то есть фразы, подтверждающие правоту собеседника, встречаются в 1,98% ответов Fable 5.1 против 3,17% у Fable 5.

Изменился и словарный состав: доля длинных значимых слов (content words, то есть слов, несущих смысл, а не служебных частиц) снизилась с 42,6% до 38,6%, а число абстрактных существительных на 100 слов упало на четверть, с 4,39 до 3,28.

Ключевые факты

  • Arena.ai проанализировала десятки тысяч ответов Claude на сложные, требующие рассуждений запросы платформы Text Arena, сравнив стиль Fable 5 и Fable 5.1.
  • Медиана длины ответа выросла на 30%, с 319 до 414 слов, но это всё равно на 21% короче медианных 525 слов у Opus 5.
  • Частота шаблонных фраз вроде «load-bearing» (на 1000 слов) упала на 20%, а слов-оговорок вроде «perhaps» и «arguably», на 36%.
  • Хвалебно-одобрительные формулировки встречаются в 1,98% ответов Fable 5.1, против 3,17% у Fable 5.
  • Доля длинных значимых слов снизилась с 42,6% до 38,6%, а абстрактных существительных на 100 слов, на 25% (с 4,39 до 3,28).

Почему это важно

Это редкий случай, когда смену «голоса» модели между версиями, Fable 5 и Fable 5.1, измерили количественно со стороны, а не описали словами самого разработчика. Anthropic обычно объявляет обновления через рост возможностей и результаты тестов, здесь независимая аналитическая компания Arena.ai показывает, как на практике меняется сама манера письма, на выборке из десятков тысяч реальных ответов, а не на паре примеров. Заголовок разбора играет словами: он утверждает, что язык Fable 5.1 стал менее load-bearing (буквально, «несущим», «опорным»), а сам термин load-bearing, один из примеров штампов, чья частота, по данным разбора, упала. Это часть более широкой тенденции в индустрии, избавлять модели от узнаваемых «ИИ-тиков»: лишних оговорок, дежурных одобрений и вступительных фраз-согласий, которые давно и часто критикуют пользователи.

Кому это важно

Разбор адресован тем, кто выбирает или настраивает модель для конкретной задачи: командам, которые строят продукты на API Claude и зависят от длины и тона ответа по умолчанию; промпт-инженерам, которые подгоняли системные подсказки под старые «тики» модели, лишние оговорки, дежурные согласия, и теперь могут это пересмотреть; самой Anthropic и её команде настройки моделей, как внешняя проверка того, куда сдвинулся стиль; и компаниям вроде Arena.ai, для которых подобный количественный разбор стиля моделей, часть их собственного продукта.

Как это применить

Для тех, кто уже работает с Fable 5.1: закладывайте более длинный ответ по умолчанию, медиана выросла на 30% (до 414 слов), и это может задеть лимиты на длину вывода или вёрстку интерфейса, рассчитанную под прежний объём. Ждите меньше дежурных оговорок и одобрительных вступлений, тон читается более прямым, но переставать просить модель уточнять неопределённость не стоит: сама находка говорит про манеру письма, а не про точность ответов. Для задач, где нужна максимальная глубина, разница с Opus 5 (у него ответы в среднем длиннее) в этом разборе сохраняется, выбор между линейками Fable и Opus по-прежнему зависит от того, важнее глубина ответа или скорость и стоимость.

Можно ли доверять

Это статистический разбор одной аналитической компании (Arena.ai), пересказанный изданием The Decoder, а не отдельно опубликованное исследование. В тексте не указаны: точный размер выборки (только «десятки тысяч» ответов), дата замера или выхода Fable 5.1, имя конкретного исследователя и методика подсчёта каждой категории, как именно распознавались шаблонные фразы, оговорки или абстрактные существительные. Сравнение дано только с Opus 5, то есть внутри линейки самой Anthropic; данных о том, как эти же показатели выглядят у моделей других разработчиков, в разборе нет. Причины изменений, целенаправленная настройка, реакция на отзывы пользователей или что-то ещё, источник тоже не называет.

Риски и подводные камни

Меньше оговорок и одобрительных фраз, это показатель стиля, а не точности: модель, которая реже говорит «возможно», не обязательно чаще права, она может просто увереннее звучать при той же доле ошибок. Рост медианной длины ответа на 30% сам по себе не означает, что ответы стали содержательнее, источник измеряет объём и частоту оборотов, а не полезность или правильность содержания. Стоит не путать статистическую находку с оценкой качества: «менее load-bearing язык», это про манеру письма, а не про то, умнее или надёжнее стала модель.