Cloudflare выпустила открытые модели решений Clef и Clef-flash и RL-дообучение

Cloudflare выпустила открытые модели решений Clef и Clef-flash и RL-дообучение

Cloudflare выпустила две собственные модели принятия решений (decision models), Clef и Clef-flash. Они размещены на платформе Workers AI, а сами модели полностью открыты на Hugging Face по лицензии Apache 2.0, так что их можно запускать локально. Поводом стал недавний ажиотаж вокруг модели Jev System One от Typesafe AI: по описанию Cloudflare, такая модель выдаёт ограниченные по форме структурированные ответы дёшево, быстро и стабильно и встраивается в рабочий процесс там, где нужно принять решение. В отличие от больших языковых моделей, которые в основном недетерминированы, но достаточно открыты для рассуждений, генерации текста и вызова инструментов, модель решений работает с любым набором входных данных без постоянного переобучения под новые категории.

Модель решений классифицирует вход, чтобы агент мог решить, как действовать. Пример из статьи: на вход подаётся сообщение клиента в поддержку, а модель отвечает, срочно ли оно и какая команда должна его обработать; ответ приходит в виде типизированных значений с вероятностями, по которым код может направить заявку, запустить эскалацию или передать вопрос человеку. В запросе к API задаются вопросы разных типов, например, выбор из вариантов с описанием критериев или оценка по шкале («нет влияния», «небольшое», «серьёзное», «критическое»).

Внутри Cloudflare Clef тестировали в команде Threat Intelligence (анализ угроз) для классификации доменов. В связке с Browser Run модель получает домен и выдаёт вероятности категорий, например, 95% что это сайт моды, 85%, интернет-магазин, меньше 1%, фишинг (это пример формата ответа). В этом сценарии Clef потратила 2,2 с на загрузку, отрисовку и классификацию сайта, а gpt-oss-120b, самая быстрая универсальная языковая модель Cloudflare, 4,7 с и вернула только две классификации. Компания называет это двукратной экономией по задержке и результатам; это один пример, а не усреднённый замер.

Отличия Clef от других моделей решений, по словам Cloudflare: во-первых, есть визуальный кодировщик (vision encoder), поэтому модель классифицирует и изображения, тогда как Jev сегодня работает только с текстом; во-вторых, контекстное окно 64k против 32k у Jev; в-третьих, качество, конкурентное по различным бенчмаркам. Cloudflare утверждает, что Clef сейчас лидирует в Jev Decision Index (результаты опубликованы на демо-сайте), а в собственном наборе тестов Typesafe модели Clef обошли Jev в 3 из 4 областей; отдельно отмечено, что Clef-flash показывает себя очень хорошо с учётом своей скорости. По задержке на 43 тестах Clef опередила другие модели решений, кроме Laya, которая очень быстра, но уступает по качеству. Поскольку модели размещены на GPU Cloudflare на периферии сети, сетевая задержка мала, и Clef можно ставить в горячий путь агента, а действие выполнять одной из LLM на Workers AI. Большая Clef, модель для точных решений, Clef-flash, для решений, критичных к задержке. Выходы строго типизированы и API совместимы с Jev, поэтому заменить Jev можно без переделки. Компания заявляет, что не читает, не хранит и не использует для обучения запросы и ответы, если клиент не пользуется продуктом дообучения.

Устройство модели. Cloudflare начала с демо на основе DiffusionGemma, где детерминированные вероятности получали из logprobs (логарифмов вероятностей) языковой модели; эта работа опиралась на независимое исследование Matt Mastracci. В Clef основой стала другая модель, Qwen. На этапе вывода выполняется только проход prefill, затем параллельно оцениваются допустимые варианты схемы. Шаг принятия решения неавторегрессивный: промежуточный текст токен за токеном не генерируется, поэтому, по словам Cloudflare, Clef заметно быстрее авторегрессивных LLM. Варианты ответа выводятся напрямую из внутренних представлений основы через двухэтапную маршрутизацию внимания. Для Clef заморожена Qwen3.8-27B, для Clef-flash, Qwen3.5-9B (названия версий, как в источнике); совместно с головой маршрутизации обучались низкоранговые адаптеры ранга 256. Дообучение использует кросс-энтропию со сглаживанием меток и потерю Брайера для калибровки вероятностей на внутренних синтетических наборах данных. Дополнительной целью служит метод RLCD (Reinforcement Learning for Calibrated Decisions): он засчитывает частичный успех за соседние порядковые варианты, поощряет полностью точные записи и штрафует отклонение от эталона.

RL-дообучение. Внутри Cloudflare нужны специализированные классификаторы: оценка обращений в Trust & Safety, сортировка запросов в поддержку, определение хорошего или плохого бота в продуктах для ботов. У компании более 15 лет сетевых данных и размеченных решений. Дообучение Clef предлагается сначала как услуга с практическим участием команды forward-deployed engineers (FDE), а позже, как самообслуживаемая платформа, где клиент собирает данные, дообучает и заново разворачивает модель на Cloudflare. Платформа опирается на AI Gateway (сбор запросов в набор данных), Workers AI (генерация прогонов на базовой Clef), Containers (песочница для оценки и повторного воспроизведения действий агента), новый компонент Trainer (обновление весов) и Workers AI с BYO Model (развёртывание дообученной модели). Cloudflare предупреждает, что при дообучении можно потерять часть универсальности ради точности в узкой области. Текст источника обрывается на описании того, из каких разрабатываемых частей платформы это складывается.

Ключевые факты

  • Cloudflare выпустила модели решений Clef и Clef-flash: они доступны на Workers AI, веса открыты на Hugging Face по лицензии Apache 2.0.
  • Модели совместимы с API Jev (Typesafe AI), имеют визуальный кодировщик (Jev, по словам Cloudflare, пока работает только с текстом) и контекстное окно 64k против 32k.
  • По данным самой Cloudflare, Clef лидирует в Jev Decision Index, обошла Jev в 3 из 4 областей набора Typesafe и быстрее других моделей решений на 43 тестах, кроме Laya.
  • В примере с классификацией домена Clef справилась за 2,2 с, а gpt-oss-120b, за 4,7 с и вернула лишь две классификации.
  • Анонсировано RL-дообучение Clef: сначала услуга с командой forward-deployed engineers, позже самообслуживаемая платформа на AI Gateway, Workers AI, Containers и новом Trainer.

Почему это важно

Cloudflare входит в формирующийся класс моделей принятия решений, которые отдают быстрые типизированные ответы с вероятностями вместо свободного текста. Такие модели нужны там, где агент должен детерминированно решить, куда направить заявку, эскалировать ли её или передать человеку. Открытые веса под Apache 2.0 и совместимость с API Jev делают Clef прямой альтернативой Jev, а анонс RL-дообучения показывает, что компания хочет предлагать не только модель, но и платформу для её настройки под свои данные.

Кому это важно

Разработчикам агентных систем, которым нужны дешёвые и быстрые решения в «горячем пути» (маршрутизация обращений, оценка срочности, модерация, классификация доменов или ботов). Командам, уже использующим Jev: переход заявлен как простая замена. Тем, кто работает с изображениями: у Clef есть визуальный кодировщик. Компаниям с большими массивами размеченных решений, которым интересно дообучение под узкую задачу.

Как это применить

Модели доступны через Workers AI: запрос к API содержит состояние (текст) и набор вопросов с типами и критериями, а в ответ приходят типизированные значения с вероятностями. Открытые веса можно скачать с Hugging Face и запускать локально; Большая Clef рассчитана на точность, Clef-flash, на решения, критичные к задержке. Для настройки под свою задачу предлагается дообучение: пока в формате услуги с командой FDE, позже, самообслуживаемая платформа. Цены на хостинг и дообучение в источнике не указаны.

Можно ли доверять

Все сравнения (лидерство в Jev Decision Index, результаты на наборе Typesafe, победа по задержке на 43 тестах) приведены самой Cloudflare; независимая проверка в тексте не упоминается. Таблицы с результатами в тексте не воспроизведены, поэтому конкретных баллов по тестам нет. Пример 2,2 с против 4,7 с, один сценарий из практики Threat Intelligence, а не усреднённый замер. Названия версий Qwen в описании обучения даны как в источнике. Текст статьи обрывается на разделе про RL-платформу.

Риски и подводные камни

Сами Cloudflare предупреждают, что дообучение может ухудшить универсальные способности ради точности в узкой области. Самообслуживаемая платформа дообучения пока только планируется, сроки не названы, а часть её компонентов, разрабатываемые. Данные клиента не используются для обучения, только если он не подключает продукт дообучения. Модели решений не заменяют LLM: они выбирают из заданных вариантов, а действия по-прежнему выполняют другие модели. Результаты бенчмарков стоит перепроверить на собственных данных.