Ornith выпустила Ornith-1.5, модели наравне с Claude Opus 4.8 в кодинге

Компания Ornith выпустила Ornith-1.5, семейство из трёх открытых моделей: флагманскую Ornith-1.5-397B и Ornith-1.5-35B (архитектура MoE, смесь экспертов, на каждый токен активируется лишь часть параметров) и компактную Ornith-1.5-9B (архитектура Dense, плотная, без разрежения). Ornith-1.5 развивает Ornith-1.0, построенную поверх моделей Qwen3.5 и Gemma 4 с дополнительным обучением. Главное нововведение версии 1.5, модель сама себе устраивает процесс обучения: предлагает себе новые, всё более сложные задачи, строит под каждую задачу обвязку (набор инструментов, инструкций и стратегию решения) и генерирует прогоны-решения (rollouts), на которых учится через обучение с подкреплением.
Каждый цикл обучения состоит из трёх шагов. Сначала система, опираясь на конкретную среду или кодовую базу, общие инструкции по типу задач и историю уже решённых моделью задач, предлагает задачу чуть сложнее тех, что модель уже умеет решать. Затем модель строит или уточняет обвязку под эту конкретную задачу. Наконец, по связке «задача плюс обвязка» модель генерирует прогон решения, который оценивается и превращается в сигнал для обучения. Награда распространяется на все три шага сразу, поэтому со временем улучшается не только качество решений, но и качество самих задач и обвязки. Награда за задачу считается как произведение трёх множителей, валидность, сложность и новизна, так что нулевая валидность обнуляет всю награду целиком, даже если задача выглядит сложной. Целевой уровень сложности задан так, чтобы модель успешно решала предложенную задачу примерно в 20% попыток, достаточно редко, чтобы это было информативно для обучения, но не настолько редко, чтобы не набралось успешных примеров. Отдельно вознаграждается сам механизм оценки: за то, насколько верно он отражает условие задачи, насколько его оценка соответствует реальному качеству решения и насколько он устойчив к сбоям и попыткам его обмануть. Генерация задач, обвязки и решений обучается совместно одним и тем же алгоритмом, GRPO.
На флагманском уровне Ornith-1.5-397B набирает 86.1 балла на Terminal-Bench 2.1 и 56.0 на DeepSWE, по заявлению Ornith, это на уровне Claude Opus 4.8 (85.0 и 59.0 соответственно) и выше открытых GLM-5.2 (82.7 и 46.2) и DeepSeek-V4-Flash-0731 (82.7 и 54.4). Ornith-1.5-35B, несмотря на то что активирует лишь 3 млрд параметров на токен, на агентном кодинге обгоняет более тяжёлые плотные модели, Gemma 4-31B и Muse Glimmer-30B от Meta: 68.5 против 43.4 и 51.7 на Terminal-Bench 2.1, 79.0 против 52.0 и 76.0 на SWE-Bench Verified; по всем тестам кодинга и агентных задач она также обходит одноразмерную Qwen 3.6-35B. Компактная Ornith-1.5-9B, с квантованной версией Ornith-1.5-9B-Mobile, которая разворачивается прямо на iPhone и Android, набирает 47.0 на Terminal-Bench 2.1 и 70.6 на SWE-Bench Verified, обгоняя более крупные Gemma 4-31B и Qwen 3.6-35B.
Все приведённые цифры, из собственного блога Ornith; компания сообщает, что усредняла каждый результат по пяти независимым прогонам, но независимой проверки заявлений нет. В тексте также есть внутренние нестыковки в том, по какому именно варианту Terminal-Bench 2.1 (через фреймворк Terminus-2 или через Claude Code) считались отдельные сравнения, подробнее в главе «Можно ли доверять». Лицензия, цена и точная дата публикации весов в материале не указаны; единственный след доступности, ссылка на Hugging Face в шапке страницы.
Ключевые факты
- Ornith выпустила Ornith-1.5, три модели: флагманская Ornith-1.5-397B и Ornith-1.5-35B (MoE, смесь экспертов) и компактная Ornith-1.5-9B (Dense, плотная). Флагман набирает 86.1 на Terminal-Bench 2.1 и 56.0 на DeepSWE, по заявлению компании, наравне с Claude Opus 4.8 (85.0 и 59.0) и выше открытых GLM-5.2 (82.7/46.2) и DeepSeek-V4-Flash-0731 (82.7/54.4).
- Главная новизна, замкнутый цикл самообучения: модель сама предлагает себе всё более сложные задачи, строит под них обвязку (инструменты, инструкции, стратегию решения) и генерирует прогоны-решения для обучения с подкреплением; награда за задачу, произведение валидности, сложности (цель, успех примерно в 20% попыток) и новизны, а сам механизм оценки отдельно вознаграждается за устойчивость к попыткам его обмануть.
- Ornith-1.5-35B активирует лишь 3 млрд параметров на токен, но на агентном кодинге обгоняет более тяжёлые плотные модели Gemma 4-31B и Muse Glimmer-30B от Meta: 68.5 против 43.4 и 51.7 на Terminal-Bench 2.1, 79.0 против 52.0 и 76.0 на SWE-Bench Verified.
- Компактная Ornith-1.5-9B и её квантованная версия Ornith-1.5-9B-Mobile разворачиваются прямо на iPhone и Android; при этом Ornith-1.5-9B обгоняет более крупные Gemma 4-31B и Qwen 3.6-35B, 47.0 на Terminal-Bench 2.1 и 70.6 на SWE-Bench Verified.
- Все цифры, из собственного блога Ornith, без независимой проверки; в тексте есть нестыковки в том, по какому варианту Terminal-Bench 2.1 считались отдельные сравнения, а лицензия, цена и дата выпуска весов не названы.
Почему это важно
Главное в Ornith-1.5, не сами веса, а то, как их получили. Вместо фиксированного набора задач, размеченных людьми, и вручную спроектированной обвязки система сама генерирует себе тренировочные задачи, сама строит под них обвязку и сама получает прогоны-решения для обучения с подкреплением. Награда идёт по всем трём звеньям сразу: со временем улучшается не только качество решений, но и качество самих задач и обвязки, получается замкнутый цикл, в котором более сильная модель предлагает более сложные задачи, более удачная обвязка лучше раскрывает возможности модели, а более качественные прогоны дают более точный сигнал для обучения. Это развитие идеи из Ornith-1.0, где модель уже умела строить себе обвязку под задачу, здесь под контролем системы оказывается ещё и генерация самих задач, и оценка решений.
Кому это важно
Разработчикам открытых моделей для агентного кодинга, Ornith-1.5 заявляет о конкуренции сразу в трёх весовых категориях: 397B целится в топ, на уровень Claude Opus 4.8, 35B, в модели среднего размера вроде Qwen 3.6-35B и плотных Gemma 4-31B и Muse Glimmer-30B, а 9B с квантованной Ornith-1.5-9B-Mobile, в локальные и мобильные сценарии на iPhone и Android. Инженерам, которые сами строят циклы обучения с подкреплением для агентов, важнее не итоговая модель, а описанная в статье схема награды, валидность как жёсткий фильтр, сложность на уровне 20% успеха, новизна как защита от повторов, плюс отдельная защита самого механизма оценки от попыток его обмануть.
Как это применить
Единственный явный сценарий использования, названный в материале, компактная Ornith-1.5-9B в квантованном варианте Ornith-1.5-9B-Mobile, которая разворачивается прямо на iPhone и Android: подходит для локальных агентов на устройстве без обращения к серверу. Для задач, где важна экономия на инференсе, есть Ornith-1.5-35B, MoE-модель, активирующая лишь 3 млрд параметров на токен при 35 млрд общих, но по заявленным результатам приближающаяся к более тяжёлым плотным моделям. Ни лицензии, ни цены, ни точной даты публикации весов в тексте нет; единственный след доступности, ссылка на Hugging Face в шапке страницы.
Можно ли доверять
Все цифры, из собственного блога Ornith; независимой проверки нет. Методологически заявлено аккуратно: каждый результат, среднее по пяти независимым прогонам. Но в самом тексте есть нестыковки. В абзаце про флагман Ornith-1.5-397B, Claude Opus 4.8 и DeepSeek-V4-Flash-0731 сравниваются по одному варианту Terminal-Bench 2.1 (через фреймворк Terminus-2), а указанный там же результат GLM-5.2, 82.7, на деле относится к другому варианту теста, через Claude Code; в собственной таблице результатов Ornith результат GLM-5.2 по варианту Terminus-2 ниже, 81. Похожая нестыковка в абзаце про Ornith-1.5-35B: указанный там результат Gemma 4-31B на Terminal-Bench 2.1 (43.4) не совпадает ни с одним значением из таблицы для этой модели (в таблице, 42.1). В сносках модель-судья для двух других тестов названа по-разному, «Claude 4.6 Opus» для HLE и «Claude 4.8 Opus» для MCP-Atlas, без объяснения, чем вызвано расхождение. Ни одна из этих неточностей не отменяет результат сама по себе, но громкое «наравне с Claude Opus 4.8» стоит воспринимать как заявление компании о себе, а не как независимо подтверждённый факт.
Риски и подводные камни
Замкнутый цикл, где модель сама придумывает себе задачи, обвязку и способ их оценивать, несёт очевидный риск: модель может научиться обманывать собственную систему оценки вместо того, чтобы решать задачи по существу. Ornith закладывает защиту от этого прямо в схему награды: механизм оценки отдельно вознаграждается за устойчивость к сбоям, обходным путям и попыткам его обмануть, а валидность задачи, жёсткий фильтр: если задача или обвязка признаны невалидными, награда обнуляется целиком, независимо от того, насколько сложной задача выглядит. То, что команде понадобились такие явные защитные механизмы, косвенное подтверждение: при обучении без внешнего контроля со стороны человека такие сбои, не гипотетический, а ожидаемый класс ошибок. Отдельный риск для тех, кто планирует использовать модель на практике: в материале не сказано ничего ни о лицензии, ни о цене, ни о конкретной дате выпуска весов, известно только, что в шапке страницы есть ссылка на Hugging Face.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.