Cognition обновила Devin моделью SWE-2, почти на уровне флагманов, но дешевле

Компания Cognition представила SWE-2, по её словам, самую совершенную модель для написания кода, которую использует её ИИ-агент Devin. Модель уже доступна в Devin Desktop и Devin CLI, в ближайшее время появится в Devin Web и Devin Fusion. На тесте FrontierCode 1.1 Main SWE-2 набирает 50,0%, что отличается от результата Fable 5.1 не более чем на один балл, и при этом стоит на 64% дешевле. На тестах FrontierCode 1.1 Main и DeepSWE 1.1 SWE-2 превосходит по результату и по цене SWE-1.7 (предыдущую модель самой Cognition) и Grok 4.6, идёт на уровне GPT-5.6 Sol и Fable 5/5.1 за заметно меньшую цену и лишь немного отстаёт от GPT-6 Astra, но в этом случае обходится вчетверо дешевле.
SWE-2 дообучена на основе модели Kimi K3, по данным Cognition, модели на 2,8 трлн параметров, уже прошедшей масштабное обучение с подкреплением (RL) для агентной работы с кодом. Собственное RL-дообучение Cognition добавляет ещё 5, 6 баллов на многих тестах и, по утверждению компании, сдвигает вверх всю границу Парето (соотношение цены и качества) модели K3, а не одну точку на ней. Cognition также утверждает, что при обучении SWE-2 впервые провела RL-обучение в режиме с несколькими триллионами параметров.
Ключевое методическое новшество, RL-алгоритм, который в одном прогоне обучения сразу охватывает все уровни усилия модели, medium, high и max, и двигает вверх всю границу цены и качества, а не одну её точку. Для этого Cognition вводит линейный штраф за стоимость для каждого уровня усилия, а коэффициент штрафа подбирается по локальному наклону границы Парето базовой модели на этом уровне; по словам компании, такой подход выведен из первых принципов и должен двигать границу Парето вперёд, сохраняя её форму, и как можно точнее отражать в обучении реальные затраты пользователей. Cognition отмечает, что подходы к посттренировке в отрасли сильно различаются: например, сам Kimi K3 обучает отдельного «эксперта» под каждую комбинацию домена и уровня усилия, а затем объединяет их в одну модель мультиучительской дистилляцией на политике, используя вдобавок бюджет токенов, привязанный к конкретной задаче и шагу обучения. Отдельно компания делится приёмом, который использует с версии SWE-1.6: взвешенной по длине базовой линией для расчёта вознаграждения, она снижает разброс градиента без дополнительных затрат и заметно стабилизирует обучение.
Заметны изменения и в поведении модели. На тесте FrontierCode 1.1 Main версия SWE-2 medium обгоняет по качеству SWE-1.7, делая при этом на 58% меньше шагов и обходясь на 81% дешевле в среднем; до первой реальной правки кода SWE-2 medium доходит медианно за 18 шагов, против 48 шагов у SWE-1.7. По отзывам пользователей, для SWE-1.7 было характерно чрезмерно осторожное и слишком долгое изучение кодовой базы перед правками; SWE-2, по данным Cognition, изучает код более прицельно, точнее определяет, какие части кодовой базы важны для задачи, и быстрее переходит к правкам. Компания также отмечает у SWE-2 более качественные тесты, которые проверяют реализацию целиком и надёжнее ловят регрессии и краевые случаи; больше находчивости в рамках заданных пользователем границ, в одном внутреннем тесте, когда нужной интеграции через MCP не нашлось, модель восстановила нужные данные из истории Slack, доступ к которой у неё уже был; и более строгую дисциплину проверки: при возражении модель не повторяет свои выводы, а заново их выводит, проверяет гипотезы пользователя вместо того, чтобы просто соглашаться, и подтверждает выводы запуском кода, а не доверяет одному тексту. По наблюдениям Cognition, SWE-2 medium быстрее переходит к действию и выгоднее по цене на простых и средних задачах, а версии high и max сильнее на сложных, они больше планируют, шире изучают кодовую базу и тщательнее проверяют результат в условиях неопределённости.
Часть поста Cognition посвящена инфраструктуре обучения и инференса. Механизм, который в GPU-планировщике задерживает и объединяет в пакеты близкие по времени запросы этапа prefill, поднял пропускную способность, количество токенов в минуту на GPU (TPM) и токенов в секунду на запрос (TPS), на 10, 20%, в обмен на возросшее время до первого токена (TTFT), которое в Cognition сочли приемлемой платой. Для ускорения генерации компания использует спекулятивное декодирование DSpark: небольшая вспомогательная модель предлагает несколько токенов, а основная модель их проверяет; с помощью инструмента SpecForge Cognition обучила новую версию DSpark, которая принимает на 15% больше предложенных токенов подряд, и встроила её онлайн-обучение прямо в цикл RL, чтобы вспомогательная модель не отставала от изменений основной. Для инференса Cognition использует низкобитные форматы NVFP4 и FP8 вместе с обучением, учитывающим квантизацию: слои MLA выполняют в FP8 вычисления K, Q, V и оценок внимания, это проще, чем в SWE-1.7, где для разных частей внимания (NoPE и RoPE) использовалась смешанная точность: FP8 для NoPE и BF16 для RoPE. В сумме это дало SWE-2 меньшее расхождение между обучением и инференсом при сопоставимой с SWE-1.7 скорости, хотя базовая модель почти втрое крупнее по числу параметров. Для обучающих данных Cognition втрое увеличила число сред для RL, добавила данные на точное следование инструкциям и построила замкнутый цикл: более ранние версии SWE-2 помогают собирать данные и постепенно усиливают модели-верификаторы.
Ключевые факты
- SWE-2 набирает 50,0% на тесте FrontierCode 1.1 Main, расхождение с Fable 5.1 не больше одного балла, а стоит модель на 64% дешевле.
- На FrontierCode 1.1 Main и DeepSWE 1.1 SWE-2 превосходит по результату и цене SWE-1.7 и Grok 4.6, идёт на уровне GPT-5.6 Sol и Fable 5/5.1 за меньшую цену и лишь немного отстаёт от GPT-6 Astra, но вчетверо дешевле его.
- Модель дообучена на основе Kimi K3 (2,8 трлн параметров); собственное RL-дообучение Cognition добавляет 5, 6 баллов на многих тестах.
- На FrontierCode 1.1 Main SWE-2 medium делает на 58% меньше шагов и стоит на 81% дешевле, чем SWE-1.7, а до первой реальной правки кода доходит медианно за 18 шагов против 48 у предыдущей модели.
- SWE-2 уже доступна в Devin Desktop и CLI, скоро появится в Devin Web и Fusion.
Почему это важно
SWE-2, практическая иллюстрация того, что в кодовых ИИ-агентах гонка смещается с чистого качества на соотношение цены и качества. Cognition в явном виде обучает модель двигать вперёд всю границу Парето, а не одну точку на ней, с помощью RL-алгоритма, который в одном прогоне охватывает сразу все уровни усилия модели. Компания утверждает, что впервые провела RL-обучение в режиме с несколькими триллионами параметров, и показывает конкретный метод, линейный штраф за стоимость, привязанный к наклону границы Парето, а не просто заявляет об очередном приросте качества.
Кому это важно
Прежде всего, пользователям Devin: агент уже сегодня работает на SWE-2 в Desktop и CLI, скоро, в Web и Fusion, и выбор уровня усилия (medium/high/max) напрямую влияет на цену и качество решения задачи. Дальше, командам, которые сравнивают агентов для написания кода по совокупной стоимости, а не только по бенчмаркам. И отдельно, инженерам, которые занимаются RL: описанные Cognition приёмы, штраф за стоимость по наклону границы Парето, взвешенная по длине базовая линия вознаграждения, онлайн-обучение вспомогательной модели для спекулятивного декодирования, конкретные рецепты, которые можно повторить в других проектах.
Как это применить
Для существующих пользователей Devin ничего отдельно включать не нужно: SWE-2 уже доступна в Desktop и CLI и скоро появится в Web и Fusion. Выбор между уровнями усилия medium/high/max, это выбор между ценой и качеством: medium быстрее переходит к правкам и выгоднее на простых и средних задачах, high и max больше планируют и точнее проверяют себя на сложных. Точных тарифов по каждому уровню усилия в посте нет, только относительные сравнения в процентах и «разах», поэтому реальную стоимость для своей задачи нужно смотреть в тарифах Devin отдельно.
Можно ли доверять
Все цифры в посте, собственные измерения Cognition на собственном подборе тестов (FrontierCode 1.1 Main, DeepSWE 1.1), без упоминания независимой проверки: это пост компании о своём продукте, а не сторонний бенчмарк. Даже формулировки самой Cognition местами осторожные: связь между новым методом RL и поведенческими улучшениями модели компания называет тем, что она «считает» причиной, а не установленным фактом. В захваченном тексте нет математической нотации, и часть методики, в частности, сама формула штрафа за стоимость и упомянутые математические приложения, по этому фрагменту проверить нельзя.
Риски и подводные камни
Абсолютных цен нет вообще, только относительные сравнения («на 64% дешевле», «за четверть цены»), поэтому реальная выгода зависит от того, сколько сейчас стоят сами конкуренты, а это может измениться в любую сторону. SWE-2 дообучена на основе чужой базовой модели Kimi K3, а не построена Cognition с нуля, качество и доступность SWE-2 отчасти зависят от базовой модели, которую компания не полностью контролирует. Бенчмарки FrontierCode 1.1 и DeepSWE 1.1 отражают набор задач, отобранный самой Cognition, и не гарантируют такой же прирост на произвольной чужой кодовой базе.