IBM выпустила Granite 4.2, рассуждающие модели с агентными функциями

IBM выпустила Granite 4.2, рассуждающие модели с агентными функциями

Команда Granite (IBM) опубликовала технический разбор Granite 4.2, первого семейства плотных (dense) декодерных моделей компании, ориентированных на рассуждение. Семейство выходит сразу в трёх размерах, 3B, 8B и 30B параметров, и распространяется под лицензией Apache 2.0. Все три модели умеют строить цепочку рассуждений перед ответом и переключаются между режимом «с размышлением» и «без размышления»; есть и промежуточный «облегчённый» режим размышления, который тратит небольшой бюджет рассуждения на простые вопросы. Каждая модель также поддерживает встроенный (нативный) вызов инструментов: при запуске через OpenAI-совместимый эндпоинт (например, vLLM) она отдаёт вызовы инструментов в формате OpenAI function calling и подключается к существующим агентным обвязкам без дополнительного связующего кода. Модели также поддержаны в SGLang.

Архитектурно все три размера, это декодерный трансформер с групповым вниманием (Grouped Query Attention) на 40 голов внимания и 8 голов ключ-значение, позиционным кодированием RoPE с параметром θ = 10 000 000, MLP-блоком на активации SwiGLU, нормализацией RMSNorm (ε = 1e-5), раздельными (не связанными) входными и выходными эмбеддингами и вычислениями в bfloat16.

Предобучение шло с нуля на примерно 15 трлн токенов по пятифазной схеме: первые две фазы, базовое предобучение, третья и четвёртая, дообучение на всё более качественных данных, пятая фаза расширяет контекстное окно до 512 тыс. токенов. Рецепт предобучения в целом повторяет предыдущее поколение, Granite 4.1.

На этапе SFT (дообучения с учителем) модель обучали на смеси из примерно 7,2 млн примеров (около 100 млрд токенов, из которых обучаемых, порядка 65 млрд): 31,6% данных, агентные, 68,4%, неагентные. Внутри агентной части основная доля приходится на разработку ПО (69%), далее идут вызов инструментов (12,1%), работа с терминалом (8,0%), математика (3,5%), поиск (0,8%) и действия (0,2%); трассы для этих данных генерировались через разные агентные обвязки, включая OpenHands, OpenCode, SWE-agent, Gemini CLI, Codex и Goose. Неагентная часть распределена между следованием инструкциям (18,8%), программированием (18,8%), математикой (14,6%), многоязычными данными (7,0%), наукой (5,4%), рассуждением (3,0%) и безопасностью (0,8%). Перед попаданием в финальную выборку данные проверяли две модели-судьи, GPT-OSS-120B и Gemma 4: они отсеивали слабые по качеству примеры, а также случаи с галлюцинациями, некорректными вызовами инструментов и обращениями к несуществующим функциям; отдельно данные дедуплицировали по SHA-256-хешу от связки «инструменты + сообщения». Для 30B-модели добавлена вторая фаза SFT, нацеленная конкретно на агентное программирование: примерно одна дополнительная эпоха при сниженной скорости обучения 3,0e-6, при этом около 16% смеси на этой фазе, повторно используемые (replay) данные из исходного SFT-набора.

После SFT следует многоэтапный RL-конвейер: каждая стадия, отдельный запуск обучения с подкреплением (метод GRPO), стартующий с чекпоинта предыдущей стадии. Базовые стадии, математика, код, наука, следование инструкциям, вызов инструментов и структурированный вывод, проходят все размеры модели. Для 8B и 30B добавлен агентный блок: разработка ПО, работа с терминалом и веб-поиск в реальных песочницах; 3B-модель этот блок пропускает и идёт по укороченному пути, только базовый RL и финальное выравнивание (RLHF). Обучение асинхронное: генератор и тренер работают параллельно, а рассинхронизацию между версиями политики сдерживают ограничением на отставание в одно обновление и усечённым importance sampling в целевой функции. Для иллюстрации: на стадии RLVR (обучение на проверяемых наградах) один шаг, это 256 промптов по 16 сгенерированных ответов, батч на 4096 примеров. Коэффициент KL-штрафа зависит от типа стадии: там, где награда объективна и проверяема (RLVR, вторая стадия SWE), KL = 0; там, где речь о предпочтениях, безопасности или узком навыке (RLHF, коррекция кода), KL = 0,05.

Ключевые факты

  • IBM выпустила Granite 4.2, первое семейство рассуждающих моделей компании: 3B, 8B и 30B параметров, лицензия Apache 2.0
  • У каждой модели есть переключатель «с размышлением / без размышления», облегчённый режим рассуждения и встроенный вызов инструментов в формате OpenAI
  • Предобучение с нуля на ~15 трлн токенов в пять фаз, контекстное окно расширено до 512 тыс. токенов
  • 8B и 30B прошли дополнительный агентный этап RL (разработка ПО, терминал, веб-поиск в песочницах), у 3B этого блока нет
  • Качество SFT-данных контролировали модели-судьи GPT-OSS-120B и Gemma 4, дедупликация, по SHA-256

Почему это важно

Granite 4.2, это переход линейки IBM от просто хороших ассистентов, следующих инструкциям, к моделям с явным рассуждением: каждая модель строит цепочку рассуждений перед ответом и умеет переключаться между «быстрым» и «вдумчивым» режимом. Для двух старших размеров это дополнено агентным обучением с подкреплением прямо в песочницах, модель учится вызывать инструменты, редактировать и запускать код, работать в терминале и искать в вебе. Всё это выходит под лицензией Apache 2.0, то есть без ограничений на коммерческое использование.

Кому это важно

В первую очередь тем, кто строит агентные системы и ищет открыто лицензируемую модель со встроенным вызовом инструментов вместо кастомного парсинга ответов. Полезно и командам, уже использующим self-hosted инференс через vLLM или SGLang, а также корпоративным пользователям IBM, работающим с семейством Granite.

Как это применить

Модель разворачивается через OpenAI-совместимый эндпоинт (например, на vLLM) или через SGLang и сразу отдаёт вызовы инструментов в формате OpenAI function calling, без дополнительной обвязки для существующих агентных фреймворков. В зависимости от сложности задачи можно выбрать полный режим размышления, облегчённый режим или ответ без рассуждения, регулируя таким образом задержку и стоимость инференса.

Можно ли доверять

Источник, официальный технический блог самой команды Granite в IBM, а не независимый обзор. Публикация подробно раскрывает архитектуру, состав обучающих данных и RL-конвейер, что необычно детально для анонса модели, и это работает в пользу доверия к описанию методологии. Но в тексте приводятся числа с результатами бенчмарков (например, AIME25, SWE-bench Verified, MMLU-Pro, BFCL v4, Terminal-Bench 2.1) только для самой Granite 4.2, сравнений с другими моделями там нет, так что судить, насколько она лучше или хуже конкурентов, по этому материалу нельзя.

Риски и подводные камни

В разборе приведены только собственные бенчмарки Granite 4.2, без сравнения с конкурентами, и не указаны ни дата релиза, ни цены или условия доступа, по этому тексту нельзя судить, чем Granite 4.2 лучше или хуже конкурентов и когда/как её можно получить. Контроль качества обучающих данных доверен двум сторонним языковым моделям (GPT-OSS-120B и Gemma 4), их собственные слепые пятна и предвзятости потенциально могут переноситься на итоговую модель через отобранные ими примеры. Детали инфраструктуры обучения, число GPU, длительность и стоимость, в тексте тоже не раскрыты.