IFM выпустила K2 Horizon: шесть открытых моделей от 0.9B до 375B с полностью открытым циклом обучения

IFM выпустила K2 Horizon: шесть открытых моделей от 0.9B до 375B с полностью открытым циклом обучения

Компания IFM представила K2 Horizon, семейство из шести открытых моделей: 0.9B, 3.7B, 7B, 32B, 36B-A4B и 375B-A23B. По собственным данным IFM, во всех классах размеров модели показывают результаты на уровне лучших в отрасли по рассуждениям, математике, программированию, агентным задачам и общим способностям, а три младшие модели, 0.9B, 3.7B и 7B, устанавливают новый рекорд (state of the art) именно для своего размера. IFM называет K2 Horizon самым полным на сегодняшний день открытым релизом: для каждой модели раскрыт весь цикл обучения, от предобучения до дообучения на рассуждения и агентные сценарии. В открытый доступ выложены промежуточные чекпойнты, обучающие данные (или подробные рецепты их сборки), архитектура, состав смеси данных, код и конфигурации обучения, подробные логи, результаты оценок и итоговые веса. Сами модели и код распространяются по лицензии Apache 2.0; наборы данных, по их собственным лицензиям (например, ODC-BY), а там, где данные нельзя перераспространять напрямую, IFM раскрывает, как именно они были собраны и смешаны.

Шесть моделей охватывают весь диапазон применения, от предельно компактных устройств до корпоративной нагрузки. Модель 0.9B рассчитана на сильно ограниченные среды вроде умных часов и очков; 3.7B и 7B несут развитые возможности на телефоны и другие локальные устройства; плотная модель 32B и разреженная 36B-A4B, вариант для локальных рабочих станций и эффективного обслуживания запросов; а 375B-A23B рассчитана на требовательные корпоративные развёртывания. Все шесть моделей поддерживают квантование. Обозначения в названиях двух старших моделей, «A23B» у 375B-A23B и «A4B» у 36B-A4B, расшифровываются как число активных параметров на токен: из 375 млрд параметров общей ёмкости у 375B-A23B на каждый токен фактически задействуется около 23 млрд, у 36B-A4B из 36 млрд общих, около 4 млрд; это разреженная архитектура «смесь экспертов» (Mixture-of-Experts, MoE), которая позволяет опираться на ёмкость значительно более крупной модели, не считая при этом каждый параметр на каждом токене. Все шесть моделей спроектированы как единое семейство с самого начала: они разделяют базовую архитектуру, словарь, методологию обучения, интерфейсы, инфраструктуру оценки и инструменты развёртывания (у 0.9B словарь меньше), а не собраны как отдельные несвязанные релизы. Каждая модель предобучена примерно на 20 трлн токенов по тщательно составленным и задокументированным смесям данных; на всём протяжении обучения фиксировались промежуточные чекпойнты и подробные логи.

Показатели по размерам различаются. Три младшие модели, 0.9B, 3.7B и 7B, показывают результаты на уровне лучших в мире для своего класса по математике, рассуждениям, общим способностям, программированию и агентным задачам; 0.9B, в частности, показывает результат выше 48 на AIME 2026 и демонстрирует уверенные рассуждения, работу с инструментами и простые агентные сценарии. Модели 3.7B и 7B переносят эти возможности на более требовательные задачи, уверенные результаты на SWE-bench и BrowseComp, точных цифр по которым IFM не приводит, но задачи, требующие долгого исследования и многократного восстановления после ошибок, вроде тех, что входят в TerminalBench, по признанию самой компании остаются сложными для самых маленьких моделей. Модель 36B-A4B, построенная на новой архитектуре MoVA, даёт исключительную отдачу на активный параметр и превосходит некоторые заметно более крупные модели: при 36 млрд параметров общей ёмкости и около 4 млрд активных на токен она почти достигает уровня плотной модели 32B, при этом, по данным IFM, при одинаковых условиях обучения 36B-A4B всё же немного уступает 32B, а не превосходит её, выигрывая только в числе задействованных на токен параметров. Модели 32B и 375B-A23B входят в число лучших каждая в своём классе: 32B, среди плотных моделей до 40 млрд параметров, 375B-A23B, среди моделей до 400 млрд параметров по общим способностям, рассуждениям, программированию и агентным задачам.

Старшая модель, 375B-A23B, самая крупная и самая мощная в семействе: её разреженная MoE-архитектура даёт 375 млрд параметров общей ёмкости, из которых на каждый токен активируется около 23 млрд. Она предназначена для самых требовательных нагрузок, где важнее всего именно качество модели: сложные рассуждения, разработка программного обеспечения, исследовательская работа и продолжительные агентные сценарии. Как и остальные модели семейства, 375B-A23B выпущена не как одна финальная точка, а как «дерево разработки»: раскрыты её промежуточные чекпойнты и ветки последующего дообучения, которые показывают, как базовая модель превращается в версии для рассуждений, следования инструкциям и специализированные агентные варианты.

IFM формулирует мотивацию релиза как попытку снять давний компромисс: прозрачная модель, которая сильно отстаёт от переднего края возможностей, имеет ограниченную ценность даже как основа для исследований, а мощная модель, выпущенная только в виде финальных весов, позволяет её запустить, но почти не даёт понимания, как именно были получены её возможности. По утверждению компании, K2 Horizon совмещает оба свойства: конкурентоспособные модели и опубликованные рецепты их обучения, исследователи могут изучать развитые способности на моделях, которые достаточно сильны, чтобы их проявлять, а разработчики, воспроизводить, адаптировать и расширять сами методы обучения, а не работать с финальным чекпойнтом как с чёрным ящиком. IFM напоминает, что придерживается этого принципа с 2023 года, когда в статье о проекте LLM360 впервые сформулировала подход «полной открытости»: с тех пор компания ежегодно выпускает открытые модели, каждый раз расширяя охват на больший масштаб, более высокие возможности, а теперь, и на полный цикл обучения вплоть до агентного дообучения.

Архитектура MoVA (Mixture-of-Value Attention) переносит на само внимание идею, которая до сих пор применялась в основном к слоям прямого распространения (feed-forward): MoE наращивает общую ёмкость модели, но благодаря маршрутизатору, который на каждый токен включает лишь малую часть экспертов, вычислительная нагрузка почти не растёт. Поскольку именно механизм внимания определяет, как трансформер собирает информацию по всему контексту, перенос разреженности на внимание открывает ещё одно измерение для наращивания ёмкости модели помимо слоёв прямого распространения. MoVA встраивает маршрутизацию экспертов прямо в многоголовое внимание, оставаясь при этом совместимой с эффективными техниками, FlashAttention, grouped-query attention и разреженным вниманием (sparse attention). Результат применения архитектуры, модель 36B-A4B: 36 млрд параметров общей ёмкости при около 4 млрд активных на токен; при одинаковых условиях обучения она лишь немного уступает плотной модели 32B, требуя при этом заметно меньше активных параметров.

Смесь данных для предобучения сочетает разнородные источники, веб-тексты, код, математику, научные тексты, многоязычные и предметные данные, с синтетическими данными, сгенерированными собственными конвейерами IFM. Почти 17% предобучающего корпуса, это траектории решения задач с явным пошаговым рассуждением, а математические траектории рассуждений дополнительно переписывались в форматы вроде диалогов и учебных пособий. В сумме, по словам компании, при предобучении было использовано около 10 трлн синтетических токенов. Конвейеры генерации синтетических данных используют миллионы комбинаций настроек, управляющих разнообразием, и начальных фрагментов контекста, включая выборку через собственную поисковую систему IFM по веб-корпусу, на котором шло предобучение. Чтобы количественно оценивать разнообразие данных на масштабе всего корпуса, компания разработала новый компрессор Wzip, который сочетает адаптивный алгоритм LZ77 со скользящими окнами и оконное кодирование Хаффмана; по словам IFM, Wzip смягчает быстрое насыщение, которое даёт метрика на основе обычных gzip/zstd при росте числа документов, и позволяет измерять разнообразие корпуса содержательнее. По измерениям компании, разнообразие её синтетических данных приближается к разнообразию качественных естественных веб-текстов и заметно превышает разнообразие веб-кода. IFM документирует состав данных, конвейеры синтеза и то, как собиралась итоговая смесь: там, где лицензии позволяют, готовые к обучению наборы данных выкладываются напрямую, а там, где перераспределение ограничено, публикуются описания источников, методы фильтрации и построения данных и состав смеси.

Данные для дообучения вводятся в обучение с самого начала промежуточной стадии (mid-training), а не откладываются исключительно на финальные этапы: они сочетают синтезированные длинные документы с траекториями следования инструкциям, рассуждений и агентных сценариев, оформленными в виде диалогового шаблона (chat template). Главный элемент этих данных, масштабный синтез задач на основе таксономий задач, настроек разнообразия и наполнения через веб-поиск, который дал в результате более 100 млн уникальных задач.

Ключевые факты

  • IFM выпустила K2 Horizon, семейство из шести открытых моделей (0.9B, 3.7B, 7B, 32B, 36B-A4B и 375B-A23B), рассчитанных на весь диапазон устройств: от умных часов и очков до корпоративных развёртываний.
  • Три младшие модели, 0.9B, 3.7B и 7B, устанавливают новый рекорд (state of the art) для своего размера в рассуждениях, математике, коде и агентных задачах; 0.9B показывает результат выше 48 на AIME 2026.
  • Для каждой модели впервые раскрыт весь цикл обучения целиком: промежуточные чекпойнты, обучающие данные или рецепты их сборки, архитектура, код, конфигурации, подробные логи и результаты оценок; модели и код выпущены по лицензии Apache 2.0.
  • Модель 36B-A4B построена на новой архитектуре MoVA (Mixture-of-Value Attention), которая переносит разреженность экспертов на само внимание: при 36 млрд параметров общей ёмкости и около 4 млрд активных на токен она почти достигает уровня плотной модели 32B, немного уступая ей при одинаковых условиях обучения.
  • Каждая модель предобучена примерно на 20 трлн токенов; в сумме, по данным IFM, при предобучении использовано около 10 трлн синтетических токенов, а почти 17% корпуса, это траектории решения задач с явным рассуждением.

Почему это важно

Открытые релизы больших языковых моделей обычно означают одно из двух: либо компания выкладывает только финальные веса, не объясняя, как модель обучалась, либо публикует научную статью с частью деталей, но без кода и данных, пригодных для полного воспроизведения. IFM заявляет, что K2 Horizon, самый полный на сегодняшний день открытый релиз: для каждой из шести моделей раскрыт весь цикл обучения, включая этап агентного дообучения, который другие открытые релизы обычно не затрагивают вовсе. Это важно ещё и потому, что три из шести моделей, 0.9B, 3.7B и 7B, при этом устанавливают новый рекорд для своего размера, а не просто открыты ценой слабых результатов: IFM явно противопоставляет свой релиз ситуации, когда открытость и конкурентоспособность считаются взаимоисключающими. Если независимая проверка подтвердит эти результаты, K2 Horizon станет редким примером релиза, который одновременно даёт исследователям возможность разобрать, как именно возникают рассуждения, работа с инструментами и агентное поведение, и даёт разработчикам модели, которые не стыдно ставить в прод.

Кому это важно

Исследователям, которые изучают, как в языковых моделях возникают рассуждения, работа с инструментами и агентное поведение, им доступны не только веса, но и промежуточные чекпойнты, обучающие данные (или подробные рецепты их сборки) и логи всех этапов обучения. Разработчикам компактных ассистентов на периферийных устройствах, часах, очках, телефонах, которым подойдут модели 0.9B, 3.7B и 7B с поддержкой квантования. Командам, которые обслуживают модели локально на собственных рабочих станциях или серверах: плотная 32B и разреженная 36B-A4B рассчитаны именно на такой сценарий. Компаниям с требовательными корпоративными нагрузками, сложными рассуждениями, разработкой ПО, продолжительными агентными сценариями, для которых предназначена старшая модель 375B-A23B. Наконец, инженерам, которые занимаются архитектурами внимания и MoE: им интересна MoVA как способ перенести разреженность экспертов со слоёв прямого распространения на само внимание.

Как это применить

Сами модели и код K2 Horizon распространяются по лицензии Apache 2.0, то есть допускают коммерческое использование без отдельного согласования. Наборы данных лицензированы отдельно (например, часть, по ODC-BY); там, где данные нельзя перераспространять напрямую, IFM вместо самих данных публикует описание того, как они были собраны, отфильтрованы и смешаны, воспроизвести данные один в один в таком случае не получится, но методика видна. Все шесть моделей поддерживают квантование, так что даже старшие из них можно ужать под более скромное железо. Выбор модели естественно завязан на сценарий: 0.9B, для точечных, лёгких по нагрузке взаимодействий и простого вызова инструментов на сильно ограниченных устройствах; 3.7B и 7B, для более требовательных задач вроде написания кода и многошаговых сценариев на телефоне или другом локальном устройстве; 32B и 36B-A4B, для локальной рабочей станции или эффективного обслуживания запросов, где важна экономия на активных параметрах; 375B-A23B, там, где на первом месте стоит именно качество, а не экономичность. Цену, доступ через API и прямые ссылки на скачивание источник не приводит вовсе, судить об экономике использования на основе одного этого текста не получится.

Можно ли доверять

Источник, собственный блог IFM, а не независимый бенчмарк или сторонний обзор, поэтому все сравнения («лучшие в классе», «превосходит некоторые более крупные модели») пока стоит воспринимать как позицию самой компании, а не как факт, проверенный третьей стороной. В пользу доверия говорит непривычная для индустрии степень раскрытия: если IFM действительно выложила чекпойнты, логи и данные (или рецепты их сборки) для всех шести моделей, результаты в принципе можно перепроверить и воспроизвести независимо, это гораздо больше, чем обычно даёт даже формально «открытый» релиз. При этом сам текст не называет ни конкретных чисел по SWE-bench и BrowseComp (только общая формулировка «уверенные результаты»), ни того, с какими именно более крупными моделями сравнивалась 36B-A4B, ни того, входят ли те же 10 трлн синтетических токенов в предобучение на 20 трлн токенов, упомянутые отдельно, или это разные пулы данных, источник этого не поясняет. Ни один конкретный исследователь или автор в тексте не назван: компания говорит о себе только как «IFM» и «мы».

Риски и подводные камни

Заявленные рекорды касаются не всех задач одинаково: сложные сценарии, которые требуют долгого исследования и многократного восстановления после ошибок, тип задач из TerminalBench, по признанию самой IFM, остаются трудными именно для самых маленьких моделей, несмотря на общий рекорд для их размера. Формулировки «превосходит некоторые заметно более крупные модели» и «входит в число лучших моделей в своём классе» не называют конкретного соперника, так что проверить их самостоятельно по этому тексту нельзя, они держатся исключительно на слове IFM. Эффективность 36B-A4B не стоит путать с превосходством: при одинаковых условиях обучения она немного, но всё же уступает по качеству плотной модели 32B, выигрывая только в числе активных параметров на токен, а не в итоговом качестве. Наконец, «полностью открытый» релиз открыт неравномерно: там, где лицензии на данные не позволяют прямое перераспределение, наружу выходит только описание методики, а не сами данные, воспроизвести обучение с нуля в таких местах не выйдет, только изучить подход.

«Прозрачная модель, которая сильно отстаёт от переднего края возможностей, имеет ограниченную ценность даже как основа для исследований. В то же время мощная модель, выпущенная только в виде финальных весов, позволяет её запустить, но почти не даёт понимания, как именно были получены её возможности.»

— IFM, в блоге о выпуске K2 Horizon