Aleph Alpha выпустила Kolibri: открытая модель на 78 млрд параметров

Aleph Alpha выпустила Kolibri: открытая модель на 78 млрд параметров

Aleph Alpha объявила о выпуске Kolibri, англо-немецкого трансформера с архитектурой Mixture-of-Experts (смесь экспертов): 78 млрд параметров всего, 3 млрд активных на токен. Модель поддерживает контекст до 1 млн токенов. Полные веса доступны на Hugging Face по лицензии Apache 2.0. Релиз компания приурочила ко Дню германского единства. Текст, собственный анонс компании, все утверждения в нём принадлежат Aleph Alpha.

Позиционирование: Kolibri, специализированная модель для «суверенной» работы в критически важных задачах в регулируемых сферах: госуправление, промышленность, авиакосмическая отрасль. Модель специализировали под немецкий язык, рассуждение, математику, агентное поведение и другие навыки, нужные клиентам в промышленной эксплуатации. Небольшой размер, по словам компании, позволяет запускать её на собственных серверах, не отправляя внутренние данные сторонним сервисам вывода. Под суверенитетом компания понимает два измерения: как построена модель и как она передаётся клиентам, с полной прозрачностью цепочки (от сбора данных до итоговых оценок), свободой развёртывания и защитой интеллектуальной собственности.

Качество. Aleph Alpha утверждает, что Kolibri лежит на границе Парето по соотношению качества и стоимости обслуживания, и для английского, и для немецкого: ни одна из сравниваемых моделей не даёт больше качества при той же стоимости. В математике, программировании, привязке к документам (grounding) и задачах на длинный контекст Kolibri, по заявлению компании, сопоставима с моделями, у которых до четырёх раз больше активных параметров, например Nemotron 3 Super. Числовых результатов тестов в видимом тексте нет, они вынесены в технический отчёт, на который даётся ссылка. Помимо публичных бенчмарков компания создала внутренние наборы оценок для немецкого госсектора, авиации, производства и автопрома и улучшала модель на парных синтетических средах, не обучаясь на данных клиентов. Модель обучена говорить «Я не знаю», если ответа нет в контексте (для этого использованы данные с отказами от ответа и протокол Merlin-Arthur).

Данные и язык. Разработан двуязычный немецко-английский токенизатор; 21,3% токенов предобучения, немецкие (около 4,3 трлн токенов, при этом около 62% английского и 14% кода). Перевод использовали умеренно, 6% всего объёма, поскольку переведённый текст несёт «культурный отпечаток» исходного языка.

Как строили. Центральная часть рассказа, «Фабрика моделей» (Model Factory): обучающий конвейер, оформленный как код с единым версионируемым рецептом. Работа над ним началась в январе. Сначала на нём получили Kolibri Origin (30 млрд параметров всего, 3 млрд активных, контекст 65 тыс. токенов): предобучение завершилось 11 июня. Kolibri завершил предобучение 11 сентября. За три месяца между ними размер вырос с 30 до 78 млрд параметров, контекст, с 65 тыс. до 1 млн токенов, объём обучения, с 7,5 до 20 трлн токенов; для этого конвейер обработал более 200 трлн токенов сырых данных. Также изменили схему внимания, втрое увеличили число экспертов, повысили разреженность, заменили алгоритм маршрутизации, более чем вдвое расширили набор задач в средах и научили модель рассуждать на четырёх уровнях усилия.

Архитектура и обучение. Для Kolibri выбрали 78 млрд параметров, хотя в экспериментах рост с 32 до 123 млрд улучшал качество: решающим стала стоимость. По данным компании, на двух H100 модель на 123 млрд обслуживает лишь 3 запроса с контекстом 256 тыс. токенов, а 78 млрд, 18 одновременных запросов и декодирует на 28% быстрее. Используется 384 небольших эксперта вместо меньшего числа широких. Из 50 слоёв полный контекст обрабатывают только 10, остальные 40 работают с окном в 512 токенов. Обучение шло на 768 GPU B200 в три этапа: 20 трлн токенов предобучения на длине последовательности 16 тыс. за 21 день, 3,44 трлн токенов промежуточного обучения (64 тыс.) и 200 млрд токенов адаптации к длинному контексту (256 тыс.), почти 24 трлн токенов суммарно, примерно втрое больше, чем у Kolibri Origin. За 21 день предобучения произошло 38 незапланированных прерываний (примерно одно на 10 000 GPU-часов) из-за сбоев железа или обрыва соединения; конвейер перезапускал обучение на других узлах, откатываясь не более чем на 250 шагов.

Честные оговорки авторов. Предобучение Kolibri Origin остановили после нескольких триллионов токенов и начали заново из-за ошибки в перемешивании данных, которую не поймали тесты; часть экспериментов пришлось перезапускать из-за ошибок в конфигурации. Прирост относительно Kolibri Origin авторы называют заметным, но говорят, что это «лёгкое направление»: больше параметров, больше данных, понятная архитектура и всё ещё небольшой масштаб. Собственно соответствие регуляторике заявлено как замысел: Kolibri делали «с учётом» Регламента ЕС об ИИ (EU AI Act), Кодекса практик для ИИ общего назначения и GDPR; модель разработана в Германии, обучена на инфраструктуре в Германии и Финляндии «без иностранного контроля». Текст источника в видимой части обрывается на разделе о предобучении.

Ключевые факты

  • Kolibri, англо-немецкая модель Mixture-of-Experts: 78 млрд параметров всего, 3 млрд активных, контекст до 1 млн токенов; веса открыты на Hugging Face под Apache 2.0.
  • По заявлению Aleph Alpha, модель на границе Парето по качеству и стоимости обслуживания и сопоставима в математике, коде, grounding и длинном контексте с моделями, у которых до четырёх раз больше активных параметров (пример, Nemotron 3 Super).
  • Обучение: 768 GPU B200, три этапа (20 трлн токенов за 21 день, 3,44 трлн, 200 млрд), почти 24 трлн токенов суммарно; 21,3% токенов предобучения, немецкие.
  • Предшественник Kolibri Origin (30 млрд, 3 млрд активных, 65 тыс. токенов) нужен был для проверки конвейера «Фабрика моделей»; его предобучение пришлось перезапустить из-за ошибки перемешивания данных.
  • Позиционирование, «суверенная» модель для госсектора, промышленности и авиакосмоса; запуск на собственных серверах, без передачи данных сторонним сервисам.

Почему это важно

Это открытый релиз новой модели европейской компании: с полными весами, лицензией Apache 2.0 и подробным рассказом о том, как её обучали. Ставка сделана не на размер, а на соотношение качества и стоимости обслуживания: при 3 млрд активных параметров из 78 млрд модель, по заявлению Aleph Alpha, сопоставима с моделями, у которых активных параметров до четырёх раз больше. Для европейского рынка заметен и акцент на происхождении: создана в Германии, обучена на инфраструктуре в Германии и Финляндии, под европейским и немецким правом, с немецким языком как одним из двух основных (21,3% токенов предобучения).

Кому это важно

В первую очередь организациям в регулируемых сферах, госуправление, промышленность, авиакосмос, где данные нельзя отправлять внешним сервисам вывода: компания прямо говорит о запуске на собственных серверах. Также тем, кому нужна сильная работа с немецким языком, и командам, строящим собственные конвейеры обучения: в анонсе много инженерных деталей (автоматические перезапуски, оценка чекпоинтов раз в час примерно, запуск полного мини-цикла на каждое изменение кода).

Как это применить

Веса можно скачать с Hugging Face и использовать на условиях Apache 2.0. Из анонса следует, что модель предназначена для локального развёртывания и поддерживает управляемое усилие рассуждения (четыре уровня), чтобы балансировать стоимость и задержку против качества ответа. Для задач с документами заявлено, что она отказывается отвечать, если ответа нет в контексте. Требования к железу, цены и названия клиентов в видимом тексте не указаны; подробности, в техническом отчёте, ссылка на который есть в анонсе.

Можно ли доверять

Источник, собственный пост Aleph Alpha, то есть заявления о качестве, суверенитете и соответствии регуляторике принадлежат самой компании. Независимой проверки в тексте нет. Числовых результатов тестов в видимой части нет, только формулировки о границе Парето и сопоставимости с моделями вроде Nemotron 3 Super; цифры вынесены в технический отчёт. Какие ещё модели участвовали в сравнении, в тексте не названо. В пользу достоверности говорит откровенность об ошибках: перезапуск обучения Kolibri Origin из-за бага и оценка прироста как «лёгкого направления». Видимая часть текста обрывается в разделе об архитектуре и предобучении.

Риски и подводные камни

«Суверенность» и «соответствие» в анонсе, заявленный замысел: модель создавалась «с учётом» EU AI Act, кодекса практик и GDPR, это не сертификат. Утверждение о границе Парето опирается на выбор сравниваемых моделей, а он в тексте не раскрыт. Контекст до 1 млн токенов, максимум поддержки: основное обучение шло на 16 тыс., затем 64 тыс., а адаптация к длинному контексту, на 256 тыс. токенов. Сами авторы оговариваются, что масштаб остаётся небольшим и вопрос дальнейшего наращивания открыт. Качество на конкретных задачах придётся проверять самостоятельно.

«Она обучена говорить «Я не знаю», когда ответа нет в контексте.»

— Aleph Alpha о поведении Kolibri