LG выпустила открытую модель K-EXAONE 2.0 на 750 млрд параметров

LG выпустила открытую модель K-EXAONE 2.0 на 750 млрд параметров

LG AI Research выпустила K-EXAONE 2.0, открытую мультиязычную базовую модель, которую компания описывает как шаг к глобальным моделям переднего края. Вместо обучения с нуля разработчики «докрутили» (upcycle) предыдущую модель K-EXAONE и расширили её архитектуру, получив модель со смесью экспертов (Mixture-of-Experts, MoE): 750 млрд параметров всего и около 37 млрд активируются на каждый токен, это более чем втрое больше активируемой ёмкости, чем у предшественника. K-EXAONE 2.0 поддерживает контекст длиной до 256 тысяч токенов и расширяет охват языков с шести до десяти.

Пайплайн обучения сочетает продолженное предобучение, дообучение с упором на сложность заданий (difficulty-focused mid-training) и постобучение, они усиливают рассуждения, агентное написание кода, мультиязычность и безопасность, выстроенную с учётом корейского социокультурного контекста. По девяти категориям оценки, отобранным так, чтобы отражать условия практического использования, K-EXAONE 2.0 превосходит K-EXAONE и остаётся конкурентоспособной среди открытых моделей: наибольший прирост показан в агентном написании кода и понимании длинного контекста, а наиболее выраженные сильные стороны, в поиске по длинному контексту и безопасности. Модель выпущена под лицензией Apache 2.0, что позволяет широкому сообществу оценивать, развёртывать, адаптировать и развивать её дальше; по словам LG AI Research, релиз, это начало, а не конечная точка их движения к переднему краю индустрии.

Ключевые факты

  • LG AI Research выпустила K-EXAONE 2.0, MoE-модель, полученную «докруткой» (upcycling) предыдущей модели K-EXAONE
  • 750 млрд параметров всего, около 37 млрд активируются на токен, более чем втрое больше активируемой ёмкости предшественника
  • Контекст до 256 тысяч токенов, охват языков расширен с шести до десяти
  • Обучение сочетает продолженное предобучение, дообучение с упором на сложность и постобучение; усилены рассуждения, агентный код, мультиязычность и безопасность с учётом корейского контекста
  • По девяти категориям оценки модель конкурентоспособна среди открытых моделей, с наибольшим приростом в агентном коде и работе с длинным контекстом; выпущена под лицензией Apache 2.0

Почему это важно

K-EXAONE 2.0, крупный открытый релиз от LG AI Research: компания не просто обновила модель, а перестроила её в архитектуру со смесью экспертов через докрутку предыдущей версии, увеличив активируемую ёмкость более чем втрое и добавив контекст до 256 тысяч токенов. Это заметное расширение линейки K-EXAONE и ещё один открытый ориентир на фоне других открытых моделей, LG прямо заявляет о конкурентоспособности с ними.

Кому это важно

Разработчикам и исследователям, которым нужна открытая модель с большим контекстом и расширенной мультиязычностью (десять языков вместо шести), а также тем, кто работает с агентным написанием кода, именно там отчёт фиксирует наибольший прирост. Отдельно важно для задач, требующих учёта корейского социокультурного контекста в безопасности модели.

Как это применить

Модель выпущена под лицензией Apache 2.0, то есть открыта для оценки, развёртывания, адаптации и дальнейшей разработки любой командой. В источнике не указаны ни дата релиза, ни условия доступа к весам сверх самой лицензии, поэтому детали практического развёртывания (где скачать, требования к инфраструктуре) нужно уточнять отдельно.

Можно ли доверять

Заявления о превосходстве над K-EXAONE и конкурентоспособности с открытыми моделями сделаны самой LG AI Research в собственном техническом отчёте, независимого подтверждения в источнике нет. Конкретные числовые результаты по девяти категориям оценки в тексте не приведены, есть только качественные формулировки о том, где модель сильнее; какие именно открытые модели взяты для сравнения, тоже не указано.

Риски и подводные камни

Модель с 750 млрд параметров требует серьёзной инфраструктуры для развёртывания даже при 37 млрд активируемых параметров на токен. Отсутствие конкретных бенчмарк-показателей и списка моделей для сравнения не позволяет проверить заявления о конкурентоспособности напрямую по этому источнику. Безопасность модели выстроена с учётом корейского социокультурного контекста, что стоит учитывать при использовании в других языковых и культурных средах.