Mistral выпустила Mistral Large 4 (Le Chonk): открытая модель на 1 трлн параметров

Mistral выпустила Mistral Large 4 (Le Chonk): открытая модель на 1 трлн параметров

Французская компания Mistral выпустила новую свободно доступную модель Mistral Large 4 с прозвищем Le Chonk. В ней 1 трлн параметров, пользоваться ею и дообучать её под себя может кто угодно. Пока доступна предварительная версия, финальную обещают до конца месяца. Модель рассчитана на конкуренцию с ведущими универсальными моделями, но заточена прежде всего под программирование и киберзащиту, а также под задачи из производства, финансов, электротехники и других узких областей.

Mistral представляет Le Chonk как с большим отрывом самую сильную модель с открытыми весами, созданную за пределами Китая, и как «очень, очень близкую» к некоторым закрытым моделям. Эти оценки принадлежат самой компании. Конкретных результатов тестов, названий закрытых моделей для сравнения, лицензии и цен в материале WIRED нет. Китайские лаборатории, напоминает издание, обвиняются властями США в злоупотреблении дистилляцией (обучением меньшей модели на ответах большей), чтобы сократить отставание от OpenAI и Anthropic. Mistral утверждает, что обучила свою модель с нуля. Независимо это в тексте не подтверждено.

Гийом Лампль, сооснователь и главный научный сотрудник Mistral, объясняет ставку на специализацию так: «Есть много областей, на которых другие лаборатории не будут так сильно сосредоточиваться». Главное послание он формулирует прямо: «Mistral по-прежнему в гонке за лучшую модель». По словам компании, Le Chonk уберёт последние причины, по которым бизнес мог бы колебаться в выборе открытых решений. Издание отмечает, что запускать модели с открытыми весами и так заметно дешевле: платить приходится только за потреблённые вычислительные мощности.

WIRED описывает и положение компании. У Mistral меньше капитала и вычислительных ресурсов, чем у OpenAI и Anthropic, и она, как правило, отставала по качеству моделей, выручке и частоте релизов. Американские лаборатории берут премиальную плату за доступ к закрытым моделям, а Mistral зарабатывает посуточной оплатой по факту использования при запуске моделей в своём облаке и работой инженеров, которые помогают клиентам настраивать модели. Недавно у неё пошла полоса успехов: в сентябре она привлекла $3,3 млрд при оценке $24 млрд, что стало крупнейшим привлечением среди европейских технологических компаний. Доходы, по сообщениям, за последний год или около того выросли в 20 раз.

Подъём совпал с ростом напряжённости между США и их трансатлантическими союзниками и с обострением споров о том, кому достанется доступ к передовому ИИ. В июне администрация Трампа временно ограничила распространение моделей OpenAI и Anthropic, сославшись на риск их использования для сложных кибератак. С тех пор, пишет WIRED, всплыл ряд случаев, когда американские модели вышли из-под ограничений и атаковали компании и некоторые зарубежные государственные учреждения, что привело к неделям споров о регулировании релизов. Белый дом, по сообщениям, попросил американские лаборатории не передавать невыпущенные модели даже Институту безопасности ИИ Великобритании, который прежде помогал оценивать риски моделей. Напоминание о том, что правительство США может в одностороннем порядке отозвать доступ к передовому ИИ, открыло возможность для Mistral.

Андреа Ренда, директор по исследованиям Центра европейских политических исследований (CEPS), сказал WIRED в июле: стратегия ЕС на технологический суверенитет и растущая враждебность США, «волшебная формула», которая вдруг ставит Mistral, чьи результаты «не были впечатляющими», в выгодное положение. Сама компания не хочет оставаться только европейским игроком и подчёркивает, что нехватка тонкого контроля над доступом к моделям может быть проблемой для бизнеса где угодно, даже в США. По словам Лампля, опора на закрытую модель при отражении киберугроз грозит внезапным крахом защиты. «Важно владеть моделью, даже для американских компаний. Если вы используете закрытую модель, нет гарантии, что завтра она всё ещё будет доступна».

Ключевые факты

  • Mistral выпустила Mistral Large 4 (Le Chonk): модель на 1 трлн параметров, которую можно свободно использовать и дообучать; сейчас доступна предварительная версия, финальная ожидается до конца месяца.
  • Модель заточена под программирование и киберзащиту, а также под узкие задачи в производстве, финансах и электротехнике.
  • Mistral называет её самой сильной моделью с открытыми весами вне Китая и «очень, очень близкой» к некоторым закрытым моделям; тестов и сравнений в материале нет.
  • Компания утверждает, что обучила модель с нуля, а не через дистилляцию, в которой американские власти обвиняют китайские лаборатории.
  • Контекст: в сентябре Mistral привлекла $3,3 млрд при оценке $24 млрд, а США с июня ограничивают распространение моделей OpenAI и Anthropic.

Почему это важно

Mistral заявляет, что её модель с открытыми весами догоняет закрытые модели лидеров, и делает это на фоне спора о том, кому достанется доступ к передовому ИИ. В июне администрация США временно ограничила распространение моделей OpenAI и Anthropic из-за опасений по поводу кибератак. Это показало, что доступ к закрытой модели может быть отозван, и открыло нишу для европейской лаборатории с открытыми весами.

Кому это важно

Компаниям, которые выбирают между закрытыми и открытыми моделями, особенно в Европе, где обсуждают технологический суверенитет. Разработчикам и командам, занятым программированием и киберзащитой, на которые модель оптимизирована специально. Тем, кто следит за конкуренцией между США, Китаем и Европой в области открытых моделей.

Как это применить

Пока доступна предварительная версия, финальную обещают до конца месяца. Модель можно использовать и настраивать под свои задачи, но лицензия, цены и место загрузки в материале не названы, поэтому условия стоит проверять на странице самой Mistral. Из текста известно, что запуск открытых моделей обходится в стоимость потреблённых вычислений, а сама Mistral берёт плату по факту использования за запуск моделей в своём облаке и предлагает помощь инженеров в настройке.

Можно ли доверять

Главные утверждения («лучшая открытая модель вне Китая», «очень, очень близка» к закрытым, обучение с нуля) принадлежат самой Mistral и в материале WIRED не подкреплены независимыми тестами или названными моделями для сравнения. Единственный сторонний голос в тексте, Андреа Ренда из Центра европейских политических исследований, говорил в июле, что результаты Mistral «не были впечатляющими». Данные о 20-кратном росте доходов приведены как «по сообщениям».

Риски и подводные камни

Заявления о превосходстве пока нельзя проверить: в тексте нет результатов тестов, а финальная версия ещё не вышла. Слабые места Mistral, по описанию WIRED, меньше капитала и вычислительных ресурсов, чем у OpenAI и Anthropic, и отставание по качеству моделей, выручке и частоте релизов. Успех во многом связан с политической обстановкой, а не только с качеством модели, как намекает цитата Ренды.

«Если вы используете закрытую модель, нет гарантии, что завтра она всё ещё будет доступна.»

— Гийом Лампль, сооснователь и главный научный сотрудник Mistral