Стартап Mostik научил ИИ-модели «разговаривать» через веса, минуя текст

Российские математики, работающие в стартапе Mostik («мост» по-русски), придумали способ, которым ИИ-модели обмениваются информацией напрямую, через математические значения в своих весах, а не через генерируемый текст. Веса определяют, как модель превращает промпт в ответ; идея Mostik в том, чтобы «перекачивать» возможности большой модели в маленькую, эффективно передавая ей интеллект.
На этом подходе команда уже построила модель, вышедшую на первое место в конкурсе ARC-AGI 3, одном из самых сложных бенчмарков для ИИ; подробности результата Mostik не раскрывает, чтобы не терять преимущество перед соперниками в этом же конкурсе. Для демонстрации идеи компания вместо этого показала другой пример: мост между двумя китайскими открытыми моделями, самой крупной версией GLM-5.2 (753 млрд параметров) и версией Qwen-3.5 на 4 млрд параметров, которая помещается на мобильном устройстве. Получившаяся гибридная система стоит в 20 раз дешевле полной GLM-5.2, а её качество, ровно посередине между двумя исходными моделями.
CEO и разработчица подхода Саша Малышева поясняет идею через известный в машинном обучении факт: ансамбли моделей работают лучше, чем отдельные модели, как толпа людей точнее оценивает вес свиньи на глаз, чем один эксперт, если усреднить все догадки. Обычно объединение моделей происходит через передачу текстового вывода одной модели на вход другой, это долго и дорого. Mostik нашла способ обмена без генерации текста вообще. По словам автора статьи, если метод приживётся, он может поднять ценность открытых моделей, позволив им сильнее конкурировать с закрытыми проприетарными моделями таких лабораторий, как Anthropic и OpenAI.
Малышева считает, что будущее ИИ, не в одной монолитной модели, чьи возможности растут за счёт масштабирования (увеличения размера и объёма данных), а в комбинировании множества разных моделей. Владимир Арустамян, технический лидер ИИ-компании Lovable, знакомый с командой Mostik, говорит, что подход может позволить сочетать топовые модели с узкоспециализированными, например, по биологии или физике, и это приведёт к обучению гораздо большего числа таких специализированных моделей; по его словам, команда занимается этим всего несколько месяцев, но уже показывает результат, который он ожидал увидеть лишь через годы. Карл Тайлс, ранее работавший специалистом по компьютерным наукам в Google DeepMind и знакомый с технологией компании, говорит, что метод позволяет приблизиться к качеству большой модели, не прогоняя через неё весь цикл вычислений, и называет его беспроигрышным решением для всех, кому нужно эффективно запускать модели.
Станислав Смирнов, профессор Женевского университета, лауреат Филдсовской премии 2010 года и главный научный сотрудник Mostik, говорит, что найти общий язык между двумя ИИ-моделями удивительно сложно: подходящего математического языка для этого пока попросту не существует. По его мнению, работа Mostik может также пролить свет на то, как ИИ-модели устроены на самом деле и насколько это похоже на работу человеческого мозга: более глубокий математический анализ способен выявить общее в том, как модели ИИ и люди рассуждают над сложными задачами.
В статье приводится и личная история Малышевой: интерес к математике у неё проснулся после того, как старший брат сказал, что ей не решить задачи математической олимпиады, которые он тогда изучал; позже она училась в одной из лучших школ Санкт-Петербурга. Когда она взялась за подход с «мостом» между моделями, часть коллег предупреждала, что это будет слишком сложно для «молодой девушки», по её словам, это лишь укрепило её решимость доказать обратное.
Ключевые факты
- Стартап российских математиков Mostik разработал способ обмена данными между ИИ-моделями напрямую через веса, без генерации текста.
- Демонстрация: мост между GLM-5.2 (753 млрд параметров) и Qwen-3.5 (4 млрд параметров), гибрид стоит в 20 раз дешевле полной GLM-5.2, а качество ровно посередине между ними.
- На этом же подходе построена модель, занявшая первое место в конкурсе ARC-AGI 3; подробности результата компания не раскрывает.
- Главный научный сотрудник Mostik, Станислав Смирнов, лауреат Филдсовской премии 2010 года, профессор Женевского университета.
- Метод может повысить ценность открытых моделей в конкуренции с закрытыми решениями Anthropic и OpenAI, но подходящего математического описания механизма, по словам Смирнова, пока не существует.
Почему это важно
Новый способ обмена информацией между ИИ-моделями, через числовые значения весов, а не через текст, потенциально эффективнее классического ансамблирования, где одна модель «читает» вывод другой. Если метод действительно работает так, как описан, он ставит под сомнение ставку индустрии на масштабирование как единственный путь роста качества: комбинирование разных моделей может оказаться более практичным способом получать возможности крупных моделей без их вычислительной цены.
Кому это важно
Разработчикам и пользователям открытых (open-weight) моделей, метод обещает поднять их конкурентоспособность против закрытых моделей Anthropic и OpenAI. Компаниям, которым нужно запускать ИИ дёшево и эффективно на ограниченном железе, включая мобильные устройства. Исследователям, изучающим совмещение крупных и узкоспециализированных моделей, например, для биологии или физики.
Как это применить
Пока это не готовый продукт, а демонстрация подхода: связка большой открытой модели GLM-5.2 (753 млрд параметров) и компактной Qwen-3.5 (4 млрд параметров, работает на мобильном устройстве) обходится в 20 раз дешевле полной GLM-5.2 при качестве ровно посередине между двумя моделями. По словам знакомых с командой специалистов, в перспективе так можно будет сочетать топовые модели с узкоспециализированными под конкретные области.
Можно ли доверять
Источник, авторитетное издание Wired, в статье цитируются несколько независимых специалистов (технический лидер Lovable, бывший сотрудник Google DeepMind), а главным научным сотрудником Mostik выступает Станислав Смирнов, лауреат Филдсовской премии 2010 года. При этом сама компания не раскрывает техническую суть механизма (по признанию Смирнова, подходящего математического языка для его описания пока нет), детали результата на ARC-AGI 3, а также данные о финансировании или дате основания, проверить заявления независимо пока нельзя.
Риски и подводные камни
Все приведённые числа относятся к одному демонстрационному примеру, а не к технологии в целом, неясно, насколько результат воспроизводим на других парах моделей. Компания сознательно скрывает детали своего топового результата на ARC-AGI 3, ссылаясь на желание выиграть конкурс, что затрудняет проверку. Оценки со стороны (представитель Lovable, бывший сотрудник Google DeepMind) дают люди, лично знакомые с командой, а не независимые тестировщики.
«Хорошо известно, что в машинном обучении ансамбли моделей работают лучше, чем отдельные модели»
— Саша Малышева, CEO Mostik