Intern-S2-Mobius: новая архитектура ускорила инференс модели почти в 4 раза

Авторы работы представили Mobius-v0, архитектуру нейросети, которая разделяет хранение знаний и рассуждение на два отдельных механизма. В ней есть общий блок Памяти (реализован как полносвязная сеть, FFN), где хранятся векторы знаний, и несколько блоков Рассуждения (реализованы как self-attention, механизм самовнимания), которые итеративно строят составные выводы. Рассуждающие блоки используют скрытые состояния как кэш и переносчик информации: они многократно обращаются к Памяти за нужными векторами знаний, а Память передаёт их обратно в блоки рассуждения. За счёт такого разделения знания-и-рассуждения, по утверждению авторов, архитектура достигает лучшего сжатия знаний и более эффективного рассуждения.
На основе Mobius-v0 показаны два результата. Во-первых, модель на 7 миллиардов параметров, обученная с нуля на этой архитектуре, достигает того же результата на итоговых задачах (downstream score), что и базовый трансформер той же размерности (7B), но используя всего 62,6% объёма обучающих данных, которые потребовались базовой модели. Во-вторых, Intern-S2-Mobius, модель, дообученная (continual pretraining) на основе Qwen3.5-35B (35 миллиардов параметров), показывает такой же итоговый результат, но при этом почти в 4 раза быстрее в сквозном инференсе (end-to-end inference) по сравнению с базовой моделью.
Ключевые факты
- Mobius-v0, архитектура с общей Памятью (FFN), хранящей векторы знаний, и несколькими блоками Рассуждения (self-attention), которые итеративно обращаются к Памяти за нужными знаниями
- 7B-модель, обученная с нуля на Mobius-v0, достигает результата 7B-трансформера, используя 62,6% объёма его обучающих данных
- Intern-S2-Mobius, дообученная на основе Qwen3.5-35B, показывает такой же итоговый результат при почти 4-кратном ускорении сквозного инференса
- Авторы заявляют, что разделение знаний и рассуждения даёт лучшее сжатие знаний и более эффективное рассуждение
Почему это важно
Большинство современных языковых моделей хранят знания и логику рассуждения в одних и тех же слоях трансформера, что делает их дорогими в обучении и в инференсе. Mobius-v0 предлагает архитектурное разделение: знания живут отдельно в блоке Памяти, а рассуждение, в отдельных блоках, которые обращаются к Памяти по мере необходимости. Заявленный результат, сопоставимое качество при заметно меньших затратах: 62,6% данных для обучения с нуля и почти четырёхкратное ускорение инференса при дообучении поверх существующей модели.
Кому это важно
В первую очередь, исследователям и инженерам, которые занимаются архитектурами языковых моделей и оптимизацией инференса: снижение затрат на обучение и ускорение генерации ответов напрямую влияют на стоимость эксплуатации таких моделей. Полезно и командам, которые дообучают крупные открытые модели (в примере, Qwen3.5-35B) и ищут способы ускорить готовую модель без потери качества.
Как это применить
В источнике нет ни даты релиза, ни сведений о доступности кода или весов моделей, узнать, можно ли уже использовать Mobius-v0, Mobius-7B или Intern-S2-Mobius, из текста нельзя. Также не указано, на каких именно тестах (бенчмарках) измерялось «сопоставимое» качество, поэтому судить о применимости результатов к конкретным задачам преждевременно.
Можно ли доверять
Материал, научная публикация, но текст источника (аннотация) короткий: он не называет ни авторов, ни организацию, ни методику измерения ускорения и объёма данных. Заявленные цифры (62,6% данных, почти 4-кратное ускорение) представлены авторами работы, независимой проверки в источнике нет. Указание, что Intern-S2-Mobius дообучена именно от Qwen3.5-35B, позволяет сопоставить результат с конкретной базовой моделью, что добавляет проверяемости.
Риски и подводные камни
Ускорение и экономия данных приведены только в относительных величинах, абсолютных цифр по задержке или пропускной способности в источнике нет, из-за чего сложно оценить реальный практический выигрыш. Неясно также, насколько результаты переносятся на модели других размеров и на задачи за пределами тех бенчмарков, что использовались авторами (какие именно, не сообщается).