Loopie: зацикленный трансформер взял золото IMO и IPhO без инструментов

Zitian Gao опубликовал препринт о Loopie, по его словам, самом мощном «зацикленном» трансформере (looped Transformer) на сегодняшний день. В отличие от обычного трансформера, зацикленная архитектура несколько раз пропускает данные через один и тот же блок весов вместо того, чтобы наращивать число уникальных параметров, это потенциально дешевле в обучении и хранении, но у подхода долго была известная слабость: при увеличении бюджета вычислений в N раз простое увеличение числа параметров модели в N раз обычно давало лучший результат, чем N-кратное зацикливание той же модели.
Автор утверждает, что Loopie решает эту проблему. Линейка состоит из двух моделей на основе смеси экспертов (Mixture-of-Experts, MoE): модели на 20 млрд параметров с 2 млрд «активных» (задействованных при инференсе) и модели на 6 млрд параметров с 0,6 млрд активных. В серии абляционных экспериментов, включая прямое сравнение с обычной MoE-моделью того же класса, 30B-A3B (30 млрд параметров, 3 млрд активных), Loopie при равном бюджете вычислений заметно превзошла базовые трансформерные модели.
Отдельно автор описывает новый пайплайн пост-обучения (дообучения после предобучения), который придал моделям сильные способности к рассуждению. По его заявлению, на Международной математической олимпиаде (IMO) и Международной физической олимпиаде (IPhO) 2025 года Loopie показала результат уровня золотой медали, причём без использования внешних инструментов (калькуляторов, кода и подобного), то есть решая задачи «в уме».
Ключевые факты
- Loopie, новый «зацикленный» трансформер (looped Transformer), заявленный автором как самый мощный в своём классе на сегодня
- Линейка из двух MoE-моделей: 20 млрд параметров (2 млрд активных) и 6 млрд параметров (0,6 млрд активных)
- В сравнении с обычной MoE-моделью 30B-A3B при равном бюджете вычислений Loopie её превзошла, это решает давнюю проблему looped-архитектур, где рост числа параметров в N раз обычно выигрывал у N-кратного зацикливания
- Новый пайплайн пост-обучения дал моделям сильные способности к рассуждению
- На Международной математической (IMO) и физической (IPhO) олимпиадах 2025 года Loopie показала результат уровня золотой медали без использования внешних инструментов
Почему это важно
Зацикленные трансформеры давно считались тупиковой веткой: при равном бюджете вычислений проще было один раз увеличить число параметров модели, чем несколько раз пропускать данные через одни и те же веса. Loopie, заявка на то, что это давнее ограничение можно преодолеть: по данным автора, при равном бюджете вычислений модель превзошла обычный трансформер сопоставимого класса (30B-A3B). Если результат подтвердится, это открывает путь к моделям, которые дешевле в хранении (меньше уникальных параметров) при сравнимом или лучшем качестве.
Кому это важно
В первую очередь, исследователям архитектур трансформеров и MoE-моделей, ищущим способы снизить стоимость обучения и инференса без потери качества. Также релевантно командам, оценивающим модели по способности решать сложные математические и физические задачи без внешних инструментов: результаты на IMO и IPhO 2025 года заявлены как ориентир для сравнения способностей к рассуждению.
Как это применить
В тексте препринта нет сведений о публикации весов моделей, доступе через API или иной форме релиза, только описание архитектуры, экспериментов и результатов на олимпиадах. Практически применить Loopie сейчас можно только опосредованно: изучить предложенный автором пайплайн пост-обучения и схему абляционных экспериментов как методологию для собственных исследований в области looped-архитектур.
Можно ли доверять
Материал, самостоятельно опубликованный препринт на HuggingFace Papers; в карточке указан один автор, Zitian Gao, хотя по формату страницы вероятны и другие соавторы, не перечисленные в доступном тексте. Заявленные результаты (обгон 30B-A3B, золотые медали на IMO и IPhO), это утверждения самого автора из аннотации, без указания на независимую проверку или рецензирование в тексте. Аффилиация автора в доступном тексте не указана, оценить репутацию стоящей за работой команды по источнику нельзя, так что к громким формулировкам («самый мощный looped-трансформер») стоит относиться с осторожностью до независимого воспроизведения.
Риски и подводные камни
«Результат уровня золотой медали», сильное заявление, но в доступном тексте нет ни конкретных баллов, ни методологии оценки, ни сравнения с результатами других моделей на тех же олимпиадах, это затрудняет самостоятельную проверку. Препринты с впечатляющими бенчмарками нередко страдают от утечки данных теста в обучающую выборку или от выборочной подачи результатов; без рецензирования и воспроизведения третьими сторонами такие цифры стоит воспринимать как предварительные.
«На Международной математической (IMO) и физической (IPhO) олимпиадах 2025 года Loopie показывает результат уровня золотой медали без использования инструментов.»
— из аннотации препринта, Zitian Gao