Frontis-MA1 обошла GPT-5.5 с Codex в тестах на инженерию ML

Frontis-MA1 обошла GPT-5.5 с Codex в тестах на инженерию ML

Рекурсивное самоулучшение (recursive self-improvement, RSI), способность ИИ-систем совершенствовать сам процесс создания ИИ (это называют AI4AI, «ИИ для ИИ»). Авторы работы, группа во главе с Junlin Yang, выбрали инженерию машинного обучения (MLE) как конкретный измеримый полигон для изучения RSI: результат каждого шага, работающий код, который можно выполнить и объективно оценить. Команда представила OpenMLE, открытый полный стек для исследований RSI в MLE из трёх частей: OpenMLE-Gym (проверяемые задачи с обратной связью по факту исполнения кода), OpenMLE-RL (обучение операторов методом обучения с подкреплением) и OpenMLE-Evo (долгосрочный поиск решений).

На основе этого стека исследователи дообучили модель Frontis-MA1 (35 млрд параметров) как агента мета-эволюции для MLE. Модель научили четырём базовым операторам эволюции программ: Draft (создание черновика решения), Improve (улучшение), Debug (отладка) и Crossover (скрещивание, комбинирование удачных решений). Эти операторы обучались через контролируемое дообучение (SFT) и обучение с подкреплением (RL), привязанные к реальному выполнению кода, на данных, из которых заранее удалили пересечения со всеми оценочными бенчмарками (чтобы модель не подсматривала ответы); затем операторы объединили в цикл долгосрочного поиска, где обучение и эволюция решений происходят совместно, в одном контуре.

На бенчмарке MLE-Bench Lite, при бюджете 12 часов на задачу и запуске на одной видеокарте RTX 4090 с ограничением 12 ГБ видеопамяти, Frontis-MA1 подняла среднюю долю медалей (Medal Average) с 39,39% у базовой модели до 60,61% за счёт OpenMLE-Evo и до 71,21% с OpenMLE-Evo-Max (версия с опытом, не привязанным к конкретному бенчмарку, и асинхронным поиском). Это превышает результат связки GPT-5.5 с Codex и приближается к показателям GPT-5.6 Sol и модели Kimi K3 (2,8 трлн параметров).

На отдельном тестовом наборе NatureBench Lite вклад модели и вклад поисковой системы (framework) переносятся независимо друг от друга: при неизменном framework замена базовой модели на обученную поднимает долю решений на уровне SOTA (Match-SOTA) с 50% до 70%; при неизменной модели включение OpenMLE-Evo поднимает тот же показатель с 20% до 50%.

Авторы выложили в открытый доступ и веса модели Frontis-MA1, и весь стек OpenMLE, код опубликован на GitHub (FrontisAI/OpenRSI), чтобы исследования исполняемого AI4AI на пути к рекурсивному самоулучшению можно было воспроизвести независимо.

Ключевые факты

  • OpenMLE, открытый стек (OpenMLE-Gym, OpenMLE-RL, OpenMLE-Evo) для исследований рекурсивного самоулучшения ИИ в инженерии машинного обучения.
  • Frontis-MA1 (35 млрд параметров), агент мета-эволюции, обученный четырём операторам эволюции программ: Draft, Improve, Debug, Crossover.
  • На MLE-Bench Lite (RTX 4090, 12 ГБ видеопамяти, 12 часов на задачу) Medal Average выросла с 39,39% до 60,61% (OpenMLE-Evo) и до 71,21% (OpenMLE-Evo-Max), выше GPT-5.5 с Codex, близко к GPT-5.6 Sol и Kimi K3 (2,8 трлн параметров).
  • На NatureBench Lite модель и поисковый framework дают независимый вклад: Match-SOTA растёт с 50% до 70% при замене модели и с 20% до 50% при замене framework.
  • Веса модели и весь стек OpenMLE выложены в открытый доступ на GitHub (FrontisAI/OpenRSI).

Почему это важно

Рекурсивное самоулучшение, ИИ, который совершенствует процесс создания ИИ, одна из ключевых тем ИИ-исследований, но чаще она обсуждается в теории. Авторы выбрали инженерию машинного обучения как измеримый полигон: результат каждого шага, работающий или неработающий код, который можно исполнить и оценить. На этом полигоне Frontis-MA1 показала измеримый рост качества решений именно за счёт того, что научилась применять операторы улучшения кода (Draft, Improve, Debug, Crossover), а не просто выдавать готовый ответ.

Кому это важно

Исследователям и инженерам, которые строят автономных ИИ-агентов для дата-сайентистских задач (AutoML, автонастройка пайплайнов, соревнования вроде Kaggle). Также релевантно сообществу безопасности ИИ, которое следит за прогрессом систем, способных самостоятельно улучшать собственную разработку, это прямой индикатор скорости приближения к рекурсивному самоулучшению.

Как это применить

Авторы выложили в открытый доступ и веса модели Frontis-MA1, и весь стек OpenMLE (код: github.com/FrontisAI/OpenRSI), включая среду с проверяемыми задачами и обратной связью по факту исполнения кода (OpenMLE-Gym). Результаты получены на одной видеокарте RTX 4090 с ограничением 12 ГБ видеопамяти при бюджете 12 часов на задачу, эксперимент можно воспроизвести без кластера, на одной потребительской карте.

Можно ли доверять

Работу опубликовала независимая исследовательская группа, а не одна из крупных ИИ-лабораторий, и цифры (39,39% → 60,61% → 71,21% по Medal Average, 50%→70% и 20%→50% по Match-SOTA), это самостоятельно заявленные авторами результаты статьи, пока не проверенные сторонними тестами. При этом код и веса открыты, что делает результаты воспроизводимыми и проверяемыми независимо, а сравнение проводится с конкретными названными ориентирами (GPT-5.5 с Codex, GPT-5.6 Sol, Kimi K3), а не с абстрактными заявлениями.

Риски и подводные камни

Прогресс показан на узком типе задач, инженерии машинного обучения на бенчмарках MLE-Bench Lite и NatureBench Lite, и неясно, насколько результат переносится на другие домены. Системы, которые сами улучшают процесс создания ИИ, это ровно тот класс технологий, для которого вопросы контроля и надзора наиболее чувствительны: чем быстрее ИИ учится улучшать инженерию ИИ, тем быстрее может расти сложность систем, которые человеку придётся контролировать.