NVIDIA дообучила Nemotron 3 до золотого уровня на IMO и IOI 2026

NVIDIA дообучила Nemotron 3 до золотого уровня на IMO и IOI 2026

Команды Nemotron (NVIDIA) в блоге на Hugging Face сообщают, что, начав с моделей Nemotron 3, они применили supervised fine-tuning (SFT, обучение на размеченных примерах), reinforcement learning (RL, обучение с подкреплением) и инференс с обратной связью и получили системы золотого уровня на международных олимпиадах по математике (IMO 2026) и по информатике (IOI 2026).

Важные оговорки. Результат на IOI получен в живом прогоне при тех же ограничениях по времени, доступу в интернет и сдаче решений, что и у участников-людей, но это был неофициальный прогон без надзора, и в официальный рейтинг IOI он не вошёл. Доказательства IMO-системы оценивали официальные проверяющие IMO.

Рецепт специализации, по словам авторов, состоит из четырёх частей: сильная базовая модель Nemotron; подбор задач предметной области и качественных цепочек рассуждений; стандартное дообучение (SFT и, где полезно, RL); цикл вывода, который генерирует, оценивает и улучшает варианты ответа. Новую базовую модель для каждой задачи строить не пришлось.

IOI (олимпиадное программирование). Авторы отобрали 22 000 задач и сгенерировали синтетические цепочки рассуждений для двух специалистов. Nemotron-3-Nano-CC (30 млрд параметров всего, 3 млрд активных) прошла SFT и RL; Nemotron-3-Ultra-CC (550 млрд всего, 55 млрд активных), только SFT. На IOI 2025 Nano выросла со 130 баллов до обучения до 280 после SFT и 291 после RL. С методом GenCorrect (итеративный цикл «сгенерировать, оценить, доработать») она набрала 468 баллов и перешла порог золота 438,3; Ultra-CC с той же стратегией набрала 502. У Nano основной прирост дал SFT, RL добавил меньший, но стабильный. У Ultra одной эпохи SFT хватило, чтобы обойти полностью дообученную Nano на IOI, ICPC и LiveCodeBench Pro. Это определило конкретную систему Ultra-CC для IOI 2026, набравшую 535,4 из 600 (неофициально).

IMO (математические доказательства). Из Nemotron 3 Ultra обучили двух специалистов: одного через SFT, другого через RL. SFT-корпус, 414 890 отфильтрованных по качеству примеров на 15 818 уникальных задачах на доказательство; он охватывал генерацию доказательств, их доработку, проверку и метапроверку, то есть модель училась строить аргументы, находить пробелы, отвечать на критику и судить, полно ли доказательство. RL-модель обучали на 9 597 задачах, подобранных у границы её возможностей. В экспериментах обе дообученные версии превзошли общедоступную модель: SFT-версия сильнее в первом раунде поиска, RL-версия лучшая среди одиночных чекпойнтов. Их сильные стороны дополняют друг друга, поэтому итоговая система использовала обоих специалистов вместе с общей моделью.

Для каждой задачи IMO модели генерировали кандидатные доказательства, оценивали их, писали критику и дорабатывали самые перспективные; итоговый вариант выбирала отдельная ресурсоёмкая стадия. Система работала целиком на естественном языке, без формального верификатора, внешних инструментов и интернета. Итог: 30 баллов из 42, полный балл по четырём задачам из шести, выше официального порога золота.

Главный вывод авторов: медали дали не одно дообучение и не одно массовое сэмплирование, а совместное проектирование модели, данных и цикла вывода. На IMO использование взаимодополняющих SFT- и RL-чекпойнтов оказалось ценнее, чем простое увеличение числа сэмплов из одного чекпойнта.

Что опубликовано. Коллекция Nemotron Labs IMO 2026 на Hugging Face включает SFT- и RL-чекпойнты, оба обучающих набора и Nemotron-IMO-Bench, новый бенчмарк из 200 задач олимпиадного уровня. Модель Nemotron-3-Ultra-CC доступна на Hugging Face. В репозитории NeMo-Skills лежат конвейер вывода для IMO, промпты, поданные доказательства и быстрый старт для воспроизведения, а также конвейер оценки и вывода для IOI. Подробности описаны в статьях по IMO и по IOI.

Ключевые факты

  • NVIDIA заявляет о золотом уровне систем на базе Nemotron 3 на IMO 2026 и IOI 2026; IOI-прогон неофициальный и в рейтинг не включён.
  • IMO: 30 баллов из 42, полный балл по четырём задачам из шести; доказательства проверяли официальные проверяющие, система работала без формального верификатора, инструментов и интернета.
  • IOI: Ultra-CC набрала 535,4 из 600 в неофициальном живом прогоне; на IOI 2025 Nano с GenCorrect набрала 468 баллов при пороге золота 438,3, Ultra-CC, 502.
  • Для Nano основной прирост дал SFT (130 → 280 баллов, после RL, 291); для Ultra одной эпохи SFT хватило, чтобы обойти дообученную Nano.
  • Опубликованы чекпойнты, датасеты, бенчмарк Nemotron-IMO-Bench (200 задач), модель Ultra-CC и конвейеры в NeMo-Skills.

Почему это важно

Олимпиады по математике и информатике, один из самых жёстких тестов рассуждения. NVIDIA показывает, что один семейный набор моделей Nemotron 3 при стандартном дообучении (SFT, RL) и цикле «сгенерировать, проверить, доработать» доходит до золотого уровня в обоих соревнованиях. Авторы подчёркивают: результат дала связка модели, данных и цикла вывода, а не одно дообучение или перебор вариантов. Заметное наблюдение: чем сильнее базовая модель (Ultra), тем меньше нужно этапов, одной эпохи SFT хватило, чтобы обойти полностью дообученную Nano.

Кому это важно

Исследователям рассуждающих моделей и командам, которые специализируют открытые модели под сложные предметные задачи: опубликованы чекпойнты, обучающие наборы, бенчмарк Nemotron-IMO-Bench из 200 задач и конвейеры. Также интересно тем, кто строит системы с проверкой собственных ответов: описаны генерация, оценка, критика и доработка кандидатов.

Как это применить

Авторы описывают повторяемый рецепт из четырёх частей: сильная базовая модель, подбор задач и качественных цепочек рассуждений, SFT и при необходимости RL, цикл вывода с генерацией, оценкой и улучшением ответов. Материалы выложены на Hugging Face (коллекция Nemotron Labs IMO 2026, модель Nemotron-3-Ultra-CC) и в репозитории NeMo-Skills: конвейер вывода для IMO, промпты, поданные доказательства, быстрый старт, конвейер оценки и вывода для IOI. Условия лицензий и требования к оборудованию в источнике не приведены.

Можно ли доверять

Источник, собственный блог команд Nemotron, то есть заявления самих разработчиков. Оценка IMO сделана официальными проверяющими. IOI-прогон авторы сами называют неофициальным и проведённым без надзора, в официальный рейтинг он не вошёл. Порог 438,3 относится к IOI 2025, а не к IOI 2026. Сравнения с результатами других лабораторий в посте нет, как и числа участников-людей. Количественных данных о сравнении IMO-чекпойнтов с общедоступной моделью тоже нет.

Риски и подводные камни

Золотой уровень на IOI 2026 основан на неофициальном прогоне, поэтому его нельзя приравнивать к месту в рейтинге. Обучение и вывод, по словам авторов, были масштабными, но данных о вычислительном бюджете в посте нет, так что стоимость воспроизведения оценить нельзя. Итоговые результаты получены не одной моделью, а системой с несколькими специалистами и ресурсоёмким отбором финального ответа, одиночная модель такого уровня не гарантирована.