Представлена Intern-S2-Preview, научная агентная ИИ-модель на 397 млрд параметров

Научные открытия всё чаще требуют от ИИ-систем способности рассуждать над разнородными по модальности научными данными, взаимодействовать с научными инструментами и средами и удерживать прогресс на задачах с долгим горизонтом. Авторы представляют Intern-S2-Preview, серию научных агентных базовых ИИ-моделей, рассчитанных на мультимодальное научное понимание, рассуждение, генерацию и решение таких задач. Флагманская модель серии, Intern-S2-Preview-397B, насчитывает 397 млрд параметров.
Обучение начинается с научного мультимодального предобучения, на отрендеренных (представленных как изображения) научных документах, чередующихся данных «изображение-текст» и разнородных научных текстовых корпусах. От предобученного чекпоинта авторы переходят к единому пайплайну пост-тренировки: контролируемое дообучение (SFT), масштабируемое мультизадачное обучение с подкреплением (RL), агентное RL-обучение по методам чёрного и белого ящика и on-policy-дистилляция. Пайплайн поддержан набором технических приёмов для стабильности и эффективности прогонов и обучения: частичные прогоны с off-policy-коррекцией, адаптивная регуляризация длины ответа, онлайн-спекулятивное декодирование, устойчивая мультизадачная оптимизация и сборка данных опыта с учётом трасс выполнения для агентных задач.
На уровне архитектуры Intern-S2-Preview-397B расширяет работу с временными рядами, от эффективного понимания длинных последовательностей до числового прогнозирования. Отдельно исследуется Memory Decoder, модуль с расширенной памятью, предложенный как самостоятельный путь для быстрой научной специализации, не требующий изменения замороженного бэкбона на 397 млрд параметров.
По оценке авторов, на научных, мультимодальных, агентных и общих бенчмарках Intern-S2-Preview-397B показывает конкурентоспособные или лидирующие результаты в целом ряде сценариев, но текст не называет ни конкретные модели-конкуренты, ни сравнительные числа этих оценок. Модули для работы с временными рядами улучшают понимание научных сигналов и прогнозирование на бенчмарке SciTS; что именно измеряет этот бенчмарк, источник не поясняет. Единственные конкретные цифры во всём тексте относятся к отдельному расширению Intern-MemDec-4B (модуль Memory Decoder на 4 млрд параметров): оно поднимает средний балл на бенчмарке Biology-Instructions с 56,92 до 60,32, не меняя при этом замороженный бэкбон на 397 млрд параметров.
Ключевые факты
- Intern-S2-Preview, серия научных агентных базовых ИИ-моделей; флагман серии, Intern-S2-Preview-397B, имеет 397 млрд параметров и создан для мультимодального научного понимания, рассуждения, генерации и решения задач с долгим горизонтом.
- Обучение сочетает научное мультимодальное предобучение с единым пайплайном пост-тренировки, контролируемым дообучением, мультизадачным RL, агентным RL по методам чёрного и белого ящика и on-policy-дистилляцией, поддержанными приёмами для стабильности и эффективности обучения.
- На уровне архитектуры модель расширяет работу с временными рядами до числового прогнозирования, а отдельный модуль Memory Decoder (Intern-MemDec-4B, 4 млрд параметров) добавляет память для быстрой научной специализации без изменения замороженного бэкбона.
- По заявлению авторов, на научных, мультимодальных, агентных и общих бенчмарках модель показывает конкурентоспособные или лидирующие результаты, но конкретные модели-конкуренты и сравнительные числа в тексте не названы.
- Единственная числовая проверка результатов во всём тексте: Intern-MemDec-4B поднимает средний балл на бенчмарке Biology-Instructions с 56,92 до 60,32.
Почему это важно
Научная работа всё чаще требует от ИИ не одного навыка, а связки сразу нескольких: понимать разнородные данные, текст, изображения, таблицы, числовые ряды, пользоваться научными инструментами и средами и не терять нить на длинных, многошаговых задачах. Intern-S2-Preview, попытка собрать такую связку в одной базовой модели: научное мультимодальное предобучение плюс единый пайплайн пост-тренировки из контролируемого дообучения, мультизадачного RL, агентного RL по методам чёрного и белого ящика и on-policy-дистилляции. К этому добавлены архитектурные расширения, числовое прогнозирование временных рядов и отдельный модуль памяти Memory Decoder для быстрой специализации без переобучения всего бэкбона на 397 млрд параметров.
Кому это важно
В первую очередь, исследователям, которые строят ИИ-агентов для науки: пайплайн пост-тренировки и приёмы стабилизации RL-обучения (частичные прогоны с off-policy-коррекцией, адаптивная регуляризация длины ответа, онлайн-спекулятивное декодирование и другие), самостоятельный технический вклад, полезный при обучении похожих больших агентных моделей. Специалистам по биологии и другим естественным наукам интересен прикладной результат, рост среднего балла на бенчмарке Biology-Instructions. Тем, кто работает с временными рядами и научным прогнозированием, важно архитектурное расширение для числового прогнозирования.
Как это применить
Текст представляет Intern-S2-Preview как исследовательскую разработку, в характерном для научного препринта безличном стиле «мы представляем». Будут ли модель или её веса доступны публично, выложат ли их как открытый код или для скачивания, источник не сообщает. Практический эффект пока показан только на бенчмарках: рост среднего балла на Biology-Instructions с 56,92 до 60,32 благодаря модулю Memory Decoder и улучшение результатов на SciTS благодаря модулям для временных рядов.
Можно ли доверять
Текст источника не называет ни имён исследователей, ни организации, ни аффилиации, обычная черта препринта, написанного от лица «мы». Центральное заявление, что модель показывает конкурентоспособные или лидирующие результаты на научных, мультимодальных, агентных и общих бенчмарках, не подкреплено в тексте ни названиями моделей-конкурентов, ни сравнительными числами: единственные конкретные цифры во всём материале относятся к одному бенчмарку, Biology-Instructions. Остальные заявленные результаты стоит воспринимать как предварительные, до независимой проверки. На Hugging Face материал набрал 36 отметок при 0 комментариях, заметный, но не бурно обсуждаемый интерес.
Риски и подводные камни
Главный риск, разрыв между широтой заявлений и глубиной подтверждений: авторы говорят о конкурентоспособных или лидирующих результатах сразу в четырёх категориях бенчмарков, научных, мультимодальных, агентных и общего назначения, но числами в тексте подкреплена только одна пара показателей на одном бенчмарке, Biology-Instructions. Источник не поясняет, что именно измеряют SciTS и Biology-Instructions и как считаются их баллы, это мешает независимо оценить, насколько существенны заявленные улучшения. Не сказано и о том, станут ли модель или её веса публично доступны, а значит, пока неясно, сможет ли кто-то за пределами авторов воспроизвести или проверить результаты.