Reflection анонсировала Beam, открытую модель на 501 млрд параметров

Reflection анонсировала Beam, открытую модель на 501 млрд параметров

5 октября 2026 года компания Reflection анонсировала Beam, свою первую модель с открытыми весами. Это разреженная модель Mixture-of-Experts (смесь экспертов): 501 млрд параметров в сумме и 23 млрд активных на каждый токен. Заявленное назначение, программирование, рассуждения и агентные задачи. Веса пока не опубликованы: Reflection сообщает, что Beam проходит финальный red-teaming (проверку на устойчивость к злоупотреблениям) и оценки, открыта запись на ранний доступ, а веса, технический отчёт, карточку модели и материалы для разработчиков компания обещает выпустить «позже в этом месяце».

Предобучение шло на 23,8 трлн токенов из веба и проприетарных лицензированных датасетов. По заявлению Reflection, базовая модель соответствует доступным открытым базовым моделям сопоставимого размера или превосходит их. Архитектура сочетает чередующееся локальное и глобальное внимание, мелкозернистые маршрутизируемые эксперты, контролируемый остаточный поток и несколько видов балансировки нагрузки между экспертами. За основу взята балансировка без вспомогательной функции потерь (DeepSeek-AI и соавторы, 2024), к которой добавлено косинусное затухание обновлений смещений экспертов, чтобы снизить возмущения маршрутизации на поздних этапах обучения.

Главная ставка, обучение с подкреплением (RL) в большом масштабе. В ходе RL-прогона было сгенерировано более 100 млн роллаутов (прогонов агента по задаче) на 10,5 тыс. GPU NVIDIA GB300 за 4 недели, максимальная длина контекста роллаутов, 256 тыс. токенов; на обучение и проверку ушло примерно 1,3 млрд песочниц. Reflection считает, что это один из крупнейших RL-прогонов среди открытых лабораторий на сегодня. Для него собрали пул почти из миллиона сред, в основном синтетическими конвейерами, плюс данные вендоров и открытые источники, по программной инженерии, работе в терминале, соревновательному программированию, STEM, веб-поиску, использованию инструментов и общей интеллектуальной работе. Задачи многократно фильтровали по сложности и качеству; по словам компании, компромиссы в качестве данных приводили к плато возможностей, а возможности росли вместе с RL-вычислениями без признаков насыщения.

Обучение шло асинхронными градиентами политики. Чтобы справиться с устареванием политики и расхождением между движками обучения и инференса, Reflection разработала новые алгоритмы; в итоге полностью асинхронный RL оставался устойчивым даже при обучении на взаимодействиях, сгенерированных более суток назад. Модель обучали с управляемым штрафом за длину: сначала качество росло при сокращении ответов, затем длина вернулась вверх вместе с агентными навыками, но уже с пользой. Пользователь регулирует баланс параметром reasoning effort: низкие значения дают короткие ответы, высокие позволяют рассуждать дольше. Ещё одно наблюдение: при обучении на рассуждениях, разработке ПО и терминальных задачах выросло качество веб-браузинга, хотя таких задач в RL-смеси не было; получив доступ в сеть, Beam сам научился обращаться к другим большим языковым моделям и использовать OCR-интерфейсы для чтения документов.

По возможностям Reflection заявляет, что Beam продвигает западный фронтир открытых весов, конкурентоспособен с более крупными открытыми моделями вроде GLM 5.2 и приближается к Qwen 3.8-Max в кодинге и агентных задачах. Передовые открытые модели вроде Kimi K3 остаются впереди по «сырым» возможностям; преимущество Beam, по словам компании, эффективность инференса: на сложных бенчмарках рассуждения он даёт результаты, сопоставимые с GLM-5.2, при вычислениях на инференсе в 3, 4 раза меньше. Для моделей класса 2T+ параметров, таких как Qwen 3.8-Max, выигрыш, как утверждается, ещё заметнее. Beam работает только с текстом, хотя может использовать информацию других модальностей, если она представлена как текст. В примерах, живая панель нью-йоркского метро на открытых данных и ноутбук для дообучения Gemma-4 на задаче Text2SQL.

Отдельный раздел посвящён инфраструктуре. В среднем поддерживалось 110 тыс. одновременных роллаутов; соотношение GPU под инференс и обучение менялось от 3,9:1 до 5,4:1, а тренер перестраивали между пятью конфигурациями GPU без потери состояния. Новые веса доходили до флота инференса в среднем примерно за 12 секунд (медиана); иерархическая раздача сократила межстоечный трафик на 75% и ускорила распространение весов в 2,2 раза по сравнению с прямой загрузкой каждой репликой. За прогон пережили 71 инцидент на стороне инференса без остановки обучения, медиана восстановления мощности, восемь минут, потерянная ёмкость составила 0,02% GPU-минут. Платформа выдерживала до 170 тыс. одновременных песочниц, обработала более миллиарда запросов на их создание на 20+ кластерах, в двух облаках и четырёх регионах; 90% новых песочниц были готовы менее чем за 10 секунд. Динамическая упаковка держала обучающие батчи заполненными в среднем на 99,99%, а пропускная способность на GPU менялась в пределах 1,5%, пока средняя длина роллаута выросла почти на 70%. Независимые судьи перепроверяли успешные решения на эксплойты верификатора.

Текст анонса в доступном виде обрывается в разделе о предобучении.

Ключевые факты

  • Beam, первая модель Reflection с открытыми весами: разреженная MoE на 501 млрд параметров, из них 23 млрд активных, для кодинга, рассуждений и агентных задач.
  • Веса, технический отчёт и карточка модели обещаны «позже в этом месяце»; пока идёт финальный red-teaming, открыта запись на ранний доступ.
  • Предобучение на 23,8 трлн токенов; RL-прогон: свыше 100 млн роллаутов на 10,5 тыс. GPU GB300 за 4 недели, контекст до 256 тыс. токенов.
  • По заявлению Reflection, Beam сопоставим с GLM-5.2 на сложных бенчмарках рассуждения при вычислениях на инференсе в 3, 4 раза меньше; Kimi K3 по «сырым» возможностям остаётся впереди.
  • Модель только текстовая; глубину рассуждения задаёт параметр reasoning effort.

Почему это важно

Reflection впервые выпускает собственную модель с открытыми весами и позиционирует её как продвижение западного фронтира открытых весов. Ставка сделана не на лидерство по «сырым» возможностям (здесь, по словам компании, впереди Kimi K3), а на эффективность: сопоставимые с GLM-5.2 результаты на сложных бенчмарках рассуждения при 3, 4-кратно меньших вычислениях на инференсе. Если это подтвердится, для тех, кто сам разворачивает модель, это означает более низкую цену за токен.

Кому это важно

Командам, которым нужна открытая модель для программирования и агентных рабочих процессов, особенно в корпоративной среде: Reflection называет Beam «рабочей лошадкой» для таких задач. Также интересно исследователям RL и инженерам инфраструктуры: анонс подробно описывает асинхронное обучение, песочницы и устойчивость к сбоям на большом масштабе.

Как это применить

Пока модель недоступна для скачивания: Reflection обещает выложить веса, технический отчёт, карточку модели и материалы для разработчиков позже в октябре 2026 года, точной даты нет. Сейчас можно записаться на ранний доступ по ссылке из анонса. Глубину рассуждений регулируют параметром reasoning effort: низкие значения дают короткие ответы, высокие, более длинные рассуждения для сложных задач. Beam только текстовый. Лицензия, цены, доступ по API и требования к железу для инференса в тексте анонса не указаны.

Можно ли доверять

Источник, официальный анонс самой Reflection, все сравнения с другими моделями её собственные, независимой проверки нет. Результаты бенчмарков приведены на рисунке, которого нет в текстовой версии, поэтому конкретных баллов в пересказе нет. Утверждение об «одном из крупнейших RL-прогонов среди открытых лабораторий» компания формулирует как своё убеждение. Доступная часть текста обрывается на разделе о предобучении.

Риски и подводные камни

Веса ещё не опубликованы, обещание дано без точной даты, а модель проходит финальный red-teaming и оценки, так что итоговые характеристики могут уточниться. Преимущество в эффективности и сравнение с GLM 5.2 и Qwen 3.8-Max пока опираются только на заявления разработчика. По самой компании, на «сырых» возможностях Beam уступает передовым открытым моделям вроде Kimi K3. Условия лицензии неизвестны, а от них зависит, как именно модель можно использовать.

«Там, где передовые открытые модели вроде Kimi K3 остаются впереди по «сырым» возможностям, преимущество Beam, эффективность на этапе инференса.»

— Reflection, анонс Beam