Qwen выпустила Qwen3.8-Max, модель на 2,4 трлн параметров с открытыми весами
3 августа 2026 года команда Qwen выпустила Qwen3.8-Max, по её словам, самую мощную модель линейки за всё время и первую модель класса Qwen-Max, чьи веса станут открытыми. Модель построена на архитектуре Qwen 3.5, масштабирована до 2,4 трлн параметров (95 млрд активных на каждый запрос) и уже доступна по API через QwenCloud; открытые веса обещают выложить на Hugging Face и ModelScope «на следующей неделе» без точной даты.
Основной упор релиза, на автономную работу без участия человека. Команда описывает три многодневных кодинг-кейса. В первом Qwen3.8-Max больше 10 дней без остановки строил проект oh-my-cli, «самообновляющийся» инструмент, который сам превращает пожелания пользователей в задачи, распределяет их между агентами и прогоняет через тесты. По состоянию на 30 июля 2026 года, после примерно 16 дней полностью автономной работы, репозиторий накопил 265 коммитов, 127 pull request'ов и 151 issue. Во втором кейсе модели дали свежую научную статью «Unified Data Selection for LLM Reasoning», про то, какие обучающие примеры выгоднее оставлять, если данных больше, чем можно позволить себе использовать для тренировки, без стартового кода. За примерно пять суток (около 125 часов непрерывной работы) Qwen3.8-Max написала около 7600 строк кода, совершила свыше 1100 действий и провела 33 раунда GPU-обучения: сначала за ~37 часов воспроизвела все шесть ключевых выводов статьи (метод отбора данных из статьи обходит случайный выбор данных на 7,7% по бенчмарку AIME24), а затем ещё 88 часов сама выдвигала и проверяла гипотезы, 18 идей за четыре раунда, и в итоге придумала метод, который превзошёл подход авторов статьи на 2,7 пункта по тому же AIME24. В третьем кейсе модель за 24 часа собрала решение для реального онлайн-конкурса WWW2025 Multimodal Dialogue Intent Recognition Challenge на платформе Alibaba Cloud Tianchi, где соревновались 526 команд из людей: для текста дообучила и объединила несколько китайских языковых моделей (BERT, MacBERT, RoBERTa), для скриншотов, визуально-языковую модель Qwen2.5-VL-7B с опорой на Chinese-CLIP, а голоса всех моделей свела во взвешенное голосование. За 45 попыток точность выросла с 0,60 до 0,853, что обошло 458 из 526 команд-людей (87% участников).
Отдельный блок посвящён «рабочим» задачам за пределами кода: команда масштабировала обучение с подкреплением на нескольких агентных средах (QwenWork, Claude Code, Codex, OpenClaw, Hermes) и проверила модель на сотнях профессий. Среди приведённых примеров: комплаенс-юрист, модель нашла 1284 релевантных пункта в корпусе из сотен документов и уложилась в час против недели работы команды параюристов; UI/UX-дизайнер, с первого раза без правок собрала интерактивный прототип банковского приложения NOVA из 8 экранов, тогда как обычный процесс требует 3-5 раундов доработки; ресторатор, по более чем сотне закупочных брифов составила меню из 26 блюд с расчётом калорийности и себестоимости на уровне 33,8%; инженер-строитель, по одному комплекту чертежей восстановила сейсмическую модель 30-этажного офисного здания с интерактивным просмотром характеристик, на что обычно уходит больше недели ручной работы; реабилитолог, превратила плоскую бумажную форму осмотра в 3D-модель с послойными анатомическими слоями; спортивный аналитик, разобрала около 8400 игровых эпизодов на игрока в тактический профиль и отчёт тренера за десятки минут.
В отдельном показательном кейсе Qwen3.8-Max по одной короткой формулировке задачи самостоятельно спланировала и за несколько часов построила полноценную стратегию ротации ETF: собрала систему данных, базовые факторы и провела несколько раундов их отбора, по ходу распознавая переобучение и меняя подход. В параллельном тесте на широту модель развернула около 330 суб-агентов, которые по шести классическим группам факторов (моментум, стоимость, качество, инвестиции, низкий риск, настроения) сгенерировали 50 направлений исследования каждая и прогнали около 6000 бэктестов; отобранные факторы показали избыточный коэффициент Шарпа от 0,64 до 1,48.
В тесте на долгий горизонт планирования модель самостоятельно спроектировала цифровую схему, криптографический ускоритель GCD/RSA, от логики до топологии кристалла. За один непрерывный автономный прогон примерно из 500 «ходов», 71 проверки и 13 контрольных этапов Qwen3.8-Max сократила число логических вентилей первой рабочей версии схемы с 8298 до 678, лучший результат среди всех сравниваемых моделей, а физическую топологию кристалла уменьшила со 106×106 мкм² (с общей длиной проводников 33 369 мкм) до 46×46 мкм² (4187 мкм), то есть сократила площадь кристалла на 81%, добившись при этом соответствия по времени на частоте 500 МГц.
В годовой симуляции интернет-торговли E-Commerce Bench (365 «дней», реальные обезличенные данные Taobao и Tmall, около 600 поставщиков и 7000 товаров) модель получила стартовый капитал в ¥100 000 и вела несколько магазинов сразу, включая переговоры с поставщиками, закупки, ценообразование и возвраты. Среди почти 600 поставщиков в тест скрытно подмешали 152 мошеннических, модель научилась их распознавать и одновременно снижать закупочные цены раунд за раундом. В итоге Qwen3.8-Max закончила год с балансом ¥416 252 (доходность 4,16x), обойдя занявшую второе место модель GLM 5.2 на 38% и показав рост на 152% по сравнению с предыдущим поколением Qwen3.7-Max.
В мультимодальной части модель, по заявлению команды, умеет разбирать финансовые отчёты и PDF объёмом более 200 страниц, а также видео длиннее 100 часов, выстраивая из него граф событий, людей и сцен. Помимо анализа, модель выполняет визуальные задачи производства: монтирует видео в влог, превращает план помещения в 3D-интерьер в Blender, воссоздаёт фронтенд по одному скриншоту интерфейса, и в процессе сама проверяет промежуточный результат (например, замечает неправильно развёрнутый на скриншоте телевизор) и переделывает его. Для оценки такого «гибридного» агентного поведения, код плюс управление интерфейсом, команда ввела бенчмарк RecreationBench: модель наблюдает за работающим приложением как за чёрным ящиком (без исходного кода и интернета) на пяти платформах (десктоп на Ubuntu/macOS/Windows, мобильные устройства на Android, веб) и воссоздаёт его заново. Также анонсирована библиотека Qwen-MM-Plugins для расширения существующих агентных систем мультимодальными возможностями.
Модель доступна сейчас через QwenCloud и поддерживает параметр reasoning_effort с тремя уровнями (xhigh по умолчанию, medium, low) для настройки глубины рассуждений и стоимости запроса; сохранение цепочки рассуждений (preserve_thinking) включено по умолчанию. Открытые веса команда обещает выложить на следующей неделе.
Ключевые факты
- Qwen3.8-Max, 2,4 трлн параметров (95 млрд активных), первая модель класса Qwen-Max с открытыми весами; доступна через QwenCloud, веса обещают через неделю на Hugging Face и ModelScope
- За 10+ дней автономной работы модель построила проект oh-my-cli с самообновляющимся движком: 265 коммитов, 127 pull request'ов и 151 issue за ~16 дней
- За ~125 часов модель воспроизвела метод отбора данных из научной статьи, а затем сама улучшила его, итоговый прирост на AIME24 составил 2,7 пункта сверх результата авторов статьи
- На онлайн-конкурсе Tianchi (526 команд-людей) модель за 24 часа подняла точность решения с 0,60 до 0,853 и обошла 458 из 526 команд
- В годовой симуляции интернет-магазина модель превратила стартовые ¥100 000 в ¥416 252 (доходность 4,16x), обойдя вторую по рангу модель GLM 5.2 на 38%
Почему это важно
Qwen3.8-Max, первая модель уровня Qwen-Max, чьи веса команда обещает открыть, и самая крупная в линейке (2,4 трлн параметров, 95 млрд активных). Упор релиза сделан не на бенчмарки-тесты с одним ответом, а на многодневную автономную работу без участия человека: от постройки собственного инструмента разработки за 10+ суток до самостоятельного проектирования цифровой схемы за 500 итераций и года работы виртуальным интернет-магазином. Это заявка на то, что модель может доводить сложные проекты до результата целиком сама, а не только отвечать на отдельные запросы.
Кому это важно
В первую очередь, разработчикам и командам, которые строят агентные системы поверх существующих харнессов (QwenWork, Claude Code, Codex, OpenClaw, Hermes): модель заявлена как совместимая с ними. Также релиз адресован тем, кто оценивает автономных агентов для конкретных профессий, юристам, дизайнерам, инженерам, аналитикам, на примере которых команда показывала возможности модели, и исследователям/квант-аналитикам, которым интересны сценарии воспроизведения научных работ и построения торговых стратегий.
Как это применить
Qwen3.8-Max уже доступна по API через QwenCloud; открытые веса команда обещает выложить на Hugging Face и ModelScope «на следующей неделе» без точной даты. Для настройки глубины рассуждений и стоимости запроса можно использовать параметр reasoning_effort (xhigh, medium, low); сохранение цепочки рассуждений (preserve_thinking) включено по умолчанию для всех задач. Цены на использование модели в источнике не указаны.
Можно ли доверять
Все цифры в статье, из собственного блога команды Qwen: сравнение с GLM 5.2 и предыдущим поколением Qwen3.7-Max, оценки скорости работы «против традиционного процесса» и итоги конкурса на Tianchi даны в изложении и оформлении самой команды, без независимой проверки. Частично прозрачность повышает то, что код одного из кейсов, проекта oh-my-cli, выложен в открытом репозитории, где ход работы можно проверить самостоятельно. Сопоставление с другими моделями в источнике ограничено двумя эпизодами, GLM 5.2 в E-Commerce Bench и обезличенной формулировкой «опережает все сравниваемые модели» в кейсе с чипом; развёрнутой таблицы бенчмарков против конкурентов в посте нет.
Риски и подводные камни
Материал по жанру, маркетинговый анонс с отобранными самой командой показательными кейсами, а не независимый обзор. В источнике не указаны ни цена использования модели (стоимость токенов), ни точная дата выхода открытых весов, только «на следующей неделе» от 3 августа 2026 года. Не названы ни конкретные разработчики модели, ни материнская компания, в тексте фигурирует только собирательный автор «QwenTeam». Не приведён и механизм или сроки нативной поддержки модели в сторонних харнессах вроде Claude Code и Codex, только примеры ручной интеграции по API.
«Qwen3.8-Max, наша самая мощная модель на сегодняшний день и первая модель с открытыми весами такого масштаба.»
— команда Qwen