Программа Strata запускает Qwen3.8-Flash-Next на игровом ПК с 12 ГБ видеопамяти

Программа Strata запускает Qwen3.8-Flash-Next на игровом ПК с 12 ГБ видеопамяти

Strata, бесплатная программа с открытым кодом (лицензия MIT), которая запускает модель Qwen3.8-Flash-Next на 125 миллиардов параметров на обычном игровом компьютере с видеокартой NVIDIA или AMD от 12 ГБ памяти под Windows или Linux. Такие модели обычно работают на серверах с сотнями гигабайт видеопамяти. По описанию проекта, модель общается в чате, пишет код, читает картинки и работает с приложениями и кодинг-агентами, а данные не покидают компьютер. Источник, README проекта.

Как это устроено. Модель состоит из 24 576 небольших «экспертов», на каждое слово (токен) нужны только 10 из них. Видеокарта хранит несколько тысяч самых востребованных экспертов, оперативная память держит всех, а процессор параллельно считает остальных. SSD хранит большую справочную таблицу. Дополнительно используется «угадай и проверь» (speculative decoding): маленькая модель-помощник предлагает следующие слова, большая проверяет их разом. Ответ получается тот же, но в 1,6, 1,8 раза быстрее. Длинные тексты читаются крупными блоками (до 8192 токенов за раз) со скоростью свыше 1000 токенов в секунду.

Скорость. Авторы проекта пишут, что измеряли её на двух обычных игровых ПК; полные таблицы вынесены в отдельный файл DETAILS.md и в пересказываемом тексте не приведены. Для RTX 3090 (24 ГБ) README говорит лишь, что она «должна» выдавать около 100, 140 токенов в секунду, это оценка, а не замер. Чем больше видеопамяти, тем быстрее. Для сравнения: 60 токенов в секунду, быстрее, чем человек читает.

Установка. Скачать и распаковать архив (или сделать git clone), на Windows дважды щёлкнуть START-HERE.bat, на Linux запустить ./setup.sh. Установщик сам определяет видеокарту, ставит нужный движок и задаёт несколько вопросов: какая модель и размер, какой контекст, читать ли картинки. На каждый можно нажать Enter и принять рекомендованный вариант. Затем скачивается модель (около 70 ГБ), и в браузере открывается приложение Strata по адресу http://127.0.0.1:8080. Для тех, кто пользуется ИИ-ассистентом по коду, есть инструкция docs/AI_SETUP.md: ассистент проверит видеокарту, память и диск, подберёт подходящий размер, установит и запустит программу. Есть и MCP-сервер, через который ИИ-инструменты могут устанавливать, запускать и останавливать Strata.

Варианты модели. Одна и та же модель выпускается в разных степенях сжатия: меньшие быстрее, большие немного умнее. Среди вариантов: Coder, версия для программирования с удалённой половиной экспертов, которая, по замерам её авторов, достигает 91% результата полной модели в SWE-bench Verified и помещается в 32 ГБ оперативной памяти, но слабее вне кода, в том числе на китайском и других CJK-текстах; Swift 1.5, дообученная версия, которая гораздо короче «думает» перед ответом при примерно том же качестве; Unsloth UD-IQ4_XS, около 4 бит, загрузка 94 ГБ, при оперативной памяти меньше ~80 ГБ часть читается с SSD; Unsloth UD-Q4_K_XL (экспериментальный), ближе всего к полной модели, но из-за чтения с SSD пишет всего 7, 8,5 токена в секунду на ПК с 64 ГБ; OrcaRouter Uncensored IQ3_XXS, настраивается вручную, в меню установщика его нет.

Как подключаться. Через браузер (чат, живой монитор модели и загрузки GPU/CPU/RAM, раздел About) либо как «OpenAI-совместимый» провайдер с адресом http://127.0.0.1:8080/v1; подойдёт любой API-ключ и любое имя модели. Для приложений на API Anthropic есть адрес /v1/messages (для Claude Code, переменная ANTHROPIC_BASE_URL=http://127.0.0.1:8080), для Codex CLI и других клиентов Responses API, /v1/responses. Режим размышления настраивается (выкл., низкий, средний, высокий). Доступ с телефона или другого ПК включается параметрами --host 0.0.0.0 --api-key, и ключ нужно задавать всегда. Экспериментально, силами сообщества, поддерживаются старые видеокарты, Intel Arc (сборка из исходников на Linux) и старые процессоры без AVX2.

Ключевые факты

  • Strata, бесплатная программа с открытым кодом (MIT) для запуска модели Qwen3.8-Flash-Next на 125 млрд параметров на игровом ПК с видеокартой NVIDIA или AMD от 12 ГБ под Windows или Linux.
  • Модель делится между видеокартой (самые частые из 24 576 экспертов), оперативной памятью (все), процессором и SSD; плюс speculative decoding ускоряет ответы в 1,6, 1,8 раза.
  • Для RTX 3090 (24 ГБ) README обещает «около 100, 140 токенов в секунду», это оценка, а не замер; измеренные таблицы вынесены в DETAILS.md.
  • Установка в один клик: скачивание модели около 70 ГБ, при первом запуске ПК может 1, 3 минуты тормозить, программа грузит 35, 55 ГБ в оперативную память.
  • Локальный сервер совместим с API OpenAI и Anthropic; вариант Coder достигает 91% результата полной модели в SWE-bench Verified по замерам самих авторов.

Почему это важно

Модели такого размера обычно требуют сервера с сотнями гигабайт видеопамяти. Strata показывает способ, как уместить 125-миллиардную модель на домашний ПК с 12, 24 ГБ видеопамяти: часто используемые части модели лежат на видеокарте, остальное, в оперативной памяти и на SSD, а процессор считает параллельно. Всё работает локально, данные остаются на компьютере.

Кому это важно

Владельцам игровых ПК с видеокартой NVIDIA или AMD от 12 ГБ, которые хотят запускать крупную модель у себя, а не через облако. Также тем, кто использует кодинг-агентов (Claude Code, Codex CLI и другие) и хочет подключить их к локальному серверу с совместимым API.

Как это применить

Скачать проект, на Windows запустить START-HERE.bat, на Linux./setup.sh, и ответить на вопросы установщика (подойдут рекомендованные варианты). Нужно около 70 ГБ на диске для модели по умолчанию и свободная оперативная память: при запуске грузится 35, 55 ГБ. Затем можно пользоваться чатом в браузере или подключить приложение как «OpenAI-совместимый» провайдер по адресу http://127.0.0.1:8080/v1. Сама Strata бесплатна и распространяется по лицензии MIT, но часть компонентов и каждая модель имеют собственные лицензии. При нехватке памяти README советует выбрать меньший размер (Q2_0 или IQ2_XS).

Можно ли доверять

Источник, README самого проекта, то есть заявления разработчиков. Автор или сопровождающий в тексте не назван. Скорость 100, 140 токенов в секунду для RTX 3090 дана как оценка («должна»), а не измерение; реальные замеры на двух тестовых ПК лежат в DETAILS.md и здесь не видны. Из качества приведена только цифра 91% для варианта Coder в SWE-bench Verified, измеренная его авторами. Сравнения остальных сжатых версий с несжатой моделью нет.

Риски и подводные камни

При запуске ПК может тормозить или не отвечать 1, 3 минуты (дольше всего в первый раз), а на нехватку свободной памяти программа реагирует сильной медлительностью или аварийной остановкой движка. По умолчанию обрабатывается один запрос за раз; параллельный режим на карте с 12 ГБ замедляет каждый ответ. Первое сообщение чата читается около минуты на 30 000 токенов. Вариант Coder слабее вне кода, включая китайский и другие CJK-тексты. Самый точный размер UD-Q4_K_XL экспериментальный и выдаёт лишь 7, 8,5 токена в секунду на ПК с 64 ГБ. Старые видеокарты, Intel Arc и процессоры без AVX2 поддерживаются только экспериментально. При доступе с других устройств обязательно нужно задавать ключ.