FreeToken превращает домашний ПК в платформу для моделей на 753 млрд параметров

Исследователи представили FreeToken, edge-native систему обслуживания MoE-моделей (mixture-of-experts, «смесь экспертов»), которая рассматривает обычный персональный компьютер не как маломощную видеокарту, а как единую эластичную платформу для инференса. Система переосмысливает весь стек обслуживания модели целиком: размещение и загрузку весов модели, резидентность экспертов (какие части модели держатся в памяти), совместное исполнение на CPU и GPU, повторное использование состояния агента и управление памятью во время работы. В основе, две особенности локального ИИ, под которые спроектирован FreeToken: нагрузка от ИИ-агентов постоянно меняет свой характер по ходу выполнения, а домашнее железо предоставляет неоднородные ресурсы, баланс которых отличается от машины к машине. Вместо того чтобы жёстко закладывать одну стратегию разгрузки вычислений на диск или CPU, FreeToken непрерывно перераспределяет вычисления и состояние модели по фактически доступным на конкретной машине ресурсам. Система поддерживает более 20 MoE-моделей и проверена на реальных агентах для кодинга и работы с инструментами, на железе от ноутбучной GPU с 8 ГБ памяти до одной рабочей GPU-станции. Ключевой результат: FreeToken расширяет то, что эти машины способны реально обслуживать, до модели на 35 млрд параметров на ноутбуке, до модели на 284 млрд параметров на игровом десктопе и до модели GLM-5.2 на 753 млрд параметров на одной рабочей GPU-станции. Авторы описывают цель проекта так: превратить открытые веса моделей в готовое к развёртыванию локальное ПО, сделав уже имеющееся у пользователей железо практичной платформой для интеллекта уровня передовых моделей. Система выложена на сайте flashml.ai.
Ключевые факты
- FreeToken, система обслуживания MoE-моделей, спроектированная для домашнего железа, а не дата-центра
- Вместо фиксированной стратегии разгрузки вычислений система непрерывно перераспределяет вычисления и состояние модели по доступным ресурсам конкретной машины
- Поддерживает более 20 MoE-моделей, проверена на реальных агентах для кодинга и работы с инструментами
- На ноутбуке с GPU от 8 ГБ можно запустить модель до 35 млрд параметров, на игровом десктопе, до 284 млрд, на одной рабочей GPU-станции, модель GLM-5.2 на 753 млрд параметров
- Система выложена в открытый доступ на flashml.ai
Почему это важно
Открытые модели с большим числом параметров обычно требуют серверного железа дата-центра. FreeToken меняет этот расклад: система сопроектирует весь стек обслуживания модели, размещение весов, резидентность экспертов, совместную работу CPU и GPU, память, под особенности именно домашнего компьютера, а не подгоняет серверное решение под меньший объём памяти. Результат, модель на 753 млрд параметров (GLM-5.2) становится обслуживаемой на одной рабочей GPU-станции, а не только в дата-центре.
Кому это важно
Разработчикам и энтузиастам, которые хотят запускать крупные открытые MoE-модели локально, на ноутбуке, игровом ПК или рабочей станции, не арендуя облачные GPU. Также авторам агентных инструментов для кодинга и работы с внешними сервисами: систему проверяли именно на таких сценариях.
Как это применить
FreeToken поддерживает более 20 MoE-моделей и работает на диапазоне железа от ноутбучной GPU с 8 ГБ памяти до одной рабочей GPU-станции. Конкретные ориентиры по мощности железа: до 35 млрд параметров, на ноутбуке, до 284 млрд, на игровом десктопе, до 753 млрд (модель GLM-5.2), на одной рабочей GPU-станции. Систему можно получить на сайте flashml.ai.
Можно ли доверять
Материал, научная публикация (страница на Hugging Face Papers), фактура подтверждена: заявленные цифры о поддерживаемых моделях, диапазоне железа и максимальных размерах моделей приведены в тексте авторами напрямую. В самом описании нет замеров скорости, задержки или точности, нет имён авторов и организаций, нет даты публикации, эти детали в источнике не раскрыты, а не додуманы здесь.
Риски и подводные камни
В открытом описании отсутствуют бенчмарки производительности (скорость генерации, задержка, точность), поэтому оценить реальный практический выигрыш по сравнению с другими решениями для локального инференса по этому тексту нельзя. Не раскрыт и механизм работы отдельных частей системы, как именно устроено совместное исполнение на CPU и GPU или повторное использование состояния агента.