H Company выпустила Holo4: агентные модели для управления компьютером

H Company выпустила Holo4: агентные модели для управления компьютером

H Company выпустила Holo4, новую серию агентных моделей в двух размерах: 27B плотная (dense) и 35B-A3B на архитектуре смеси экспертов (Mixture of Experts). Обе доступны через H Models API, а веса выложены на Hugging Face в форматах BF16, FP8, NVFP4 и 4-битный GGUF. Вместе с ними компания выпустила обновлённую версию Holotron 3, малую модель Holotron4 Nano.\n\nГлавная идея, одна модель для любых интерфейсов. Holo4 кликает и печатает на экране, пишет и запускает собственный код, вызывает инструменты через MCP и API и выбирает то, что подходит задаче. Авторы объясняют: большинство агентных моделей обучены под один интерфейс, модели, ориентированные на экран, «слепы» без него, а те, что предпочитают вызов инструментов, застревают перед приложением без API. Реальная работа так не разделена, и одна бизнес-задача может требовать сочетания подходов. Holo4 работает на десктопе, в вебе, на Android, в песочнице для кода и с бизнес-API; это одна и та же модель, вызываемая одинаково, отдельную модель под платформу выбирать не нужно.\n\nПо цифрам: на OSWorld 2.0 (управление рабочим столом) Holo4 27B набирает 61,7% против 81,8% у Opus 5.5, а Holo4 35B-A3B, 30,9%. Сами авторы признают, что Holo4 уступает только сильнейшим закрытым моделям на длинных рабочих процессах, но утверждают, что делает это с параметрами на порядки меньше и при гораздо меньшей стоимости. На OSWorld 2.0 и AutomationBench (работа с API) модель, по их словам, конкурирует с передовыми моделями при существенно меньшей цене за задачу. Для сравнения в сноске приведены ориентиры: Opus 5, 70,2% и GPT-5.6 Sol, 66,2% (режим максимального усилия, частичные баллы, офлайн-набор v2026.08.08 из графика запуска OpenAI); релизы, наборы задач и оболочки (harness) у сравниваемых точек различаются. Все траектории, стоящие за публичными результатами, открыты: их можно воспроизвести по шагам на trajectories.hcompany.ai или скачать с Hugging Face.\n\nМодель обучали с учителем и с подкреплением на большом наборе сред и задач, в том числе созданных внутренним конвейером Agentic Task Factory. Он строит интерактивные среды и проверяемые задачи только по документации, например по скриншотам реальных сайтов или открытого ПО, и уже выдал около 10 000 задач для веб-приложений, MCP-серверов и десктопных сред, включая гибридные, где одно состояние доступно и через GUI, и через MCP. Параллельно команда переписала harness, цикл, исполняющий действия модели и управляющий контекстом на сотнях шагов; главные изменения, надёжная память, отслеживающая сотни шагов, и командная оболочка на самой десктопной машине.\n\nВ трёх примерах (3D-модель Эйфелевой башни и логотипа H во FreeCAD, игра в стиле Pac-Man в Godot) Holo4 27B сравнивают с его базой Qwen3.8 27B при одинаковых запросе и harness. Башня: 84 вызова и 1,3 млн токенов у Holo4 против 60 вызовов и 1,0 млн у Qwen. Логотип: 94 вызова и 1,5 млн против 118 и 1,9 млн. Pac-Man: 68 вызовов, 2,4 млн токенов и 268 строк против 197 вызовов, 11,4 млн токенов и 327 строк.\n\nHolotron4 Nano получена из Nemotron 3 Nano Omni от NVIDIA по тому же рецепту: авторы (участники NVIDIA Nemotron Coalition) говорят о значительном росте на GUI-задачах и в средах с MCP, API или песочницами для кода, причём выигрыш измерен в абсолютных процентных пунктах, но сами числа в тексте не приведены. Оптимизированные чекпойнты DSpark drafter для ускорения вывода обещаны в ближайшие дни.

Ключевые факты

  • Holo4, две модели: 27B dense и 35B-A3B (смесь экспертов); доступны в H Models API, веса на Hugging Face в BF16, FP8, NVFP4 и 4-битном GGUF.
  • На OSWorld 2.0 Holo4 27B набирает 61,7% против 81,8% у Opus 5.5, Holo4 35B-A3B, 30,9%; авторы говорят о параметрах на порядки меньше и гораздо меньшей стоимости.
  • Одна модель работает через GUI, код, MCP и API на десктопе, в вебе, на Android, в песочнице для кода и с бизнес-API.
  • Обучение опирается на Agentic Task Factory (около 10 000 задач) и переписанный harness с надёжной памятью на сотни шагов; все траектории публичных бенчмарков открыты.
  • Вместе с Holo4 вышла Holotron4 Nano на основе Nemotron 3 Nano Omni; чекпойнты DSpark drafter обещаны в ближайшие дни.

Почему это важно

Holo4, попытка сделать одну агентную модель, которая сама выбирает между кликами по экрану, кодом и вызовом MCP/API, вместо набора узких моделей под каждый интерфейс. Модели такого класса (27B и 35B-A3B) заметно меньше закрытых лидеров: по OSWorld 2.0 Holo4 27B отстаёт от Opus 5.5 (61,7% против 81,8%), но авторы подчёркивают, что делает это при гораздо меньшей стоимости. Важно и то, что открыты веса и траектории публичных прогонов.

Кому это важно

Командам, автоматизирующим бизнес-процессы в программах без API и с API одновременно; разработчикам агентов, которым нужна модель для десктопа, веба и Android в одном вызове; тем, кто хочет запускать агента у себя: веса доступны в BF16, FP8, NVFP4 и 4-битном GGUF. Holotron4 Nano рассчитана на тех, кому нужна малая модель на базе Nemotron 3 Nano Omni.

Как это применить

Доступ есть двумя путями: через H Models API (обе модели доступны сразу) или локально по весам с Hugging Face. Траектории можно посмотреть в просмотрщике trajectories.hcompany.ai или скачать как датасет, чтобы понять поведение агента до внедрения. Оптимизированные чекпойнты DSpark drafter для ускорения вывода обещаны в ближайшие дни. Цены API, требования к железу и лицензия весов в тексте не указаны.

Можно ли доверять

Все утверждения о качестве и стоимости исходят от самой H Company; независимой проверки в материале нет. Авторы признают отставание от сильнейших закрытых моделей и открывают траектории публичных результатов, что позволяет их проверить. При этом сами оговаривают, что у сравниваемых точек различаются релизы, harness и наборы задач; на AutomationBench результаты Holo4 измерены во внутреннем harness на публичном наборе, а у других моделей стоимость взята с официального лидерборда на приватном наборе, оценку Holo4 на приватном наборе обещают позже. В тексте упомянуты и Opus 5.5 (81,8%), и Opus 5 (70,2%, другой набор), и неясно, одна ли это модель.

Риски и подводные камни

Holo4 35B-A3B набирает лишь 30,9% на OSWorld 2.0, то есть заметно меньше 27B-версии. Оценки стоимости строятся по токенам и зависят от выбранных тарифов, поэтому сравнение приблизительное. В примерах с FreeCAD и Godot приведены только число вызовов, токенов и строк: результаты не описаны, а на задаче с Эйфелевой башней Holo4 27B потратил больше вызовов и токенов, чем Qwen3.8 27B (84 вызова и 1,3 млн токенов против 60 и 1,0 млн). Числа прироста Holotron4 Nano в тексте отсутствуют. Лицензия весов не указана.