DeepSeek выпустила открытый харнесс DeepSeek Harness для ИИ-агентов

DeepSeek выпустила открытый харнесс DeepSeek Harness для ИИ-агентов

Китайская DeepSeek выложила в открытый доступ раннюю версию своего агентного харнесса, DeepSeek Harness. Харнесс построен на мета-фреймворке Cordis и держится на одной идее: буквально всё в системе, модели, инструменты, навыки (skills), сессии, песочницы, файловые системы, циклы выполнения, оркестрация и интерфейс, реализовано как плагин, который можно комбинировать, менять местами, заменять и расширять.

Слово «харнесс» в этом году стало общим обозначением давно существующей функции: промежуточного слоя между разработчиком и моделью, который управляет промптами, контекстом, вызовом инструментов, циклом агента, состоянием, обработкой ошибок, безопасностью и правами доступа. Так, Claude Code, харнесс для семейства моделей Claude от Anthropic, а Codex выполняет ту же роль для моделей GPT от OpenAI; среди других харнессов, Aider, Cline, Goose, OpenCode, OpenHands и Pi. Границы термина размыты: иногда так называют только цикл агента и набор инструментов, иногда, более широкий набор функций вроде песочниц и субагентов. Google Antigravity, например, состоит из харнесса Antigravity Agent Runtime, доступного через Agent SDK, десктопного приложения Antigravity 2.0 и CLI.

По мнению издания, именно харнессы сейчас становятся главным полем конкуренции по мере того, как модели превращаются в коммодити. Харнесс часто реализует пользовательский интерфейс, источник инерции: настроив инструменты под себя, разработчики неохотно переходят на конкурирующий продукт, даже если интерфейс, это просто командная строка. Ряд исследований (без конкретных ссылок в статье) утверждает, что производительность и стоимость работы модели заметно зависят от выбора харнесса из-за разных архитектурных решений. Пример из статьи: агент Pi использует минимальный системный промпт примерно в 200 токенов, тогда как Claude Code до недавнего времени использовал системный промпт примерно в 10 000 токенов, пока в прошлом месяце Anthropic не сократила его примерно на 80%. Одна и та же модель в разных харнессах даёт разные результаты.

Плагинная система DeepSeek Harness унаследована от фреймворка Cordis, который позволяет добавлять и убирать компоненты «на лету», не ломая приложение. Статья исследователей DeepSeek, Ифаня Ши (Yifan Shi), Вэй Чжана (Wei Zhang) и Тяньи Цуя (Tianyi Cui), описывает два свойства Cordis: временную композируемость (temporal composability), удаление компонента откатывает его эффект, и пространственную композируемость (spatial composability), компоненты могут управлять зависимостями друг от друга. В качестве контрпримера авторы приводят систему расширений Visual Studio Code: все расширения VS Code работают в общем процессе (extension host), и после активации их нельзя убрать «на лету», требуется перезапуск хоста; VS Code позволяет расширениям объявлять зависимости друг от друга, но эта возможность почти не используется. DeepSeek Harness поддерживает зависимости между плагинами. По мнению исследователей DeepSeek, такая композируемость необходима в системах, которые непрерывно меняются практически без участия человека, она позволяет избегать вынужденных перезапусков и сбоев при появлении и исчезновении компонентов.

Ещё одна функция DeepSeek Harness, запись цепочки рассуждений. Всё, что видит модель, фиксируется в журнале сессии в режиме «только дозапись» (append-only): системные промпты, рассуждения, вызовы инструментов и их результаты, планирование работы субагентов и каждое добавление данных в контекст. В разделе Trajectory эти записи можно просматривать по источнику, а возобновление сессии, её ответвление (форк), поиск и повтор работают на одном и том же потоке событий. Модель DeepSeek R1, вышедшая в прошлом году, наделала шума именно благодаря обучению на цепочках рассуждений, разбиению промпта на последовательность «мыслей» с их осмыслением перед итоговым ответом. Доступ к промежуточным рассуждениям помогает оценить, насколько хорошо и точно рассуждает модель и как дополнительное «размышление» влияет на результат. Anthropic даёт частичный доступ к рассуждениям, когда доступен расширенный или адаптивный режим размышления (это зависит от конкретной модели), но всё чаще скрывает рассуждения, показывая лишь их пересказ (summary). В начале этого года Anthropic заявила, что внедрила классификаторы для «выявления попыток извлечь цепочку рассуждений с целью построить на её основе обучающие данные для другой модели рассуждений», и не показывает сырые рассуждения: по словам компании, «текст в блоке размышлений, это пересказ (summary) рассуждений Claude». Доступ к «сырым» рассуждениям требует обращения к отделу продаж Anthropic. Статья связывает это отчасти с опасениями, что цепочки рассуждений можно использовать для копирования моделей через дистилляцию, но это её собственная трактовка, а не подтверждённая позиция Anthropic. OpenAI, за исключением своих открытых моделей, тоже скрывает цепочку рассуждений, компания использует её для мониторинга модели; два года назад, представляя модель o1, в OpenAI заявили: «Взвесив несколько факторов, включая пользовательский опыт, конкурентное преимущество и возможность вести мониторинг цепочки рассуждений, мы решили не показывать пользователям сырые цепочки рассуждений». А в недавно выпущенных DeepSeek-V4-Pro и V4-Flash режим рассуждений в API включён по умолчанию. По мере взросления экосистемы открытых моделей доступ к цепочке рассуждений выглядит следующей точкой конкурентной борьбы.

Армин Ронахер, сооснователь ИИ-компании Earendil, которая сейчас курирует разработку агента Pi, отреагировал на релиз в соцсетях: «Не думаю, что DeepSeek Harness совершенен, но это точно первый случай, когда, глядя на что-то новое в этой области, я по-настоящему вдохновился пересмотреть некоторые наши решения. Мне очень нравится в этом open source!»

Ключевые факты

  • DeepSeek выложила раннюю open source версию агентного харнесса DeepSeek Harness на мета-фреймворке Cordis: модели, инструменты, песочницы, файловые системы, циклы выполнения, оркестрация и UI, всё реализовано как плагины.
  • Cordis поддерживает временную композируемость (откат эффекта при удалении компонента) и пространственную композируемость (зависимости между компонентами), описано в статье исследователей DeepSeek Ифаня Ши, Вэй Чжана и Тяньи Цуя; в пример поставлен extension host VS Code, для удаления расширений в котором нужен перезапуск.
  • Харнесс ведёт append-only журнал всей сессии с разделом Trajectory для просмотра цепочки рассуждений, вызовов инструментов и работы субагентов, контрастирует с политикой Anthropic (показывает только пересказ рассуждений, сырые, через отдел продаж) и OpenAI (скрывает рассуждения с релиза o1).
  • Размер системного промпта сильно зависит от харнесса: у агента Pi, около 200 токенов, у Claude Code был около 10 000 токенов до сокращения примерно на 80% в прошлом месяце.
  • Армин Ронахер, сооснователь Earendil (курирует агент Pi), назвал релиз первым за долгое время случаем, который вдохновил его пересмотреть архитектурные решения собственного харнесса.

Почему это важно

Харнессы становятся главным полем конкуренции ИИ-компаний по мере того, как модели превращаются в коммодити и перестают быть единственным полем гонки. DeepSeek Harness показывает, что китайские лаборатории способны предложить архитектурно интересный инструмент для разработчиков, а не только догонять по качеству и цене моделей. Приведённый в статье пример с размером системного промпта (около 200 токенов у Pi против около 10 000 у Claude Code) наглядно показывает, что харнесс реально влияет на результат и стоимость работы модели, а не только на удобство использования.

Кому это важно

Разработчикам, которые строят или выбирают агентные харнессы, аналоги Claude Code, Codex, Aider, Cline, Goose, OpenCode, OpenHands, Pi. Авторам конкурирующих харнессов, для которых плагинная архитектура Cordis с временной и пространственной композируемостью, прямой архитектурный вызов. Anthropic и OpenAI, чья политика скрытия «сырых» цепочек рассуждений становится предметом сравнения на фоне более открытого подхода DeepSeek Harness.

Как это применить

DeepSeek Harness распространяется как open source, пока в ранней версии. Плагинная архитектура позволяет менять модель, инструменты, песочницу, хранилище, планировщик или интерфейс через конфигурацию, не трогая исходный код самого харнесса, и поддерживает явные зависимости между плагинами. Раздел Trajectory даёт возможность разбирать сессию агента по источникам событий, возобновлять её, форкать, искать и повторять, это полезно для отладки поведения агента. Статья не называет конкретную лицензию и точную дату релиза, это стоит уточнить отдельно перед использованием в проде.

Можно ли доверять

Материал The Register, фактический технический разбор, не материал сатирической рубрики издания; описание плагинной архитектуры и композируемости подкреплено цитатами с сайта DeepSeek Harness и статьёй исследователей DeepSeek. Слабое место, утверждение о «ряде исследований», которые связывают выбор харнесса с производительностью и стоимостью модели: статья не даёт на них конкретных ссылок или цифр. Связь цепочек рассуждений с риском дистилляции моделей статья сама подаёт как предположение («appears to be due in part»), а не как подтверждённый факт или позицию самой Anthropic.

Риски и подводные камни

DeepSeek Harness, ранняя версия, и даже сторонний энтузиаст (Ронахер) прямо говорит, что харнесс «не идеален». Лицензия релиза в материале не названа, это стоит проверить до использования в проде. Заявление о пользе харнессов для производительности и стоимости моделей опирается на неназванные исследования. Сама статья прямо не подтверждает, что цепочки рассуждений реально использовались для дистилляции моделей, это только предполагаемая, не доказанная причина политики Anthropic.

«Не думаю, что DeepSeek Harness совершенен, но это точно первый случай, когда, глядя на что-то новое в этой области, я по-настоящему вдохновился пересмотреть некоторые наши решения. Мне очень нравится в этом open source!»

— Армин Ронахер, сооснователь Earendil, курирующей разработку агента Pi