Feyospace-s1 занял 10-е место в официальном рейтинге CyberGym, его обучила независимая команда из семи человек

Feyospace-s1 занял 10-е место в официальном рейтинге CyberGym, его обучила независимая команда из семи человек

Независимая команда из семи человек представила Feyospace: фреймворк для дообучения моделей с открытыми весами под агентные задачи в кибербезопасности. Отправная точка авторов: обучение способных кибер-агентов принято сводить прежде всего к масштабу модели, но для дообучения моделей с открытыми весами узкое место, не размер, а стоимость исполняемых сред для тренировки, надёжность многошагового контроля за поведением агента и доступ к мощным моделям-учителям (более сильным моделям, чьи решения задач используются как обучающие примеры).

В ответ команда построила фреймворк, ориентированный на данные, а не на масштаб: пять взаимодополняющих систем и отдельный движок для генерации обучающих сред. Choulea анализирует скрытые сигнатуры рассуждений модели. SkyReal снижает стоимость сэмплирования у модели-учителя. Hongzwang обходит ограничения API на запуск модели-учителя, какие именно это ограничения и зачем их обходить, текст не объясняет. PSBreakup восстанавливает способности, ослабленные слиянием моделей. Kreator превращает вмешательства эксперта в пригодные для обучения данные о рассуждениях.

Отдельно построен движок данных: он генерирует сбрасываемые (перезапускаемые с нуля) среды для программирования, поиска уязвимостей, CTF-задач (соревнований по кибербезопасности в формате «захвати флаг»), работы с историей уязвимостей ядра ОС, построения полноценных эксплойтов, прошивок и заданий на реальном оборудовании. В обучающий набор попадали только те кандидатные траектории, что прошли верификацию исполнением и аудит доказательств; после отбора осталось 164 269 траекторий для контролируемого дообучения (SFT) с длинным контекстом.

Результат, три чекпоинта модели Feyospace. В среднем они превзошли свои стартовые модели, Qwen3.6-35B-A3B, Qwen3.8-27B и Qwen3.5-122B-A10B, на 23,76% на полном наборе тестов CyberGym и на 10,49% на объединённых CTF-наборах; на тех же CTF-наборах до дообучения у этих моделей было 33,23%, 45,51% и 28,31% соответственно. По состоянию на 1 сентября 2026 года один из трёх чекпоинтов, Feyospace-s1, показывает верифицированную долю успешных решений 63,24% и занимает 10-е место в официальном рейтинге CyberGym; все три чекпоинта, первые среди моделей сопоставимого по числу параметров класса (то есть не в общем рейтинге, а в своей весовой категории). Авторы называют это, по собственной оценке, первой сквозной демонстрацией того, что независимая команда из семи человек способна обучить модель с открытыми весами, лидирующую по агентным возможностям в кибербезопасности.

Статья называется «Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models», этим прозвищем, «Cyber Mercury Seven», авторы называют себя в заголовке, никак его не поясняя. Не сообщается и то, будут ли опубликованы веса моделей или код пяти систем; статья подана 8 сентября 2026 года, а срез состояния рейтинга в тексте, на 1 сентября 2026 года.

Ключевые факты

  • Независимая команда из семи человек построила ориентированный на данные фреймворк для дообучения моделей с открытыми весами под агентные задачи в кибербезопасности.
  • Фреймворк состоит из пяти систем (Choulea, SkyReal, Hongzwang, PSBreakup, Kreator) и отдельного движка данных, который генерирует сбрасываемые среды для кода, поиска уязвимостей, CTF, истории уязвимостей ядра ОС, эксплойтов, прошивок и заданий на реальном оборудовании.
  • После верификации исполнением и аудита доказательств для обучения осталось 164 269 траекторий; три получившихся чекпоинта Feyospace превзошли свои стартовые модели в среднем на 23,76% на полном наборе CyberGym и на 10,49% на объединённых CTF-наборах.
  • По состоянию на 1 сентября 2026 года чекпоинт Feyospace-s1 показывает верифицированные 63,24% успешных решений и занимает 10-е место в официальном рейтинге CyberGym; все три чекпоинта, первые среди моделей сопоставимого размера.
  • Текст не говорит, будут ли опубликованы веса моделей или код пяти систем.

Почему это важно

Общее место в разговоре об обучении ИИ-агентов, что их способности определяются прежде всего масштабом модели. Авторы, независимая команда из семи человек, с этим спорят применительно к дообучению моделей с открытыми весами: по их аргументу, узкое место не размер, а стоимость исполняемых сред для обучения, надёжность многошагового контроля за поведением агента и доступ к мощным моделям-учителям. Ответом стал фреймворк, ориентированный на данные: пять систем, каждая закрывает одно из этих узких мест (Choulea, SkyReal, Hongzwang, PSBreakup, Kreator), плюс отдельный движок, который генерирует сами обучающие среды, от программирования и поиска уязвимостей до CTF, истории уязвимостей ядра ОС, эксплойтов, прошивок и работы с реальным оборудованием. Итог, не просто улучшение показателей, а, по формулировке самих авторов, первая сквозная демонстрация того, что команда такого масштаба способна обучить модель с открытыми весами, лидирующую по агентным возможностям в кибербезопасности: один из трёх получившихся чекпоинтов занял 10-е место в официальном рейтинге CyberGym, а все три, первые среди моделей сопоставимого размера.

Кому это важно

В первую очередь, исследователям и инженерам, которые дообучают модели с открытыми весами под агентные задачи в кибербезопасности и выбирают, куда вкладывать ресурсы: в размер модели или в качество и верификацию обучающих данных. Сообществу вокруг бенчмарка CyberGym и CTF-соревнований, результат прямо измеряется по их публичным рейтингам, поэтому его можно перепроверить независимо. Шире, всем, кто следит за тем, какого уровня агентных возможностей в наступательной кибербезопасности (поиск уязвимостей, построение эксплойтов) может сегодня достичь небольшая команда без привязки к крупной лаборатории или компании.

Как это применить

Текст описывает методику обучения, пять систем плюс движок данных, а не готовый продукт. Он не говорит, опубликованы ли (или будут ли опубликованы) веса моделей или код самих пяти систем; 164 269 обучающих траекторий, отобранных для обучения, авторы обещают выложить отдельно, для воспроизводимости. Установить, скачать или лицензировать здесь пока нечего. Из применимого, сама архитектурная идея: фильтровать кандидатные обучающие траектории верификацией исполнением и аудитом доказательств перед тем, как пускать их в дообучение, а не наращивать объём данных без проверки.

Можно ли доверять

У заявленных цифр есть внешняя опора: кандидатные траектории отбирались верификацией исполнением и аудитом доказательств, а не только самооценкой модели, а итоговый результат, 10-е место в общем рейтинге CyberGym и 1-е место среди моделей сопоставимого размера, сверяется с публичным рейтингом и в принципе проверяем сторонними наблюдателями. Проверить состав и независимость команды из семи человек, а также заявленную новизну («первая такая демонстрация»), сторонним наблюдателям сложно: источник называет семь авторов и лабораторию Vera Praxis Lab, но эти сведения трудно верифицировать независимо. Статья датирована подачей 8 сентября 2026 года; отдельная дата в тексте, срез состояния рейтинга на 1 сентября 2026 года.

Риски и подводные камни

Фреймворк прямо нацелен на задачи наступательной кибербезопасности: поиск и эксплуатацию уязвимостей, CTF, атаки на ядро ОС и прошивки устройств. Один из пяти компонентов, Hongzwang, в тексте описан только как система, обходящая ограничения API на запуск модели-учителя, какие именно это ограничения и зачем их обходить, не поясняется, поэтому нельзя оценить, о защитных они или о чисто технических ограничениях. Текст не сообщает, будут ли опубликованы веса моделей или код пяти систем, поэтому неясно, станет ли эта способность, агент, специально обученный на эксплойтах, CTF и прошивках, широко доступной. Оценить риски двойного назначения дополнительно мешает та же непрозрачность, что снижает доверие к самому описанию: заявления о команде, её размере, независимости и прозвище «Cyber Mercury Seven» из заголовка статьи трудно проверить независимо: источник называет семь авторов и лабораторию Vera Praxis Lab, но не более того.

«Обучение способных кибер-агентов часто считают прежде всего проблемой масштаба модели. Но у дообучения моделей с открытыми весами ограничение более прямое, это стоимость исполняемых сред, надёжность многошагового контроля за агентом и доступ к мощным моделям-учителям.»

— авторы