Abliteration.ai продаёт доступ к открытым ИИ-моделям без ограничений безопасности

Стартап Abliteration.ai превратил технику «аблитерация» (от англ. abliteration), она убирает у модели с открытыми весами склонность отказывать в вредных запросах, в платный коммерческий сервис. Платформа размещает у себя «обезоруженные» версии открытых моделей, включая недавно вышедшую GLM-5.3 от компании Z.ai, и даёт доступ к ним через браузер или API. Компания появилась в конце прошлого года, а официально зарегистрирована была в марте. По собственным словам компании в соцсетях, цель сервиса, дать возможность выполнять «работу по наступательной кибербезопасности, ред-тимингу и тестированию ИИ-агентов, за которую не берутся другие модели».
Сам приём не новый: сообщество открытых моделей годами убирает у них отказы, и Hugging Face уже хранит тысячи таких версий. Abliteration.ai не изобрела технику, а превратила её в готовый хостинг: не нужно самому скачивать веса и искать вычислительные мощности для запуска.
В собственном тесте TechCrunch редакция бесплатно завела аккаунт через браузер и обратилась к «обезоруженной» версии GLM-5.3: модель без колебаний написала Python-программу для кражи сохранённых паролей Chrome и подробный протокол выращивания опасного патогена в домашних условиях. Какие-то ограничения на платформе всё же есть: в том же тесте модель отказалась давать инструкции по самоубийству. Сооснователь Abliteration.ai по имени Девон (фамилию не называет, по его словам, он всё ещё работает в другой компании) сказал, что сейчас работает над тем, чтобы добавить ограничения против насилия. Для клиентов, которым нужны собственные рамки, сервис предлагает отдельный слой модерации, который можно настроить самостоятельно.
По словам Девона, у стартапа уже есть договорённости с несколькими крупными облачными провайдерами, и компания покрывает эти расходы только за счёт выручки клиентов; венчурных денег Abliteration.ai пока не привлекала, но ведёт переговоры об этом. Среди клиентов, несколько ранних ред-тиминговых стартапов из Великобритании и Европы, которые помогают банкам, авиакомпаниям и другим инфраструктурным организациям усиливать киберзащиту. Один из крупных клиентов, по словам Девона, проверяет на устойчивость ИИ-агентов банков, и не смог бы делать это без «обезоруженной» модели. Проверки личности клиентов у сервиса, по сути, нет: единственное, что видит компания, номер банковской карты, которой оплачивают доступ; вопрос о границах собственной ответственности за возможный вред Девон называет ещё не решённым.
Критики предупреждают о рисках. Эндрю Юн, глава исследований в некоммерческой организации по ИИ-безопасности CivAI, заявил TechCrunch, что аблитерация позволяет «изменить модель так, чтобы она стала социопатом»: «можно ввести сюда буквально что угодно, и модель это выполнит». Он ожидает, что в ближайшем будущем отредактированные, «обезоруженные» модели начнут использовать во вред, и в недавней авторской колонке предложил обязать провайдеров моделей запускать классификаторы, которые обнаруживают и блокируют вредоносную активность в сфере кибербезопасности и биооружия, а также обязать компании, сдающие в аренду мощные GPU, проверять личность клиентов и «отказывать в доступе там, где есть основания подозревать опасное использование».
Мнения в самой индустрии ред-тиминга расходятся. Ахмед Али, гендиректор компании Fabraix, которая занимается ред-тимингом ИИ-агентов, говорит, что его команда больше полагается на дообучение открытых моделей, чем на «обезоруженные» версии: аблитерация отнимает у модели часть знаний и возможностей, и «если вы действительно пытаетесь причинить реальный вред, кибер- или био-, она будет не так эффективна». Алессио Ломушо, главный технолог компании Safe Intelligence, согласен, что возможности модели могут снижаться, но всё равно считает, что «обезоруженные» модели способны вызывать поведение, полезное для стресс-тестирования систем. Дэвид Слейтер, основатель и главный архитектор платформы кибербезопасности Armadin, говорит: «пока обезоруженные модели не входят в наш процесс», открытые модели прошлых поколений, вплоть до самого последнего, и без того было несложно обойти (jailbreak) и заставить делать то, что нужно. При этом Armadin изучает аблитерацию, потому что, по его словам, «подталкивать открытое сообщество к пониманию возможностей моделей, это важно»: рано или поздно это всё равно произойдёт, «за закрытыми дверями, в приватном порядке», а открытость, по его мнению, даёт исследователям инструменты понять, где на самом деле проходит передний край, и разобраться, в чём вред.
Ключевые факты
- Стартап Abliteration.ai продаёт доступ к «обезоруженным» версиям ИИ-моделей с открытыми весами, включая недавно вышедшую GLM-5.3 от Z.ai, через браузер и API; компания появилась в конце прошлого года и официально зарегистрирована в марте.
- В собственном тесте TechCrunch такая модель без колебаний написала Python-код для кражи сохранённых паролей Chrome и подробный протокол выращивания опасного патогена в домашних условиях; при этом в том же тесте модель отказалась давать инструкции по самоубийству.
- По словам сооснователя Девона (фамилию не называет), у компании уже есть договорённости с крупными облачными провайдерами, и она покрывает эти расходы только за счёт выручки клиентов; венчурных денег пока не привлекала, но ведёт переговоры об этом.
- Проверки личности клиентов у сервиса, по сути, нет, единственное, что видит компания, это номер банковской карты; среди клиентов, ред-тиминговые стартапы из Великобритании и Европы, которые проверяют на устойчивость системы банков, авиакомпаний и другой критической инфраструктуры.
- Эндрю Юн из CivAI предупреждает, что аблитерация превращает модель в «социопата», готового выполнить любой запрос, и предлагает обязать провайдеров моделей и арендодателей GPU проверять клиентов; в самой индустрии ред-тиминга мнения расходятся, Fabraix и Armadin говорят, что почти не используют «обезоруженные» модели, а Safe Intelligence видит в них пользу для стресс-тестирования.
Почему это важно
Аблитерация, не новость сама по себе: сообщество открытых моделей годами убирает у них отказы, и Hugging Face уже хранит тысячи таких версий. Значение истории в другом: Abliteration.ai превращает нишевую практику энтузиастов в готовый коммерческий сервис с хостингом, веб-интерфейсом и API, не нужно самому скачивать веса и искать вычислительные мощности. По словам компании, она уже покрывает счета за облачные мощности выручкой клиентов, а не инвестициями, это заметный пример того, как «снятие ограничений» с ИИ становится бизнес-моделью, а не любительским хобби.
Кому это важно
В первую очередь, специалистам по кибербезопасности и ред-тимингу: агентские ред-тиминговые команды, обслуживающие банки, авиакомпании и другую критическую инфраструктуру, получают инструмент, который не могут дать модели с отказами из коробки. Важно это и для исследователей безопасности ИИ вроде CivAI, они видят в сервисе прецедент, который ставит вопрос о контроле доступа к мощным открытым моделям. И для облачных провайдеров, сдающих в аренду GPU: один из критиков прямо предлагает обязать их проверять личность клиентов.
Как это применить
Доступ устроен просто: аккаунт создаётся за минуты, обратиться к «обезоруженной» версии модели (в тесте TechCrunch, GLM-5.3 от Z.ai) можно бесплатно через браузер или через API. Проверки личности клиента, по сути, нет, единственное, что видит сервис, это номер банковской карты, которой оплачивают доступ. Для тех, кто всё же хочет каких-то ограничений, Abliteration.ai предлагает отдельный слой модерации, который клиент настраивает сам под свои задачи.
Можно ли доверять
Ключевое подтверждение в статье, не пересказ пресс-релиза, а собственный эксперимент TechCrunch: редакция лично завела аккаунт и получила от модели рабочий код для кражи паролей Chrome и протокол выращивания патогена, то есть заявленная «безотказность» проверена независимо, а не только словами компании. При этом издание отмечает и границы: в том же тесте модель отказалась выдавать инструкции по самоубийству, какие-то ограничения на платформе всё-таки есть. А вот утверждения самой компании о выручке, клиентах и переговорах об инвестициях остаются на её собственных словах, TechCrunch не называет по имени ни одного клиента, облачного провайдера или банка. Источник, обычный редакционный репортаж TechCrunch, не сатира и не колонка мнений, поэтому пересказ воспринимается как прямая новость.
Риски и подводные камни
Главный риск, двойное назначение: один и тот же инструмент одинаково хорошо служит защитникам и злоумышленникам, а по признанию сооснователя компании, чёткой границы ответственности за вред от использования сервиса пока нет, «мы всё ещё её определяем». Практики ред-тиминга расходятся и в том, насколько «обезоруженные» модели вообще полезны: гендиректор Fabraix Ахмед Али говорит, что аблитерация обедняет знания и возможности модели, и для реального вреда, кибер- или био-, она подходит хуже, чем дообученная версия. Эндрю Юн из CivAI предупреждает, что в ближайшем будущем такие модели начнут использовать во вред, и предлагает обязать провайдеров ставить классификаторы вредоносной активности и проверять личности арендаторов GPU, но большинство опрошенных TechCrunch экспертов уверены, что остановить эту тенденцию уже не получится.
«Изменить модель так, чтобы она стала социопатом.»
— Эндрю Юн, глава исследований CivAI, TechCrunch