Musubi выпустила PolicyLM-1.7B: открытая модель для модерации контента

Musubi выпустила PolicyLM-1.7B: открытая модель для модерации контента

Во вторник компания Musubi объявила о PolicyLM-1.7B, лёгкой модели принятия решений (decision model), заточенной под модерацию контента в реальном времени. Веса модели открыты.

Идея в том, чтобы взять политику модерации, написанную обычным английским языком, и применять её к сообщениям менее чем за 50 миллисекунд. По замыслу Musubi, модель должна быть близка по стоимости и скорости к ИИ-классификаторам, на которых держится модерация в большинстве соцплатформ. При этом, поскольку у неё есть гибкость современной большой языковой модели, она способна применять сложные правила без специального обучения. Ещё важнее, что при изменении правил модели не нужно новое обучение, так что люди, которые пишут политику, могут сколько угодно итерировать формулировки.

Сооснователь и директор по ИИ Musubi Филип Янкович (Filip Jankovic) говорит, что такая модель позволяет менеджерам платформ размечать контент проактивно. По его словам, продуктовым командам просто нужно лучше понимать, что происходит на их платформе, особенно когда объём контента растёт экспоненциально.

Модели принятия решений стали горячей темой в мире ИИ после выхода Jev от TypeSafe AI в сентябре; вскоре появились конкурирующие модели от OpenAI и Amazon. Вместо текста такая модель выдаёт вероятности исходов. В случае PolicyLM-1.7B ответ бинарный: контент либо относится к категории, либо нет. Ограничив выход набором заранее заданных вариантов, такие модели работают быстрее и дешевле больших языковых моделей, сохраняя гибкость архитектуры трансформера.

Один из ранних сценариев для моделей принятия решений, обуздание неправильного поведения ИИ-агентов, так что, как отмечает издание, логично применить ту же технологию к поведению людей. Янкович подчёркивает, что интерес к таким моделям появился у него раньше Jev: он прослеживает его до проекта 2024 года GLiNER (Generalist Model for Named Entity Recognition), где применялись многие из тех же приёмов. Musubi не боится сравнений с Jev и хочет использовать новый интерес к моделям принятия решений, чтобы привлечь внимание к модерации. В анонсе сказано: «Если вас заинтересовала Jev, то PolicyLM-1.7B, модель того же типа, обученная специально для модерации контента, и вы можете запустить её сами».

Ключевые факты

  • Musubi объявила PolicyLM-1.7B: лёгкую модель принятия решений для модерации в реальном времени, веса открыты.
  • Модель применяет политику, написанную обычным английским языком, к сообщениям менее чем за 50 миллисекунд; при смене правил новое обучение не нужно.
  • Она выдаёт бинарный вердикт: контент относится к категории или нет. Такие модели выдают вероятности исходов вместо текста, поэтому быстрее и дешевле больших языковых моделей.
  • Жанр моделей принятия решений стал заметным после Jev от TypeSafe AI в сентябре, за ним последовали модели OpenAI и Amazon.
  • Янкович, сооснователь и директор по ИИ Musubi, связывает свой интерес к теме с проектом GLiNER 2024 года.

Почему это важно

Модерация в большинстве соцплатформ держится на ИИ-классификаторах. PolicyLM-1.7B, по замыслу Musubi, соединяет скорость классификатора с гибкостью современной языковой модели: правило пишется обычным языком, и его можно менять без нового обучения. Это ещё один пример растущей волны моделей принятия решений, которая началась с Jev от TypeSafe AI в сентябре.

Кому это важно

Продуктовым командам и менеджерам платформ, которым нужно размечать растущий поток пользовательского контента. Также тем, кто следит за новым классом моделей принятия решений, которые выдают вероятности исходов вместо текста, в том числе для контроля поведения ИИ-агентов.

Как это применить

Веса опубликованы, и в анонсе сказано, что модель можно запустить самостоятельно. Практический сценарий из источника: записать политику модерации обычным языком, применять её к сообщениям и вносить правки в формулировки без переобучения. Название лицензии, место загрузки весов и цены в источнике не указаны.

Можно ли доверять

Пересказ основан на материале TechCrunch, где описан анонс компании и цитируется сооснователь Musubi, то есть заинтересованная сторона. Заявленные скорость менее 50 миллисекунд и сходство по стоимости с классификаторами описаны как замысел разработчиков. Показателей точности и доли ложных срабатываний, железа для замера и клиентов в источнике нет.

Риски и подводные камни

Независимых проверок качества пока не приведено: ни бенчмарков, ни данных о точности, ни о ложных срабатываниях. Модель выдаёт бинарный ответ, поэтому сложные политики придётся разбивать на отдельные категории. Это вывод из описания бинарного выхода, а не заявление источника. Цифра 50 миллисекунд, заявленная цель, а не измеренная задержка.

«Продуктовым командам просто нужно лучше понимать, что происходит на их платформе, особенно когда объём контента растёт экспоненциально.»

— Филип Янкович, сооснователь и директор по ИИ Musubi