Semalith v1.4 при 44x меньшем размере обошла Llama-Guard-3-8B в защите от prompt-инъекций
Развёртывание больших языковых моделей в финансовых сервисах и агентных сценариях требует классификатора безопасности, который одновременно ловит prompt-инъекции, распознаёт общий вред и проверяет соответствие регуляторным требованиям финансовой отрасли (BFSI). До сих пор ни один открытый guardrail-классификатор не закрывал все три задачи за один проход модели.
Semalith v1.4, классификатор на 184 миллионах параметров на базе DeBERTa-v3-base, который решает эту задачу: за один прямой проход он одновременно классифицирует запрос по трём осям, prompt-инъекции, общий вред и соответствие регуляторике BFSI. У модели голова на 22 класса (безопасный запрос, девять подтипов prompt-инъекций, общий вред и одиннадцать меток BFSI), а также вспомогательная голова на 4 суперкатегории; обе обучаются совместно с взвешенной функцией потерь. Обучающий корпус, 76 204 строки, собранные из 49 публичных источников; авторы дедуплицировали его по SHA-1 против каждого из отложенных (held-out) наборов для тестирования, добившись нулевого пересечения на 21 из 22 бенчмарков (максимум загрязнения, 0,22%).
На 22 отложенных бенчмарках Semalith v1.4 обыгрывает Llama-Guard-3-8B во всех семи тестах на детекцию prompt-инъекций (7 из 7) и в 11 из 18 бенчмарков в целом, при этом модель в 44 раза меньше по числу параметров. На выборке из 208 безобидных агентных запросов доля ложных срабатываний (FPR) у Semalith v1.4 равна 0,000, тогда как у Llama-Guard-3-8B, 0,063.
Обратная сторона: на бенчмарках общего вреда (WildGuardMix, HEx-PHI, HarmBench) лидирует именно Llama-Guard-3, авторы прямо описывают это как взаимодополняющее разделение сильных сторон, а не безоговорочное превосходство Semalith. В работе также раскрыты шесть измеренных слабых мест модели.
Авторы дают рекомендацию по выбору версии: для модерации диалогов рекомендована более ранняя v1.3 (F1 0,624 на ToxicChat), а v1.4, когда приоритет в покрытии меток BFSI или в нулевой доле ложных срабатываний на безобидных агентных запросах.
Ключевые факты
- Semalith v1.4, классификатор на 184М параметров на базе DeBERTa-v3-base, за один проход проверяет prompt-инъекции, общий вред и соответствие регуляторике BFSI
- Обучен на корпусе из 76 204 строк из 49 источников; дедупликация по SHA-1 дала нулевое загрязнение на 21 из 22 отложенных тестовых наборов (максимум, 0,22%)
- Против Llama-Guard-3-8B выигрывает все 7 из 7 тестов на детекцию prompt-инъекций и 11 из 18 бенчмарков в целом, при 44-кратно меньшем размере
- На 208 безобидных агентных запросах доля ложных срабатываний, 0,000 против 0,063 у Llama-Guard-3-8B
- На бенчмарках общего вреда (WildGuardMix, HEx-PHI, HarmBench) по-прежнему лидирует Llama-Guard-3-8B; авторы раскрывают ещё шесть слабых мест модели
Почему это важно
До сих пор ни один открытый guardrail-классификатор не решал одновременно три задачи безопасности LLM-агентов, детекцию prompt-инъекций, распознавание общего вреда и проверку соответствия регуляторике финансовой отрасли (BFSI), за один проход модели. Компаниям приходилось либо жертвовать одной из осей защиты, либо гонять несколько моделей подряд, наращивая задержку и стоимость инференса. Semalith v1.4 закрывает все три оси в одной компактной модели.
Кому это важно
В первую очередь, командам, которые разворачивают LLM-агентов в финансовых сервисах и других регулируемых средах и нуждаются в проверке запросов на соответствие BFSI-требованиям вместе с защитой от инъекций. Также релевантно инженерам по безопасности ИИ-систем в целом: 184 миллиона параметров вместо 8 миллиардов у Llama-Guard-3-8B означает кратно более дешёвый и быстрый инференс guardrail-слоя на каждый запрос агента.
Как это применить
Semalith распространяется в двух версиях с разным назначением: v1.3 рекомендована для модерации диалоговых сценариев (показывает F1 0,624 на бенчмарке ToxicChat), а v1.4, когда приоритет в покрытии меток соответствия BFSI-регуляторике или в нулевой доле ложных срабатываний на безобидных агентных запросах. Модель делает это за один прямой проход, выдавая метки сразу по всем трём осям безопасности.
Можно ли доверять
Авторы прогнали модель на 22 отложенных (held-out) бенчмарках и явно проверили обучающий корпус на утечку тестовых данных: дедупликация по SHA-1 против каждого held-out набора дала нулевое пересечение на 21 из 22 бенчмарков, максимальное загрязнение, 0,22%. Результаты сравнения с Llama-Guard-3-8B приведены по конкретным численным метрикам (FPR, число выигранных тестов), а не в общих словах, а слабые стороны модели не скрыты, им посвящён отдельный раздел работы.
Риски и подводные камни
Semalith v1.4 не превосходит Llama-Guard-3-8B повсеместно: на бенчмарках общего вреда (WildGuardMix, HEx-PHI, HarmBench) сильнее по-прежнему Llama-Guard-3-8B, так что речь идёт о взаимодополняющих моделях, а не о полной замене одной другой. Авторы также прямо перечисляют шесть измеренных слабых мест классификатора, детали конкретных провалов в тексте работы не раскрываются в пересказе.