Qwen3-VL-8B-Instruct заняла 2-е место в классификации хейт-спича в непальских мемах
Исследователи описали свою систему для отраслевого соревнования (shared task) CHiPSAL 2026, оно посвящено мультимодальному определению языка вражды и тональности в непальских интернет-мемах. Соревнование состояло из двух подзадач: бинарная классификация «есть язык вражды / нет» и трёхклассовая классификация тональности.
В основе системы, фреймворк RA-HMD (Robust Adaptation of Hateful Meme Detection), адаптированный под визуально-языковую модель Qwen3-VL-8B-Instruct, которая напрямую понимает деванагари, письменность, которой пользуется непальский язык. Благодаря этому авторы обошлись без отдельных этапов распознавания текста на изображении (OCR) и перевода: по их словам, именно раздельные OCR- и переводческий конвейеры обычно копят ошибки, а сквозной (end-to-end) подход эту проблему устраняет.
Обучение шло в два этапа. На первом модель дообучали методом LoRA с добавлением MLP-«головы» для генеративной классификации. На втором дообучали саму модель-эмбеддер (backbone) методом контрастного обучения с функцией потерь InfoNCE с учителем. Дисбаланс классов в датасете (когда примеров одного класса заметно меньше остальных) компенсировали передискретизацией (oversampling) редких классов, аугментацией изображений и focal loss, функцией потерь, которая сильнее штрафует за ошибки на трудных примерах. На этапе вывода предсказания объединяли: вероятности токенов с первого этапа смешивали с оценками классификатора со второго этапа, подбирая веса смешивания по валидационной выборке.
По итогам соревнования система заняла 2-е место в задаче определения языка вражды с F1-мерой 0.797 и 4-е место в задаче определения тональности с F1-мерой 0.518. Авторы также приводят детальные абляции (эксперименты по отключению отдельных компонентов системы) и разбор ошибок с выводами об адаптации крупных визуально-языковых моделей под низкоресурсные языки Южной Азии.
Ключевые факты
- Система создана для CHiPSAL 2026, соревнования по мультимодальному определению языка вражды и тональности в непальских мемах, с двумя подзадачами: бинарная классификация языка вражды и трёхклассовая классификация тональности
- В основе, фреймворк RA-HMD, адаптированный под визуально-языковую модель Qwen3-VL-8B-Instruct с нативной поддержкой деванагари, что позволило отказаться от отдельных этапов OCR и перевода
- Обучение в два этапа: LoRA-дообучение с MLP-«головой» для генеративной классификации, затем контрастное дообучение backbone-модели с InfoNCE-функцией потерь
- Дисбаланс классов устраняли передискретизацией редких классов, аугментацией изображений и focal loss; на инференсе смешивали вероятности токенов первого этапа с оценками классификатора второго этапа
- Результат: 2-е место по языку вражды (F1 0.797), 4-е место по тональности (F1 0.518)
Почему это важно
Работа показывает, что современную визуально-языковую модель можно напрямую дообучить понимать текст на изображении на низкоресурсном языке с собственной письменностью (деванагари), минуя отдельные шаги распознавания текста и перевода. Авторы утверждают, что именно раздельные OCR- и переводческие конвейеры обычно накапливают ошибки, а сквозной подход эту проблему снимает, это значимо для языков, где качественных инструментов OCR и перевода мало или нет вовсе.
Кому это важно
Материал адресован исследователям мультимодального анализа мемов и языка вражды, специалистам по низкоресурсным языкам и обработке текста на нелатинских письменностях, а также командам, занимающимся модерацией контента в регионах Южной Азии, где непальский и родственные языки распространены.
Как это применить
Практический вклад, воспроизводимый рецепт: адаптация фреймворка RA-HMD под конкретную визуально-языковую модель (в статье, Qwen3-VL-8B-Instruct), двухэтапное обучение (LoRA с MLP-«головой», затем контрастное дообучение с InfoNCE), борьба с дисбалансом классов через передискретизацию, аугментацию и focal loss, и ансамблирование предсказаний двух этапов на инференсе с весами, подобранными на валидации. Этот же рецепт применим к другим низкоресурсным языкам с собственной письменностью.
Можно ли доверять
Результаты получены в рамках формального соревнования (shared task) с объективной метрикой F1 и явным ранжированием участников, 2-е и 4-е места из числа команд-конкурентов. Источник не раскрывает имён авторов, институциональной принадлежности, даты проведения соревнования, размера и состава датасета мемов, а также сравнения с архитектурами конкурирующих систем, эти детали в тексте отсутствуют, что ограничивает независимую проверку заявленных результатов.
Риски и подводные камни
Система заняла лишь 4-е место по тональности (F1 0.518), заметно ниже результата по языку вражды, то есть подход не одинаково хорошо работает на обеих подзадачах. Работа узкоспециализирована: она обучена и проверена на конкретном датасете непальских мемов для конкретного соревнования, поэтому её обобщаемость на другие языки, платформы или типы контента не подтверждена. Без доступа к архитектурам и результатам конкурирующих команд трудно оценить, насколько предложенный подход опережает альтернативы, а не просто попал в число лидеров конкретного заезда.