LLM-INSTRUCT выиграла конкурс по анализу аргументации на ArgMining 2026

Команда, представившая систему LLM-INSTRUCT, победила в UZH Shared Task, конкурсном задании воркшопа ArgMining 2026, посвящённого анализу аргументации на уровне абзацев в официальных резолюциях ООН и ЮНЕСКО. Задача состояла из трёх частей под строгую JSON-схему: классификация типа абзаца, предсказание подмножества тегов из официального набора в 141 тег и предсказание направленных связей между абзацами. Условие конкурса, использовать только открытые (open-weight) модели с числом параметров не больше 8 миллиардов, то есть без доступа к закрытым флагманским моделям.

Авторы формализовали задачу как структурированное предсказание с ограничениями и построили конвейер из четырёх шагов. Сначала плотный поиск с учётом метаданных сужает исходный набор из 141 тега до узкого списка вероятных кандидатов. Затем применяется декодирование с ограничениями: для каждого измерения задачи, типа абзаца, тегов, связей, задан собственный потолок числа предсказаний, чтобы модель не выдавала лишнего. Только неуверенные, пограничные случаи передаются в трёхагентный механизм дебатов, где несколько агентов на основе языковой модели обсуждают и уточняют ответ. Финальный шаг, проверка результата на соответствие требуемой JSON-схеме перед отправкой.

На официальном лидерборде LLM-INSTRUCT заняла 1-е место в общем зачёте и 1-е место по метрике F1, но лишь 5-е, по метрике LLM-as-a-Judge, когда качество ответов оценивает другая языковая модель. В ходе разработки, подбирая конфигурацию системы, авторы подняли Micro-F1 по задаче 1b с 35,83% до 40,08%, сохранив при этом внутренний показатель по задаче 2 на уровне 4,421.

Главный вывод авторов: сокращение пространства решений до того, как модель начинает генерировать ответ, повышает не только точность, но и устойчивость итогового результата к ошибкам формата. Код и вспомогательные скрипты системы выложены в открытый доступ на GitHub.

Ключевые факты

  • LLM-INSTRUCT, победитель UZH Shared Task на воркшопе ArgMining 2026 по анализу аргументации в абзацах официальных резолюций ООН и ЮНЕСКО.
  • Задача, классификация типа абзаца, выбор подмножества из 141 официального тега и предсказание направленных связей между абзацами в строгом JSON-формате; допускались только открытые модели не больше 8 млрд параметров.
  • Конвейер системы: плотный поиск по метаданным сужает набор тегов, декодирование с ограничениями задаёт потолок предсказаний по каждому измерению, неуверенные случаи уходят на дебаты трёх агентов, финальный шаг, проверка JSON-схемы.
  • На официальном лидерборде, 1-е место в общем зачёте и по F1, 5-е, по метрике LLM-as-a-Judge (оценка ответов другой моделью); при подборе конфигурации Micro-F1 задачи 1b вырос с 35,83% до 40,08% без потерь по задаче 2 (4,421).
  • Главный вывод авторов: сужение пространства решений перед генерацией повышает и точность, и устойчивость результата к нарушениям формата; код опубликован на GitHub.

Почему это важно

Результат показывает общий инженерный принцип для конвейеров на основе языковых моделей со строгим форматом вывода: вместо наращивания размера модели можно сузить пространство возможных ответов ДО генерации, поиском кандидатов, ограничениями декодирования и точечной эскалацией в дебаты только для спорных случаев. Именно эта стратегия принесла системе на компактных открытых моделях (не больше 8 млрд параметров) первое место в конкурсе, где строгий JSON-формат и большой каталог тегов (141) делают задачу структурно сложной независимо от размера модели.

Кому это важно

Инженерам и исследователям, которые строят конвейеры на основе языковых моделей для структурированного извлечения информации, классификации, тегирования, предсказания связей, под жёсткую схему вывода, особенно на компактных открытых моделях без доступа к дорогим флагманским API. Также сообществу анализа аргументации и организаторам и участникам подобных конкурсов, а ещё командам, которые размечают объёмные нормативные и дипломатические тексты вроде резолюций ООН и ЮНЕСКО.

Как это применить

Технические приёмы системы переносимы в собственные проекты с многотеговой разметкой: сужать список кандидатов плотным поиском по метаданным перед обращением к модели, а не отдавать ей все варианты сразу; на декодировании задавать отдельный потолок числа предсказаний для каждого измерения задачи, чтобы модель не выдавала лишнего; запускать более дорогой многоагентный разбор только для действительно неуверенных случаев, это контролирует стоимость; обязательно проверять финальный вывод на соответствие JSON-схеме перед отправкой. Код и вспомогательные скрипты системы открыты на GitHub, на них можно ориентироваться напрямую.

Можно ли доверять

Источник, препринт на arXiv, но он описывает систему-победителя официального конкурса: результат подтверждён не только словами авторов, а публичным лидербордом (1-е место в общем зачёте и по F1, 5-е, по LLM-as-a-Judge, когда ответы оценивает другая модель). Цифры по улучшению Micro-F1 в ходе разработки (с 35,83% до 40,08%), это внутренние показатели авторов, а не строчка официального лидерборда, и сама статья пока не прошла рецензирование, как обычно для arXiv-препринта. Код опубликован в открытом доступе, что позволяет проверить заявленное независимо.

Риски и подводные камни

Система лучше всего показала себя по метрике F1, точному совпадению с эталонной разметкой, но заняла лишь 5-е место по LLM-as-a-Judge, когда качество ответа оценивает другая модель: первенство по «жёсткой» метрике не обязательно означает лучший результат по всем критериям качества. Конвейер заточен под конкретные условия конкурса, схему из 141 тега для текстов ООН и ЮНЕСКО и лимит модели в 8 млрд параметров, а насколько подход переносится на другие домены или на более крупные модели, в источнике не говорится. Механизм дебатов подключается только для неуверенных случаев, поэтому эффективность всей схемы зависит от того, насколько надёжно система определяет собственную неуверенность.

«Главный вывод прост: сокращение пространства решений перед генерацией повышает и точность, и устойчивость итоговой посылки.»

— авторы системы LLM-INSTRUCT