LongNovel, бенчмарк для выявления галлюцинаций ИИ в пересказе романов
Хотя контекстные окна больших языковых моделей за последние годы заметно выросли, галлюцинации, выдуманные детали, которых не было в оригинале, остаются проблемой при пересказе длинных текстов. Авторы работы утверждают: романы подходят для изучения этой проблемы лучше, чем новости или научные статьи, в романах много внутренней информации и подробных описаний событий и диалогов, на фоне которых легче поймать модель на выдумке. При этом, по их оценке, у нынешних исследований нет многомасштабного бенчмарка для выявления галлюцинаций именно в пересказе длинных романов, и никто как следует не изучал, как галлюцинации меняются по мере роста объёма контекста.
Чтобы закрыть этот пробел, исследователи предложили LongNovel, многомасштабный двуязычный (китайский и английский) бенчмарк для выявления галлюцинаций. Китайская часть датасета построена на 29 китайских романах объёмом от 16 до 100 тысяч токенов; английская часть собрана из данных на уровне глав датасета BookSum. Авторы разработали 8 типов галлюцинаций и для их генерации применили комбинацию двух методов, Multi-Model Arbitration (арбитраж между несколькими моделями) и Entity-Referenced Hallucination Generation (генерация галлюцинаций, привязанных к сущностям текста); по словам авторов, это должно одновременно обеспечивать достоверность данных и сбалансированное распределение по типам галлюцинаций. Содержимое тестового набора дополнительно вручную проверили люди, это должно повысить надёжность данных.
Авторы пишут, что обширные эксперименты показывают: LongNovel, сложный бенчмарк для современных моделей. При этом самих цифр, точности, доли пойманных галлюцинаций или названий проверенных моделей, источник не приводит; описания всех 8 типов галлюцинаций в тексте тоже нет. LongNovel авторы выложили в открытый доступ на GitHub (https://github.com/BDML-lab/LongNovel), для дальнейших исследований.
Ключевые факты
- LongNovel, многомасштабный двуязычный (китайский и английский) бенчмарк для выявления галлюцинаций ИИ при пересказе длинных романов.
- Китайская часть построена на 29 романах объёмом от 16 до 100 тысяч токенов; английская часть, из данных на уровне глав датасета BookSum.
- Заложено 8 типов галлюцинаций; для их генерации авторы скомбинировали методы Multi-Model Arbitration и Entity-Referenced Hallucination Generation.
- Тестовый набор дополнительно вручную проверили люди, чтобы повысить надёжность данных.
- Числовых результатов (точность, доля выявленных галлюцинаций, список проверенных моделей) авторы не приводят; датасет выложен на GitHub в открытый доступ.
Почему это важно
Контекстные окна языковых моделей выросли, но при пересказе длинных текстов модели по-прежнему выдумывают детали, которых не было в оригинале. Авторы считают романы удобным полигоном для изучения этой проблемы: в отличие от новостей и научных статей, в них много внутренней логики и подробных описаний событий и диалогов, на фоне которых легче заметить выдумку. По их словам, у существующих исследований нет многомасштабного бенчмарка для такой задачи, и никто толком не изучал, как частота и характер галлюцинаций меняются по мере роста объёма текста, LongNovel должен закрыть именно этот пробел.
Кому это важно
Бенчмарк полезен командам, которые разрабатывают и оценивают большие языковые модели для длинных текстов: разработчикам нужен способ измерить, сколько модель выдумывает при пересказе больших объёмов текста. Пригодится он и командам, которые строят продукты для суммаризации книг и длинных документов, им важно понимать, где модели чаще ошибаются. Подойдёт LongNovel и исследователям, которые изучают, как устойчивость языковых моделей к галлюцинациям меняется по мере роста контекста.
Как это применить
Датасет LongNovel авторы выложили в открытый доступ на GitHub (https://github.com/BDML-lab/LongNovel), бенчмарк можно скачать и прогнать через него собственную модель, сравнив, как часто она выдумывает факты при пересказе длинных романов на разных объёмах контекста, от 16 до 100 тысяч токенов. Поскольку бенчмарк двуязычный, его можно использовать для проверки моделей и на китайском, и на английском материале, конкретные детали запуска стоит смотреть в самом репозитории на GitHub.
Можно ли доверять
Для надёжности тестового набора авторы вручную проверили его содержимое, это снижает риск, что галлюцинации в самом бенчмарке замаскированы под настоящий текст. Но в аннотации нет ни имён авторов, ни организаций, стоящих за проектом, ни даты публикации. Нет и количественного подтверждения тезиса «LongNovel, сложный бенчмарк»: точных цифр по точности, доле выявленных галлюцинаций или списку проверенных моделей источник не называет, только общая формулировка про «обширные эксперименты». К тому же это препринт на arXiv: до размещения там работы не проходят независимое рецензирование, так что выводы пока не подтверждены сторонней экспертизой.
Риски и подводные камни
Китайская часть датасета описана подробно, 29 романов, 16, 100 тысяч токенов, а для английской части в тексте нет ни числа романов, ни диапазона длины, только формулировка «данные на уровне глав из датасета BookSum». Из-за этого двуязычность бенчмарка выглядит не совсем симметричной, и не ясно, насколько сравнимы результаты между двумя языками. Как устроены методы генерации галлюцинаций, Multi-Model Arbitration и Entity-Referenced Hallucination Generation, в тексте не раскрыто, поэтому со стороны нельзя оценить, насколько правдоподобны сгенерированные так галлюцинации и нет ли перекоса в сторону конкретных типов ошибок. Наконец, ни одна проверенная модель в тексте не названа и итоговых цифр нет, поэтому судить, действительно ли LongNovel выявляет реальные слабые места современных языковых моделей, пока преждевременно.