NCP-Bench показал: даже GPT-5.2 теряет сюжет за 20 ходов

NCP-Bench показал: даже GPT-5.2 теряет сюжет за 20 ходов

Исследователи представили NCP-Bench, тест из 100 сюжетных сред, построенных на основе киносинопсисов. Бенчмарк проверяет способность, которую авторы назвали Narrative Commitment Preservation (сохранение сюжетных обязательств): удерживает ли модель, играющая роль рассказчика, установленные факты и данные обещания сюжета на длинной дистанции интерактивной истории, когда игрок вмешивается в повествование без ограничений. Каждая из 100 сред снабжена структурированной спецификацией, траекторией сюжета, списком обязательств и исходными фактами, и на протяжении всего взаимодействия агента-игрока с агентом-рассказчиком система автоматически сверяет ответы модели с этой спецификацией. Проверка нескольких современных языковых моделей выявила заметный разрыв: высокое качество языка ответов само по себе не гарантирует сохранение сюжетных обязательств, и даже сильные модели часто выдают логически противоречивый контент, столкнувшись со враждебными («adversarial») вмешательствами игрока. Лучший результат показала GPT-5.2, она сохраняла непротиворечивость сюжета лишь в 42% прогонов после 20 ходов. Доля прогонов с конфликтом фактов у разных моделей составила от 40% до 68%. В пределах лимита в 100 ходов все заявленные в сценарии обязательства («achievement commitments») были выполнены полностью лишь в единичных прогонах.

Ключевые факты

  • NCP-Bench, тест из 100 сюжетных сред на основе киносинопсисов, проверяющий, держит ли ИИ-рассказчик логику и данные сюжетные обязательства при вмешательстве игрока
  • Лучшая из проверенных моделей, GPT-5.2, сохраняла непротиворечивость сюжета лишь в 42% прогонов после 20 ходов
  • Доля прогонов с конфликтом фактов у разных моделей, от 40% до 68%
  • В пределах лимита в 100 ходов все сюжетные обязательства были выполнены полностью только в единичных прогонах
  • Высокое качество текста ответов само по себе не гарантирует, что модель не нарушит логику сюжета

Почему это важно

Языковые модели всё чаще используют как движок интерактивных историй в играх, рассказчика, который на лету реагирует на действия игрока. До сих пор проверяли в основном качество и связность текста, но не то, держит ли модель логику сюжета на длинной дистанции, когда игрок намеренно пытается сломать сценарий. NCP-Bench впервые формализует эту проверку и показывает: даже лучшие модели регулярно противоречат сами себе и нарушают заранее заданные сюжетные обязательства.

Кому это важно

Разработчикам ИИ-игр и интерактивных нарративных продуктов, которым нужно оценить, выдержит ли выбранная модель длинную партию без логических провалов. Исследователям, которые строят бенчмарки для ИИ-агентов. Компаниям, стоящим за крупными моделями (в тексте упомянута GPT-5.2), как сигнал о конкретном слабом месте, которое пока не устраняется одним лишь повышением качества генерируемого текста.

Как это применить

NCP-Bench можно использовать как тест перед тем, как ставить модель в основу интерактивной истории или ролевой игры: прогнать её через сюжетные среды бенчмарка и посмотреть на долю конфликтов фактов и выживаемость после 20 и более ходов, а не полагаться на субъективное впечатление от качества диалогов.

Можно ли доверять

Материал, научная публикация на Hugging Face Papers со стандартной для такого источника структурой (задача, метод, результаты на числах). В доступном тексте не указаны имена всех авторов, институциональная принадлежность, дата публикации, статус рецензирования, а также не раскрыта точная методика подсчёта «выживаемости» и «конфликта фактов», это опущено даже в самой аннотации, а не только скрыто источником.

Риски и подводные камни

Диапазон конфликтов фактов в 40, 68% и выполнение всех обязательств лишь в единичных прогонах из 100 ходов показывают, что современные модели пока хрупки в роли долгоживущего рассказчика: продукт, который полагается на ИИ-агента как на держателя сюжета без дополнительных проверок и ограничений, рискует получить сюжетные противоречия и нарушенные обещания истории уже за десятки ходов.