Точные ИИ-агенты не всегда признают неуверенность: бенчмарк эпистемической скромности

Точные ИИ-агенты не всегда признают неуверенность: бенчмарк эпистемической скромности

В научной работе поставлен вопрос: когда найденные агентом данные противоречат его прежним «убеждениям», пересмотрит ли он ответ, признает ли неуверенность или упрётся в неверный вывод? По мнению авторов, существующие оценки агентных систем смотрят в основном на успешность выполнения задачи и мало говорят о том, как агенты ведут себя при таких конфликтах.

Авторы предлагают оценивать агентов по эпистемической скромности (EH): это готовность агента распознавать, учитывать в действиях и сообщать неуверенность в ходе выполнения задачи. Её измеряют по трём поведенческим измерениям на уровне всей траектории работы агента: Identify, Solve и Escalate (ISE; условно, выявить, разрешить, довести до сведения).

Испытательной ситуацией служит конфликт знаний: параметрические знания базовой языковой модели противоречат найденным свидетельствам, либо два источника в контексте расходятся между собой. Проверяют два сценария: контролируемый конфликт и естественно возникающий конфликт в ходе многошагового выполнения задачи. К каждому подобран парный контроль без конфликта.

На четырёх агентах авторы получили, что более высокая точность не обязательно означает большую эпистемическую скромность. Некоторые конфигурации с высокой точностью распознают конфликт во время выполнения, но не сообщают о неразрешённой неуверенности в своих неверных итоговых ответах. Анализ траекторий показал, что агенты часто замечают конфликт на ранних шагах, но не удерживают и не разрешают его на поздних.

Наконец, авторы показывают, что вмешательства на уровне модели могут повысить EH, но часто ценой снижения точности. Из этого они делают вывод, что эпистемическая скромность возникает из взаимодействия базовой модели, обвязки агента (agent harness) и среды оценки.

Ключевые факты

  • Предложено оценивать ИИ-агентов по эпистемической скромности (EH): готовности распознавать, учитывать в действиях и сообщать неуверенность при выполнении задачи.
  • EH измеряется тремя поведенческими измерениями на уровне траектории: Identify, Solve, Escalate (ISE); проверяются контролируемый и естественно возникающий конфликты знаний с парным контролем без конфликта.
  • На четырёх агентах высокая точность не обязательно означает высокую скромность: часть точных конфигураций видит конфликт, но не сообщает о неуверенности в неверном итоговом ответе.
  • Агенты часто замечают конфликт на ранних шагах, но не удерживают и не разрешают его на поздних.
  • Вмешательства на уровне модели повышают EH, но часто за счёт точности; авторы связывают EH с взаимодействием модели, обвязки агента и среды оценки.

Почему это важно

Агента обычно оценивают по тому, решил ли он задачу. Работа показывает, что этого мало: агент может дать неверный ответ и при этом не сказать, что в ходе работы наткнулся на противоречие. Для систем, которые самостоятельно ищут данные и делают многошаговые выводы, умение честно сообщить о неразрешённой неопределённости, отдельное свойство, не сводимое к точности.

Кому это важно

Тем, кто строит и оценивает ИИ-агентов, работающих с поиском и внешними источниками, а также исследователям оценки и надёжности языковых моделей. Выводы касаются прежде всего агентов, которые опираются на найденные свидетельства и могут встретить данные, противоречащие знаниям модели или друг другу.

Как это применить

Практический смысл работы, в наборе вопросов к оценке агента: распознаёт ли он конфликт, удерживает ли его до конца траектории и сообщает ли о неуверенности в итоговом ответе (три измерения ISE). Отдельно стоит смотреть на траекторию целиком, а не только на финальный ответ: именно там, по словам авторов, конфликт теряется на поздних шагах. Если пытаться повысить скромность вмешательствами на уровне модели, нужно учитывать возможную потерю точности.

Можно ли доверять

Это научная работа с описанием предложенного авторами подхода и их выводов; описание не называет конкретных агентов и базовых моделей, не приводит числовых результатов и не называет наборов данных, поэтому масштаб эффектов по тексту оценить нельзя. Вывод о том, что скромность возникает из взаимодействия модели, обвязки и среды, сформулирован самими авторами как предположение («suggesting»), а не как доказанный факт. Протестировано четыре агента, так что обобщать результат на все системы рано.

Риски и подводные камни

Определение эпистемической скромности и три измерения ISE, выбор авторов; другие способы операционализации могут давать иные результаты. Выводы получены на четырёх агентах и двух типах конфликтных сценариев. Конкретные вмешательства на уровне модели и величина потери точности в описании не раскрыты, поэтому судить о цене повышения скромности нельзя.