Почему выводы ИИ-бенчмарков нельзя механически складывать в одну цепочку доказательств
Результат одного ИИ-бенчмарка почти никогда сам по себе не превращается в содержательный практический вывод, по пути оценщики совершают целую серию шагов: обобщают результат на новые случаи, трактуют его как показатель способности модели, переносят на другие системы или площадки развёртывания, а затем добавляют допущения о том, как результат будет проверяться людьми и к каким последствиям приведёт. Существующие подходы к оценке достоверности бенчмарков требуют доказательств для каждого отдельного вывода в этой цепочке. Работа указывает на другую проблему: даже если каждое отдельное звено цепочки обосновано, это не гарантирует, что обоснована сама цепочка целиком, обоснованные связи не складываются автоматически в обоснованную последовательность.
Центральное понятие статьи, «проецируемость» (projectibility): вопрос о том, оправдан ли перенос вывода, сделанного на основе наблюдаемых случаев, на случаи, которые ещё не наблюдались. Термин восходит к философу Нельсону Гудмену, который показал, что для одних и тех же данных можно построить несколько конкурирующих обобщений ("проблема соперничающих экстраполяций"); авторы соединяют эту идею с подходом "validity-centred", архитектурой проверки обоснованности отдельных аргументов, чтобы тестировать такие конкурирующие обобщения применительно к оценке ИИ.
Основной результат, «принцип неаддитивности»: поддержка двух соседних проекций (шагов рассуждения) разрешает их объединение в одну цепочку только тогда, когда совпадают конечные точки и исходные допущения этих проекций, а зависимости между данными и неопределённость результатов переносятся из одного шага в другой без потерь. Если хотя бы одно из этих условий нарушено, соединять выводы нельзя, даже если каждый из них сам по себе корректен.
Авторы иллюстрируют принцип на нескольких примерах. Кейс из юридических исследований показывает, что результат бенчмарка и отдельное исследование того, как система работает в реальном развёртывании, могут быть каждый по отдельности методически безупречны, и при этом оставаться «параллельными», то есть не складываться в единый вывод о пригодности системы для практического применения. Повторный анализ данных и симуляция дополнительно показывают, что устойчивость агрегированных (усреднённых) показателей бенчмарка может маскировать различия между отдельными случаями, а именно эти различия оказываются критичными на следующем шаге проекции, когда результат переносят на новую задачу или новую популяцию пользователей.
Итог работы, практический инструмент, «аудит проецируемости»: процедура, которая проверяет цепочки аргументов вида «от результата бенчмарка, к утверждению о пригодности системы для реального использования» и диагностирует в них необоснованные, неоправданные стыки между шагами.
Ключевые факты
- Результат ИИ-бенчмарка редко доходит до практического вывода за один шаг: по пути его обобщают, переносят на другие системы и площадки, а также добавляют допущения о человеческой проверке и последствиях использования.
- Обоснованность каждого отдельного вывода в такой цепочке не гарантирует обоснованность самого соединения выводов, это отдельная, отдельно проверяемая проблема.
- Ключевое понятие, «проецируемость» (projectibility, восходит к философу Нельсону Гудмену): оправдан ли перенос вывода с наблюдаемых случаев на ненаблюдаемые.
- Сформулирован «принцип неаддитивности»: соседние выводы можно объединять в цепочку только если совпадают их конечные точки и допущения, а зависимости и неопределённость передаются по цепочке без потерь.
- На примере из юридических исследований и на реанализе данных с симуляцией показано, что результат бенчмарка и исследование реального внедрения могут быть каждый корректны сами по себе, но не складываться в общий вывод; итог, метод «аудита проецируемости» для выявления таких необоснованных стыков.
Почему это важно
Индустрия и исследователи регулярно строят содержательные утверждения о возможностях и безопасности ИИ-систем, складывая результаты нескольких бенчмарков и исследований в одну доказательную цепочку, «модель показала X на тесте, значит, она способна на Y в реальном применении». Работа показывает, что такое сложение само по себе требует отдельного обоснования: проверенности каждого отдельного звена недостаточно, если стыки между звеньями никто не проверял.
Кому это важно
В первую очередь, методологам и исследователям, которые разрабатывают и интерпретируют бенчмарки ИИ, командам, отвечающим за оценку безопасности и готовности моделей к развёртыванию, а также тем, кто на основе бенчмарков принимает решения о допуске систем к реальному использованию (например, в праве, медицине или других чувствительных областях).
Как это применить
Авторы предлагают конкретную процедуру, «аудит проецируемости»: перед тем как соединять результаты двух исследований или бенчмарков в общий вывод, нужно явно проверить, совпадают ли их конечные точки и исходные допущения и переносятся ли зависимости данных и неопределённость результатов из одного шага в другой. Если хотя бы одно из условий нарушено, соединять выводы напрямую нельзя, нужно либо провести отдельное исследование именно на стыке, либо явно указать разрыв в цепочке доказательств.
Можно ли доверять
Это теоретическая, методологическая работа: она опирается на философский аппарат (проблема соперничающих экстраполяций Нельсона Гудмена) и на подход validity-centred к оценке аргументов, а иллюстрирует принцип конкретным кейсом из юридических исследований, а также реанализом данных и симуляцией. Речь идёт не об эмпирическом открытии новых фактов о конкретной модели, а о методе проверки логики уже существующих доказательных цепочек.
Риски и подводные камни
Главный риск, обратный: сегодня решения о развёртывании и допуске ИИ-систем нередко опираются именно на такие непроверенные цепочки бенчмарков, и предложенный аудит указывает, что часть таких выводов может опираться на необоснованные стыки, а не на реально подтверждённую цепочку доказательств. Работа не даёт готового списка «опасных» существующих утверждений, она даёт метод, которым эти утверждения ещё предстоит перепроверить.