E2A-Bench выявил провалы в оценке финансовых ИИ и перекос к «покупай» после дообучения

Исследователи представили E2A-Bench, бенчмарк из 969 запросов, который проверяет не просто умение мультимодальной ИИ-модели (VLM) прочитать финансовый график, а то, можно ли доверять её итоговому решению «покупать» или «продавать». По мнению авторов, существующие тесты на галлюцинации в основном смотрят только на отдельные утверждения, подтверждены они текстом или нет, но не прослеживают, остаётся ли доказательство связанным с рассуждением модели, её уверенностью и итоговым действием на всём пути от графика до совета.
Бенчмарк построен на 323 акциях, входящих в индекс HS300 (крупнейшие бумаги материкового Китая), и трёх модальностях входных данных; каждый запрос снабжён доказательствами, детерминированно рассчитанными из данных OHLCV, цен открытия, максимума, минимума, закрытия и объёма торгов. Модели оценивают по четырём осям: опора на факты, согласованность между рассуждением и действием, калибровка между уверенностью и доказательствами и направленное покрытие ответов, им соответствуют метрики UCR, RCI, ECI и NDR. Последняя, NDR, намеренно устроена так, чтобы измерять надёжность цепочки «доказательство → действие» с поправкой на покрытие, а не реальную доходность на торгах.
На 20 проверенных моделях авторы нашли три проблемы, которые скрывает единственный сводный балл за галлюцинации. Во-первых, модель с самым низким UCR, то есть, казалось бы, с наименьшим числом необоснованных утверждений, по итоговому NDR оказывается почти в самом низу рейтинга: она даёт направленный, а не уклончивый ответ лишь в 6,4% случаев. Во-вторых, добавление верификации с «оракулом» (эталонной проверкой) снижает число неподтверждённых утверждений, но одновременно может обрушить покрытие, модель попросту начинает чаще уклоняться от прямого ответа. В-третьих, дообучение моделей на финансовых данных усиливает соотношение рекомендаций «покупать» к «продавать» в 4,21, 4,68 раза при сравнении строгих пар «базовая модель, её дообученная версия»: специализация под финансовую область систематически толкает модели к более «бычьим» советам.
Вывод авторов: оценивать финансовые VLM по единственному баллу за галлюцинации недостаточно, нужно прослеживать всю цепочку от доказательства до действия. Код и данные бенчмарка опубликованы на GitHub.
Ключевые факты
- E2A-Bench, 969 запросов по 323 акциям индекса HS300, три модальности входных данных; доказательства детерминированно выведены из данных OHLCV.
- Модели оценивают по четырём метрикам, UCR, RCI, ECI и NDR; NDR намеренно не измеряет реальную доходность на торгах, а только надёжность цепочки «доказательство → действие» с поправкой на покрытие.
- У модели с самым низким UCR (меньше всего неподтверждённых утверждений), один из худших результатов по NDR: она отвечает по существу, а не уклончиво, лишь в 6,4% случаев.
- Верификация с «оракулом» снижает число неподтверждённых утверждений, но может обрушить покрытие ответов.
- Дообучение на финансовых данных усиливает соотношение «покупать»/«продавать» в 4,21, 4,68 раза при сравнении строгих пар «базовая модель, дообученная версия».
Почему это важно
Финансовые VLM всё чаще предлагают как помощников, читающих графики и советующих «покупать» или «продавать». Обычные тесты на галлюцинации проверяют только, подтверждён ли текст модели источником, но не отвечают на вопрос, остаётся ли ход рассуждения связанным с самим доказательством вплоть до итогового совета: модель может формально не попасться на выдумке и всё равно давать ненадёжные рекомендации. E2A-Bench впервые системно проверяет именно эту цепочку «доказательство → рассуждение → уверенность → действие», а не только отдельные утверждения.
Кому это важно
Разработчикам и исследователям, которые строят или оценивают финансовые VLM и торговых ассистентов на их основе; командам, которые дообучают базовые модели под финансовую область и рискуют получить систематический перекос в сторону «покупать»; всем, кто при оценке ИИ-моделей на галлюцинации полагается на один сводный балл, работа показывает, что такой балл легко переоценить.
Как это применить
Код и данные E2A-Bench опубликованы на GitHub, так что бенчмарк можно прогнать на своей модели. Практический вывод для тех, кто дообучает VLM под финансовые задачи: смотреть не только на итоговый балл за галлюцинации, а отдельно, на направленное покрытие (долю решительных, а не уклончивых ответов) и на соотношение «покупать»/«продавать» до и после дообучения; именно в этих двух местах, по данным авторов, прячутся самые серьёзные искажения.
Можно ли доверять
Методология описана подробно: почти тысяча запросов, привязанных к детерминированным доказательствам из котировок, и сравнение 20 моделей по четырём независимым метрикам, это похоже на добросовестное эмпирическое исследование, а не на маркетинговое заявление. При этом сам текст работы не называет ни авторов, ни организацию, ни площадку или дату публикации, а точные числовые значения UCR/RCI/ECI по каждой модели и названия моделей с худшими результатами в доступном описании не приводятся, их можно найти только в полном тексте и коде на GitHub, которые здесь не проверялись.
Риски и подводные камни
Главный риск, считать, что низкий балл за галлюцинации сам по себе означает надёжность: модель может редко «выдумывать» и при этом в подавляющем большинстве случаев уклоняться от прямого ответа, а это на практике не более полезно. Верификация с «оракулом» лечит один изъян (недостоверные утверждения) ценой другого (падения покрытия), обычный компромисс точности и полноты, который легко упустить, глядя на один показатель. И главное для практического применения: дообучение под финансовую область само по себе склоняет модель отвечать «покупать» в разы чаще, независимо от того, оправдано ли это конкретным графиком, а поскольку NDR не измеряет реальную торговую доходность, хороший балл в бенчмарке ещё не гарантия, что советы модели будут прибыльными.