Модель Jev точнее Laya на 9 из 11 решений агента, а авторы исправили свои ошибки

Агентные системы на каждом шаге принимают много мелких типизированных решений: какую модель вызвать, какой инструмент выбрать, релевантен ли найденный текст, нет ли во входных данных инъекции. «Модели системы 1» (System-1 decision models) отвечают на такие вопросы за один прямой проход и выдают вероятности классов. Авторы статьи отмечают, что такие модели обещают большую экономию стоимости и задержки по сравнению с вызовами больших языковых моделей.

Авторы сравнили в парных тестах открытую по весам модель Laya и хостинговую Jev на 11 точках принятия решений агента, собранных из 18 публичных источников. В набор вошли 7 283 базовых случая и 6 640 вариантов для проверки устойчивости. Входные данные были побайтно одинаковыми, использовались парные тесты, а воспроизводимость проверяли на разном оборудовании и в разные дни.

Результат: Jev значимо точнее на 9 из 11 точек принятия решений, преимущество составляет от +10,8 до +46,0 процентных пунктов. Ни одна из моделей не превосходит случайное угадывание при маршрутизации между моделями в режиме zero-shot (без примеров), а в оценке релевантности найденного текста для RAG они дают ничью. Laya меняет 30% ответов, если порядок вариантов обратить, и резко деградирует, когда кандидатов много или они похожи. В примере с выбором инструмента Laya показывает 31% при 50 ближайших по смыслу инструментах, тогда как у Jev на задачах с единственным верным инструментом, 98%.

Отдельная часть работы, аудит собственного конвейера. Три ошибки анализа и одно искажение дизайна эксперимента исказили прежние главные выводы авторов о внедрении. Первое: не был учтён расход на предварительную проверку, заявленная экономия 23,9% на деле составила 4,3%. Второе: точность на этапе-фильтре (gate) выдали за сквозное качество, 58% против 98%. Третье: пороги подбирались на тех же данных (in-sample); при целевых 5% пропусков на отложенной выборке доля пропусков доходила до 17%. Четвёртое: «эффект канала» в ложных срабатываниях детектора инъекций исчезает, если использовать содержимое, родное для канала. Ещё два заподозренных искажения на выводы не повлияли.

Все случаи, сырые выходы моделей и код анализа авторы выложили в публичный репозиторий на GitHub (David-DL-Space/sys1-eval).

Ключевые факты

  • Сравнение Laya (открытые веса) и Jev (хостинговая) на 11 точках принятия решений агента из 18 публичных источников: 7 283 базовых случая и 6 640 вариантов устойчивости.
  • Jev значимо точнее на 9 из 11 точек, преимущество от +10,8 до +46,0 п.п.; в zero-shot-маршрутизации между моделями обе не лучше случайного выбора, а в RAG-фильтрации релевантности ничья.
  • Laya меняет 30% ответов при смене порядка вариантов; при 50 ближайших инструментах показывает 31% против 98% у Jev на задачах с единственным верным инструментом.
  • Самоаудит: экономия 23,9% на деле оказалась 4,3% из-за неучтённой стоимости предварительной проверки; сквозное качество 58%, а не 98% точности фильтра; пороги на тех же данных дали до 17% пропусков вместо целевых 5%.
  • Данные, сырые выходы и код анализа открыты на GitHub.

Почему это важно

Быстрые модели решений для агентов продают как способ резко удешевить и ускорить работу по сравнению с вызовами больших языковых моделей. Работа проверяет это обещание на единых данных и показывает, что результат сильно зависит от задачи: на девяти из 11 точек выигрывает Jev, а в маршрутизации между моделями ни одна из двух не лучше случайного выбора. Не менее ценно, что авторы пересматривают собственные громкие цифры: экономия 23,9% превратилась в 4,3%.

Кому это важно

Разработчикам агентных систем, которые решают, заменять ли часть вызовов большой модели быстрой моделью решений для выбора инструмента, маршрутизации, фильтрации найденных текстов или обнаружения инъекций. Также исследователям, оценивающим такие модели: работа показывает, какие ошибки методики встречаются на практике.

Как это применить

Из статьи следуют практические проверки перед внедрением: считать экономию вместе со стоимостью предварительной проверки; отличать точность фильтра от сквозного качества; подбирать пороги на отдельных данных, а не на тех же; проверять устойчивость к смене порядка вариантов и к большому числу похожих кандидатов. Код и данные оценки опубликованы на GitHub (David-DL-Space/sys1-eval), так что тесты можно воспроизвести на своих задачах.

Можно ли доверять

Это аннотация научной статьи на arXiv, и все выводы, самих авторов. Методика выглядит аккуратной: побайтно одинаковые входы, парные тесты, проверки воспроизводимости на разном оборудовании и в разные дни, открытые данные и код. Выводы подкреплены открытым репозиторием, а ошибки в прежних цифрах авторы признают сами. Но в тексте аннотации нет авторов и организаций, не сказано, на чём построены Laya и Jev, кто их выпускает, каковы их размеры и цены. Какие два из 11 решений Jev не выигрывает значимо, кроме маршрутизации и RAG-фильтрации, тоже не уточняется.

Риски и подводные камни

Результаты относятся к конкретным 11 точкам решений и двум моделям; переносить их на другие модели и задачи без проверки нельзя. Из аннотации не видно, на какой модели и точке принятия решений измерены цифры 58% и 98% или 23,9% и 4,3%, и не раскрыта метрика, стоящая за 31% у Laya. Сами авторы показывают, как легко завысить выгоду: из-за неучтённых расходов, подмены метрики или подбора порогов на тех же данных. Это стоит учитывать и при чтении их выводов, и при оценке чужих заявлений об экономии.