CAPA: бенчмарк проверяет, помнят ли ИИ-ассистенты кода привычки пользователя

CAPA: бенчмарк проверяет, помнят ли ИИ-ассистенты кода привычки пользователя

ИИ-ассистенты для программирования всё чаще превращают неформальные пожелания пользователя в готовый код, но такие запросы часто содержат неоднозначности, которые у конкретного человека повторяются от задачи к задаче и от сессии к сессии. Обычно системы разрешают каждую неоднозначность заново в рамках текущей сессии, как правило, задавая уточняющий вопрос. Авторы работы формулируют новую задачу, персонализированную адаптацию к неоднозначности: по истории уже решённых сессий конкретного пользователя ассистент должен распознать повторяющийся у него паттерн неоднозначности, сразу выдать нужное рабочее решение и свести уточняющие вопросы к минимуму, вместо того чтобы переспрашивать заново каждый раз.

Чтобы проверить эту способность, авторы представили бенчмарк CAPA. Он описывает персонализированную неоднозначность в коде через шесть механизмов и встраивает их в изначально однозначные исполняемые задачи с помощью контролируемого трёхэтапного конвейера генерации. Бенчмарк включает 600 сессий кодинга, распределённых по 60 сбалансированным ячейкам «пользователь × тип неоднозначности», из которых 300 сессий отложены отдельно для оценки моделей.

На CAPA протестировали 12 современных больших языковых моделей в двух режимах, без истории и с историей того же пользователя. Качество мерили тремя метриками: долей исполняемых успешных решений, долей успехов с первой попытки и числом ходов до завершения задачи. Авторы также разбирают, как на результат влияют сложность задачи и личность пользователя, и предлагают лёгкий метод для инференса, «стробирование по истории того же пользователя» (same-user history gating), при котором история используется выборочно, а не всегда. Конкретные числовые результаты, насколько именно история улучшает показатели у разных моделей, в тексте работы не раскрываются. По словам авторов, CAPA закладывает основу для разработки долгоживущих ИИ-ассистентов кода, которые лучше подстраиваются под намерения конкретного пользователя и реже переспрашивают одно и то же.

Ключевые факты

  • Новая задача «персонализированная адаптация к неоднозначности»: ассистент использует историю решённых сессий пользователя, чтобы не переспрашивать повторяющиеся у него неоднозначности.
  • Бенчмарк CAPA: 600 сессий кодинга, 60 сбалансированных ячеек «пользователь × тип неоднозначности», из них 300 сессий отложены для оценки.
  • Неоднозначность встраивается в задачи через шесть механизмов и контролируемый трёхэтапный конвейер генерации.
  • На CAPA протестировали 12 современных LLM в режимах «без истории» и «с историей того же пользователя»; метрики, успешность выполнения, успех с первой попытки, число ходов до завершения.
  • Авторы предлагают лёгкий инференс-метод, «стробирование по истории того же пользователя»; конкретные числовые результаты моделей в тексте абстракта не приводятся.

Почему это важно

Существующие методы снятия неоднозначности в коде решают каждый запрос изолированно, в рамках одной сессии, и заново задают уточняющий вопрос, даже если пользователь уже отвечал на похожий вопрос раньше. Авторы впервые формализуют, может ли история прошлых сессий того же пользователя работать как память, снижающая число повторных переспросов в новой сессии. Это смещает фокус с разовой обработки запроса на долговременную персонализацию ассистента под конкретного человека.

Кому это важно

В первую очередь это адресовано разработчикам ИИ-ассистентов для программирования и исследователям, которые проектируют механизмы памяти и персонализации для LLM. Полезно и командам, оценивающим модели: CAPA даёт стандартизированный набор из 600 сессий и метрики, по которым можно сравнивать 12 и более моделей между собой в задаче учёта пользовательской истории.

Как это применить

CAPA можно использовать как готовый тестовый стенд для проверки, насколько ассистент кода умеет опираться на историю конкретного пользователя вместо повторных уточняющих вопросов. Предложенный авторами лёгкий метод инференса, стробирование по истории того же пользователя, не требует дообучения модели и может быть встроен в существующий пайплайн ассистента как дополнительный шаг перед генерацией ответа.

Можно ли доверять

Источник, абстракт научной работы на Hugging Face Papers, без указания авторского состава и институтов в самом тексте (имя в карточке взято из метаданных краулера, а не из абстракта) и без даты публикации. В тексте нет конкретных числовых результатов по моделям, только описание метрик и общий вывод, что бенчмарк создан и протестирован на 12 LLM. Оценить, насколько велик эффект от использования истории, по одному абстракту нельзя, для этого нужна полная работа с таблицами результатов.

Риски и подводные камни

Использование истории сессий конкретного пользователя как памяти ассистента поднимает вопрос хранения и конфиденциальности этих данных, в абстракте это не обсуждается. Сам бенчмарк построен на синтетически сгенерированных неоднозначностях (шесть механизмов, встроенных контролируемым конвейером), и остаётся открытым, насколько точно это воспроизводит реальные, стихийно возникающие неоднозначности в работе с живыми пользователями.