RealSWE: живые запросы снижают точность ИИ-агентов на 6,4 п.п.

Исследователи заметили разрыв между тем, как принято оценивать ИИ-агентов для написания кода, и тем, как их реально используют. Стандартный бенчмарк SWE-bench строится из отобранных issue на GitHub, длинных, структурированных и насыщенных деталями. Реальные же запросы пользователей обычно намного короче и менее структурированы.
Чтобы измерить этот разрыв, авторы разработали таксономию из шести категорий информации в запросе и четырёх параметров языкового стиля и применили её к реальным пользовательским запросам из SWE-chat и к формулировкам задач из SWE-bench Verified и SWE-bench Pro. Выяснилось, что запросы, где есть только постановка задачи, сама по себе или с минимальным дополнительным контекстом, составляют 88% реальных пользовательских промптов, но лишь 7% задач в бенчмарке. Кроме того, 87% реальных запросов написаны неформально, тогда как 94% задач бенчмарка, формально.
Опираясь на эти наблюдения, авторы представили RealSWE, набор из 381 семейства задач на основе SWE-bench Verified и SWE-bench Pro. Варианты внутри каждого семейства решают одну и ту же задачу и опираются на один и тот же эталонный патч, различаясь только составом информации и языковым стилем формулировки.
Проверив на RealSWE семь современных языковых моделей, исследователи получили три вывода. Во-первых, реалистичные по форме запросы в среднем снижают долю решённых задач на 6,4 процентных пункта и способны менять места моделей в рейтинге. Во-вторых, контролируемый анализ показал: наличие в запросе желаемого поведения и мотивации существенно влияет на результат, тогда как информация об окружении и шаги воспроизведения лишь добавляют токены без измеримой пользы. В-третьих, языковой стиль формулировки даёт лишь небольшой эффект, и его величина зависит от конкретной модели.
Практический вывод авторов: явное указание желаемого поведения и мотивации, то, что большинство реальных запросов пользователей опускает, заметно повышает качество работы модели над задачами разработки.
Ключевые факты
- RealSWE, 381 семейство вариантов задач на основе SWE-bench Verified и SWE-bench Pro; варианты внутри семейства решают одну и ту же задачу и используют один эталонный патч, отличаясь только составом информации и стилем формулировки
- 88% реальных пользовательских запросов (из SWE-chat) содержат только постановку задачи почти без контекста, против 7% задач в бенчмарке SWE-bench; 87% реальных запросов написаны неформально против 94% формальных в бенчмарке
- На семи современных языковых моделях реалистичные по форме запросы в среднем снижают долю решённых задач на 6,4 п.п. и способны менять места моделей в рейтинге
- Наличие в запросе желаемого поведения и мотивации существенно повышает результат модели, а сведения об окружении и шаги воспроизведения ошибки почти не дают эффекта, лишь удлиняя запрос
- Языковой стиль формулировки (формальный/неформальный) влияет на результат слабо, и эффект зависит от конкретной модели
Почему это важно
Бенчмарки вроде SWE-bench формируются из тщательно отобранных, детально описанных issue с GitHub, и по ним принято сравнивать ИИ-агентов для написания кода. Но работа показывает, что такие задачи почти не похожи на то, что пишут реальные пользователи: 88% реальных запросов ограничиваются голой постановкой задачи против 7% в бенчмарке, а 87% написаны неформально против 94% формальных задач в тесте. Из-за этого оценки на бенчмарке систематически завышают то, как агент справится с живым, неформальным запросом: на реалистичных формулировках результат падает в среднем на 6,4 процентных пункта, а расстановка мест между моделями может меняться.
Кому это важно
Разработчикам ИИ-агентов и инструментов для автоматизации написания кода, при выборе модели по таблицам лидеров SWE-bench стоит учитывать, что цифры получены на нетипично подробных формулировках задач. Авторам и составителям бенчмарков, исследование показывает конкретный пробел (короткие неформальные запросы) и предлагает готовый инструмент (RealSWE) для его закрытия. Пользователям ИИ-агентов для разработки, выводы работы прямо говорят, как сформулировать запрос эффективнее.
Как это применить
Главная практическая рекомендация авторов: явно указывать в запросе желаемое поведение и мотивацию, что именно нужно получить и зачем, поскольку именно этих сведений чаще всего не хватает в реальных запросах, а их наличие заметно улучшает результат агента. При этом тратить время на подробное описание окружения и пошаговое воспроизведение ошибки менее оправданно: контролируемый анализ показал, что эти сведения почти не повышают долю решённых задач, лишь удлиняя запрос. Разработчикам и тестировщикам агентов для кода стоит использовать наборы вроде RealSWE, а не только классический SWE-bench, чтобы оценка отражала работу с живыми, неформальными запросами.
Можно ли доверять
Источник, препринт статьи с исследовательской методологией: авторы вводят таксономию признаков запроса, статистически сопоставляют реальные и бенчмарковые формулировки, а затем проверяют выводы контролируемым экспериментом на семи моделях, где варианты внутри каждого семейства задач различаются ровно одним параметром при неизменном эталонном решении. В доступном тексте не указаны авторы и организации, не названы конкретные семь протестированных моделей и не приведена детализация результатов по каждой модели, есть только усреднённая цифра 6,4 п.п.; эти детали, видимо, раскрыты в полном тексте статьи, а не в аннотации.
Риски и подводные камни
Работа опирается на конкретный источник реальных запросов (SWE-chat) и конкретный бенчмарк (SWE-bench), поэтому выводы о доле неформальных и куцых запросов могут не совпадать для других инструментов и других языков программирования. Усреднённое падение на 6,4 п.п. скрывает разброс между моделями, в тексте отмечено, что реалистичные формулировки способны менять места моделей в рейтинге, а значит для одних моделей эффект может быть заметно больше, для других, меньше. Наконец, отсутствие в аннотации перечня протестированных моделей не позволяет проверить, насколько репрезентативна выборка из семи систем.