SWE-Touch: бенчмарк выявил провалы ИИ-агентов при правках кода на лету

SWE-Touch: бенчмарк выявил провалы ИИ-агентов при правках кода на лету

Исследователи представили SWE-Touch, фреймворк для проверки ИИ-агентов, пишущих код, в условиях общей рабочей области, где пользователь может одновременно просматривать и менять код прямо во время выполнения задачи агентом. Действующие репозиторные бенчмарки обычно оценивают агентов, работающих в одиночку, либо допускают участие пользователя только в виде сообщений в чате, SWE-Touch закрывает этот пробел.

Ядро метода, валидированные «конфликтующие правки» (Counter-Edits): правдоподобные изменения кода, относящегося к задаче, которые вступают в противоречие с её выполнением. Авторы добывают критичные для задачи участки кода из нескольких траекторий её решения, используют отдельный генератор пользовательских патчей (User Patch Generator) для конструирования этих правок и вносят их вместе с контекстными сообщениями от имени пользователя в тот момент, когда агент доходит до соответствующего участка кода.

Авторы оценили девять моделей-агентов для кодинга на бенчмарке SWE-bench Verified, а также провели дополнительные эксперименты на более длинных по горизонту задачах из SWE-Bench Pro и DeepSWE. Внедрение конфликтующих правок снижает средний показатель решённых задач на SWE-bench Verified на 7,7 процентного пункта; деградация сохраняется и на обоих более длинных бенчмарках.

Анализ траекторий работы агентов связывает эти сбои с ограниченным пониманием изменяющейся рабочей области: агенты либо сохраняют конфликтующий код, либо заменяют его, но недостаточно повторно проверяют репозиторий и не валидируют изменённый код целевыми тестами. Вывод авторов: сильные результаты в автономном режиме сами по себе ещё не гарантируют осознания состояния среды и адаптивного поведения, необходимых для совместной работы в общей рабочей области. Авторы указывают на обнаружение изменений в рабочей области, согласование конфликтующих правок с задачей и проверку затронутого поведения как на ключевые способности, которые агентам предстоит развивать дальше.

Ключевые факты

  • Представлен бенчмарк SWE-Touch, проверяет ИИ-агентов для кода в условиях, когда пользователь параллельно правит тот же код во время работы агента
  • Метод основан на валидированных «конфликтующих правках» (Counter-Edits): правдоподобных изменениях кода, которые мешают выполнению задачи; их строит отдельный генератор пользовательских патчей
  • Оценены девять моделей-агентов на SWE-bench Verified, плюс SWE-Bench Pro и DeepSWE для более длинных задач
  • Конфликтующие правки снижают средний процент решённых задач на 7,7 процентного пункта на SWE-bench Verified; деградация сохраняется и на длинных задачах
  • Причина сбоев, агенты слабо отслеживают меняющуюся рабочую область: сохраняют конфликтующий код или заменяют его без повторной проверки репозитория и тестов

Почему это важно

Большинство бенчмарков для ИИ-агентов, пишущих код, тестируют их в стерильных условиях, агент работает один, без вмешательства человека в сам код. SWE-Touch впервые системно проверяет более реалистичный сценарий: живую совместную работу, где пользователь параллельно правит те же файлы. Результат, 7,7 процентного пункта падения решённых задач, показывает, что автономная сила агентов не переносится напрямую на условия совместной работы с человеком в общей рабочей области.

Кому это важно

Разработчикам, которые встраивают ИИ-агентов вроде кодовых ассистентов в командную работу над репозиторием, и командам, создающим сами такие агенты: результаты SWE-Touch указывают на конкретный слепой участок, обработку конфликтующих изменений кода, внесённых человеком параллельно с агентом.

Как это применить

SWE-Touch можно использовать как дополнительный тест при выборе или обучении кодового агента: помимо стандартной точности на SWE-bench Verified имеет смысл смотреть, насколько устойчиво агент ведёт себя, когда пользователь параллельно меняет код. Авторы называют три способности, которые стоит целенаправленно развивать и проверять: обнаружение изменений в рабочей области, согласование конфликтующих правок с задачей и повторную проверку затронутого поведения тестами.

Можно ли доверять

Материал, научная работа с методологией: авторы вводят механизм валидированных конфликтующих правок, тестируют девять моделей на признанном бенчмарке SWE-bench Verified и подтверждают эффект на двух дополнительных наборах задач (SWE-Bench Pro, DeepSWE). Конкретные названия моделей и результаты по каждой из них в исходном тексте не приведены, доступны только агрегированные цифры по девяти моделям.

Риски и подводные камни

Из текста не следует, что 7,7 процентного пункта, предел деградации: цифра усреднена по девяти моделям, и разброс между отдельными моделями в источнике не раскрыт. Само явление, агенты, которые сохраняют устаревший код или заменяют его без повторной проверки, говорит о риске тихих ошибок в реальных проектах, где ИИ-агент работает бок о бок с живым разработчиком, редактирующим тот же код.