ABSeeker: агент на 4B параметров дотянулся до моделей в разы крупнее

Поисковые агенты, которые ищут, проверяют и собирают информацию за несколько шагов, обычно обучают так: вся цепочка действий получает одну общую оценку, успех или провал. Из-за этого модель не может понять, какие именно шаги были полезны, а какие, ошибочными или лишними, даже если итоговый ответ верный или, наоборот, неверный из-за одного неудачного шага. Авторы статьи предлагают метод Answer-Backtracked Credit Assignment (ABC), который превращает эту одну общую оценку в подробную, пошаговую.
Работает это так: зная вопрос и правильный ответ на него, ABC сначала прослеживает путь от ответа назад, восстанавливает промежуточные подсказки ("улики"), которые нужны были, чтобы прийти к этому ответу. Затем каждый шаг агента в цепочке поиска сверяется с этими подсказками и получает свою оценку, насколько он приближал к ответу. На основе таких пошаговых оценок авторы построили два способа обучения: ABC-SFT, который по-разному взвешивает вклад каждого шага при обучении с учителем, и ABC-GRPO, где пошаговые оценки становятся наградой в обучении с подкреплением по схеме GRPO.
На этой основе исследователи обучили модель ABSeeker на базе Qwen3.5-4B, используя всего 8,5 тысячи примеров. На бенчмарке BrowseComp она набрала 37,3%, на BrowseComp-ZH, 39,1%. С добавлением управления контекстом результаты выросли до 55,3% и 52,9% соответственно. По утверждению авторов, это заметно превосходит другие агенты того же масштаба (4B) и приближается к результатам моделей примерно в 30B параметров, то есть примерно в семь раз крупнее.
Ключевые факты
- Предложен метод ABC (Answer-Backtracked Credit Assignment): вместо одной оценки на всю цепочку действий агент получает оценку за каждый отдельный шаг поиска
- Оценка шага строится через восстановление промежуточных подсказок от правильного ответа назад к началу цепочки, а затем сверку каждого шага с этими подсказками
- На основе пошаговых оценок построены два способа обучения: ABC-SFT (взвешивание вклада шагов при обучении с учителем) и ABC-GRPO (пошаговая оценка как награда в RL)
- Модель ABSeeker (база Qwen3.5-4B, всего 8,5 тыс. примеров для обучения) показала 37,3% на BrowseComp и 39,1% на BrowseComp-ZH, а с управлением контекстом, 55,3% и 52,9%
- Результаты ABSeeker (4B) превосходят агенты того же масштаба и приближаются к моделям порядка 30B параметров
Почему это важно
Стандартный способ обучать поисковых агентов, награждать или штрафовать всю цепочку действий целиком, по итоговому результату. Проблема в том, что такая награда ничего не говорит о том, какие конкретно шаги внутри цепочки были полезны, а какие, ошибочными или лишними: агент может случайно прийти к верному ответу через неудачный шаг или, наоборот, сделать несколько правильных шагов, но получить общий провал из-за одной ошибки в конце. ABC решает именно эту проблему, переводит грубую оценку "успех/провал" в подробную оценку по каждому шагу.
Кому это важно
Работа адресована тем, кто занимается разработкой и обучением ИИ-агентов, выполняющих длинные многошаговые задачи поиска, проверки и сбора фактов, то есть систем, похожих на исследовательских или поисковых ассистентов, которым нужно самостоятельно решать, куда идти дальше в цепочке рассуждений. Отдельно результат интересен тем, кто работает с ограниченными вычислительными ресурсами: авторы показывают, что более точное обучение позволяет компактной модели приближаться по качеству к моделям существенно большего размера.
Как это применить
Метод ABC применяется в два этапа обучения. Сначала для набора вопросов с известными правильными ответами восстанавливаются промежуточные подсказки, необходимые для решения (Answer-Backtracked Clue Recovery), а затем каждый шаг агента в цепочке поиска сверяется с этими подсказками и получает свою оценку (Clue-Anchored Step Scoring). Эти оценки затем используются в двух вариантах: ABC-SFT переопределяет вес каждого шага при обучении с учителем, ABC-GRPO использует их как награду в обучении с подкреплением по схеме GRPO. Модель ABSeeker обучена этим способом на базе Qwen3.5-4B на 8,5 тысячи примеров.
Можно ли доверять
Результаты приведены на двух публичных бенчмарках для поисковых агентов, BrowseComp (английский) и BrowseComp-ZH (китайский), с конкретными числовыми показателями до и после добавления управления контекстом. Заявленное превосходство над агентами того же масштаба (4B) и приближение к моделям порядка 30B, оценка самих авторов; сторонняя проверка или сравнение с независимыми бенчмарками в тексте не упомянуты. Имена авторов и организация, стоящая за работой, в тексте не указаны.
Риски и подводные камни
В источнике не раскрыто, из чего именно состоит упомянутое "управление контекстом", кроме итоговых цифр, которые оно даёт, оценить вклад этого компонента отдельно от самого метода ABC невозможно. Не названы конкретные модели, с которыми сравнивается ABSeeker в категории "около 30B", это затрудняет независимую проверку сравнения. Также не приведены данные о вычислительных затратах и времени обучения, дате публикации, доступности кода или лицензии.