EvolveTrade: LLM-агент для торговли сам переписывает свою стратегию по итогам сделок

Торговые ИИ-агенты на базе больших языковых моделей (LLM) умеют совмещать рыночные данные, новости и исполняемый анализ, но их поведение чаще всего задаётся статичным, вручную написанным набором правил использования инструментов, он фиксируется ещё до запуска агента в работу. Из-за этого агент не может подстроить то, как он собирает данные, вызывает инструменты, проверяет сигналы и управляет риском, когда рыночный режим меняется.
Авторы представляют EvolveTrade, фреймворк, в котором системный промпт торгового агента, использующего инструменты, рассматривается как текстовая параметризованная политика (стратегия поведения). После каждого интервала обновления отдельный агент-политика пересматривает эту стратегию, опираясь на накопленные следы принятых решений и на реальную отдачу портфеля, при этом базовая языковая модель («бэкбон») остаётся неизменной. Обновлённая стратегия затем применяется к следующей партии торговых решений, так агент постепенно уточняет собственную процедуру сбора информации и построения портфеля.
В экспериментах на нескольких рыночных режимах и на двух разных базовых LLM EvolveTrade в большинстве проверенных настроек показал более высокий коэффициент Шарпа (Sharpe Ratio) и совокупную доходность (Cumulative Return), чем агенты с фиксированной стратегией. Поведенческий анализ дополнительно показал, что самообновляющиеся стратегии чаще задействуют анализ через код и активируют вычисления, релевантные текущему рыночному режиму; отдельный разбор на уровне отдельных кейсов прослеживает, как изменения стратегии, вызванные обновлением политики, влияют на итоговую разницу в доходности.
Авторы делают вывод, что адаптация именно многоразовой процедуры, управляющей использованием инструментов, ключевое направление для построения более устойчивых торговых ИИ-агентов на базе LLM.
Ключевые факты
- EvolveTrade превращает системный промпт торгового LLM-агента в обновляемую текстовую стратегию вместо жёстко прописанного набора правил.
- После каждого интервала торговли отдельный агент-политика переписывает стратегию по накопленным решениям и результатам портфеля; сама базовая LLM при этом не меняется.
- В экспериментах на нескольких рыночных режимах и двух базовых LLM EvolveTrade в большинстве настроек показал более высокий коэффициент Шарпа и совокупную доходность, чем агенты с фиксированной стратегией.
- Самообновляющиеся стратегии чаще используют анализ через код и активируют вычисления, привязанные к текущему рыночному режиму.
- Авторы считают адаптацию процедуры использования инструментов ключевым направлением развития более устойчивых торговых агентов на LLM.
Почему это важно
Большинство торговых ИИ-агентов на LLM сегодня работают по правилам использования инструментов, зашитым один раз и навсегда: как собирать данные, когда проверять сигнал, как управлять риском. При смене рыночного режима такой агент не подстраивается, меняется рынок, а логика поведения агента остаётся прежней. EvolveTrade показывает путь вокруг этого ограничения без дообучения самой модели: стратегия хранится как текст (системный промпт), и отдельный агент-политика правит именно этот текст по итогам реальных решений и реальной отдачи портфеля. Это отделяет способность агента адаптироваться от необходимости менять веса базовой модели.
Кому это важно
В первую очередь, тем, кто строит или исследует торговых агентов на базе LLM: интересен и сам результат (более высокий коэффициент Шарпа и доходность против фиксированной стратегии), и механизм. Но идея шире одной ниши: разделение «базовая модель неизменна / политика инструментов, текст, который можно переписывать по обратной связи» применимо к любым LLM-агентам с использованием инструментов, не только торговым, это интересно разработчикам агентных систем в целом.
Как это применить
В тексте источника нет ни ссылки на код или датасет, ни названия конкретных рыночных режимов и базовых моделей, использованных в экспериментах, работа описывает архитектуру и результат, но не даёт готового инструмента для повторения. Практический вывод на сегодня, сама идея: если у агента есть текстовый слой политики использования инструментов, его можно обновлять отдельным «агентом-политикой» по накопленным решениям и итоговой отдаче, не трогая базовую модель. Воспроизвести эксперимент из статьи напрямую пока нельзя, только реализовать подход самостоятельно.
Можно ли доверять
Материал, препринт с HuggingFace Papers, рецензирование в тексте не упомянуто, имена авторов и организация в самом тексте не указаны. Результат заявлен качественно («часто улучшает» показатели «в большинстве проверенных настроек»), а не в виде конкретных цифр, процентного прироста коэффициента Шарпа или доходности источник не приводит. Это ограничивает степень проверяемости заявления: улучшение подтверждено экспериментально, но насколько оно велико, из текста не следует.
Риски и подводные камни
Главный источник неопределённости, сама конструкция «политика обновляется по недавним результатам»: такой механизм рискует подстраиваться под последний по времени рыночный режим и терять устойчивость при его резкой смене, хотя источник впрямую этот риск не разбирает. Отсутствие в тексте названий конкретных рыночных режимов, идентичности двух использованных базовых LLM и числовых результатов не позволяет оценить, насколько устойчив выигрыш вне условий эксперимента. Код и датасет не выложены, поэтому независимая проверка результатов пока невозможна.