FrugalEvo: рекорд в упаковке кругов за $0,55, 1,68 вместо ~$50

Методы эволюции программ под управлением больших языковых моделей, такие как AlphaEvolve, хорошо справляются со сложными вычислительными задачами оптимизации, например с упаковкой кругов. Авторы статьи отмечают, что прежние работы обычно оптимизируют прирост качества за фиксированное число итераций, и утверждают, что на практике нужно максимизировать прирост на единицу затрат.
Для этого предложен FrugalEvo, эволюционный фреймворк, учитывающий стоимость. Более сильная и дорогая модель исследует стратегии решения, а более дешёвая реализует их и итеративно дорабатывает получившийся код. Кроме того, авторы разработали процесс эволюции, эффективный по кэшу: обвязка (harness) и промпты построены так, чтобы на разных шагах эволюции как можно больше общих префиксов, это улучшает повторное использование кэша.
Для оценки качества решения при фиксированном бюджете введена метрика BA-AUC (Budget-Aware Area Under the Curve): площадь под кривой лучшего на данный момент результата в зависимости от накопленных затрат на LLM, до границы бюджета.
Результаты: на 10 математических и системных задачах оптимизации FrugalEvo по качеству итогового решения не уступает или превосходит современные базовые методы, включая OpenEvolve, ShinkaEvolve, AdaEvolve и EvoX, и при этом даёт более высокий BA-AUC на 9 задачах. На 10 алгоритмических задачах оптимизации из ALE-Bench-Lite его средний результат выше, чем у этих методов.
Отдельно выделена упаковка кругов: FrugalEvo показывает новый уровень state of the art (лучший известный результат) с GPT-5.6 Terra и Luna всего за 1,68 доллара и с GLM-5.3 и её вариантом Flash за 0,55 доллара. Это не уступает или превосходит все базовые методы, включая мультиагентные CORAL и SwarmResearch, которые стоят в среднем около 50 долларов.
Ключевые факты
- FrugalEvo делит работу между моделями: дорогая исследует стратегии решения, дешёвая реализует их и дорабатывает код.
- Обвязка и промпты рассчитаны на максимальное совпадение префиксов между шагами эволюции, чтобы лучше использовать кэш.
- Новая метрика BA-AUC, площадь под кривой лучшего результата в зависимости от накопленных затрат на LLM до границы бюджета.
- На 10 математических и системных задачах метод не уступает или превосходит OpenEvolve, ShinkaEvolve, AdaEvolve и EvoX по итоговому качеству и выигрывает по BA-AUC на 9 задачах.
- На упаковке кругов новый рекорд достигнут за 1,68 доллара (GPT-5.6 Terra и Luna) и за 0,55 доллара (GLM-5.3 и её вариант Flash) против примерно 50 долларов в среднем у мультиагентных CORAL и SwarmResearch.
Почему это важно
Методы вроде AlphaEvolve показали, что LLM могут находить сильные решения в сложных задачах оптимизации, но обычно их сравнивают по приросту качества за фиксированное число итераций. Авторы предлагают другую рамку: считать выигрыш на единицу затрат. На упаковке кругов они сообщают о новом лучшем результате за 0,55, 1,68 доллара, тогда как мультиагентные методы CORAL и SwarmResearch стоят в среднем около 50 долларов.
Кому это важно
Исследователям и инженерам, которые используют LLM для эволюционного поиска алгоритмов и оптимизации кода и считают расходы на токены. Также тем, кто сравнивает такие методы: предложенная метрика BA-AUC учитывает не только финальный результат, но и то, как быстро и дёшево он достигнут.
Как это применить
Из аннотации следует общая идея: разделить роли между моделями, сильную модель задействовать для выбора стратегии, а дешёвую для реализации и доработки кода, и строить промпты так, чтобы префиксы повторялись между шагами и лучше работал кэш. В аннотации не названы цена использования метода и ссылка на код, поэтому для воспроизведения нужно смотреть полный текст статьи.
Можно ли доверять
Все цифры взяты из аннотации статьи и представляют собой заявления самих авторов; независимой проверки в материале нет. Приведены только затраты, а числовые значения качества (например, сумма радиусов при упаковке кругов) и значения BA-AUC не даны. Цифра около 50 долларов, это приблизительное среднее именно для мультиагентных методов CORAL и SwarmResearch, а не для всех базовых методов.
Риски и подводные камни
В аннотации не указан бюджет, использованный в экспериментах, и не сказано, какая именно из 10 задач не показала выигрыш по BA-AUC. Также не раскрыто, какая часть экономии приходится на более дешёвую модель, а какая на повторное использование кэша, и запускались ли базовые методы с теми же моделями. Сравнение стоимости с мультиагентными методами поэтому стоит читать осторожно.