KernelGenBench: бенчмарк для оценки ИИ-генерации ядер под разные чипы

Рост спроса на ускорительные ядра (kernels) для LLM подтолкнул исследователей автоматизировать их разработку с помощью языковых моделей и агентных систем, но до сих пор не было единого способа строго сравнить, насколько хорошо разные методы справляются с этой задачей на разном железе и на разных типах операторов. Авторы представили KernelGenBench, унифицированный бенчмарк для систематической оценки Triton-ядер, сгенерированных LLM и агентами.

Бенчмарк состоит из двух частей. KernelGenBench-MS (Multi-Source) проверяет генерацию на 210 операторах из трёх источников, выходящих за рамки типичных PyTorch-задач. KernelGenBench-MC (Multi-Chip) измеряет переносимость производительности на подмножестве из 110 операторов, прогоняя их на шести разных аппаратных платформах.

В рамках оценки было потрачено более 15 миллиардов токенов, и авторы сделали три ключевых наблюдения. Во-первых, агентные методы стабильно превосходят методы простого сэмплирования из LLM, а операторы cuBLAS оказались самыми сложными для всех методов без исключения. Во-вторых, качество генерации сильно зависит от платформы: даже специализированные на ядрах агенты резко теряют в качестве при переходе между чипами, например, агент AutoKernel даёт 87% успешных решений на NVIDIA, но всего 25% на Platform E. В-третьих, автономная генерация ядер остаётся крайне дорогой: специализированные агентные методы тратят в среднем 5,11 миллиона токенов на один успешно сгенерированный оператор (агент AKO4all, 5,19 миллиона), что на порядки больше, чем у простых методов сэмплирования из LLM.

Ключевые факты

  • KernelGenBench, первый комплексный бенчмарк для оценки LLM- и агент-генерируемых Triton-ядер сразу по нескольким источникам операторов и типам железа
  • Часть MS (Multi-Source): 210 операторов из трёх источников за пределами стандартных PyTorch-задач
  • Часть MC (Multi-Chip): 110 операторов, тест переносимости производительности на шести аппаратных платформах
  • Агентные методы устойчиво обгоняют простое сэмплирование из LLM, но операторы cuBLAS остаются самыми сложными для всех подходов
  • Специализированный агент AutoKernel: 87% успешных решений на NVIDIA против 25% на Platform E; лучшие агентные методы тратят свыше 5 млн токенов на один успешный оператор

Почему это важно

Разработка эффективных ускорительных ядер, узкое и трудоёмкое ремесло, а спрос на них растёт вместе с ростом самих языковых моделей. LLM и агентные системы обещают автоматизировать эту работу, но без единого строгого бенчмарка невозможно было сравнить методы между собой и понять, где они реально работают, а где только выглядят рабочими. KernelGenBench закрывает этот пробел, впервые объединяя оценку по разным источникам операторов и разным чипам в одном тесте.

Кому это важно

Инженерам, которые разрабатывают или встраивают агентов для автогенерации ядер и низкоуровневой оптимизации под ускорители; командам, создающим инфраструктуру для LLM-инференса и обучения на неоднородном железе; исследователям, оценивающим агентные методы кодогенерации на практических, а не игрушечных задачах.

Как это применить

Бенчмарк можно использовать как эталонный тест при разработке собственных агентов или пайплайнов генерации ядер: часть MS показывает, насколько метод устойчив к разнообразию операторов, а часть MC, насколько решение переносимо между разным железом без пересборки с нуля. Результаты также подсказывают, что стоимость (в токенах), не менее важный критерий при выборе метода, чем итоговое качество.

Можно ли доверять

Это препринт на arXiv без прохождения независимого рецензирования, но заявления подкреплены масштабной эмпирической проверкой: авторы прогнали оценку на 210 операторах (из них 110, ещё и на шести аппаратных платформах) и потратили свыше 15 миллиардов токенов, приводя конкретные цифры по конкретным методам и платформам, а не общие оценки.

Риски и подводные камни

Главный риск, который показывает сам бенчмарк, резкая деградация качества при переносе между аппаратными платформами: агент, дающий 87% успеха на одном чипе, может упасть до 25% на другом. Второй риск, стоимость: специализированные агентные методы требуют миллионы токенов на один успешно сгенерированный оператор, что делает автономную генерацию ядер пока дорогим и не всегда экономически оправданным подходом.