Φ-Bench: может ли ИИ сам разработать инфраструктуру для себя

Φ-Bench: может ли ИИ сам разработать инфраструктуру для себя

Исследователи представили Φ-Bench, бенчмарк для систематической проверки того, способны ли большие языковые модели заниматься инженерной работой над инфраструктурой, на которой сами эти модели работают: от отдельных вычислительных ядер до системы целиком.

Авторы объясняют, чем существующие тесты не годятся для этой задачи: они проверяют работу либо с изолированными вычислительными ядрами, либо с заранее заданными операторами, либо с заранее определённой целью оптимизации, и поэтому не показывают, способна ли модель на открытую (без жёстко заданной формы задачи) и растянутую во времени инженерную работу над инфраструктурой языковых моделей, какая нужна в реальной разработке.

Φ-Bench собран из задач по оптимизации, уже изучавшихся в передовых исследовательских работах, и привязан к реальным репозиториям кода, а не к синтетическим примерам. Это, по словам авторов, даёт бенчмарку широкий охват всего инфраструктурного стека и разброс задач по сложности: от точечного дописывания кода на уровне одного вычислительного ядра, через долгие, состоящие из многих шагов задачи реализации, до сквозной оптимизации системы целиком.

На Φ-Bench авторы прогнали серию экспериментов с передовыми языковыми моделями. По их описанию, результаты показывают как нынешние возможности этих моделей в инженерной работе со сложной инфраструктурой языковых моделей, так и их ограничения, и дают представление о том, какие трудности остаются на пути к автономной оптимизации ИИ-инфраструктуры будущего. Какие именно модели тестировались и какие числовые результаты они показали, аннотация работы не сообщает.

Ключевые факты

  • Φ-Bench, новый бенчмарк для систематической проверки того, способны ли большие языковые модели сами заниматься инженерной работой над инфраструктурой, на которой они же работают, от вычислительных ядер до системы целиком.
  • Причина создания: существующие тесты проверяют только изолированные вычислительные ядра, заранее заданные операторы или заранее определённую цель оптимизации, и не показывают, способна ли модель на открытую, растянутую во времени инженерную работу с инфраструктурой языковых моделей.
  • Задачи бенчмарка взяты из оптимизационных задач передовых исследований и привязаны к реальным репозиториям кода; сложность задач, от точечного дописывания кода одного вычислительного ядра до долгих многошаговых задач реализации и сквозной оптимизации всей системы.
  • Авторы прогнали через Φ-Bench серию экспериментов с передовыми языковыми моделями: по их описанию, результаты показывают и текущие возможности, и ограничения моделей в инженерной работе с инфраструктурой языковых моделей.
  • Аннотация работы не называет ни протестированные модели, ни числовые результаты экспериментов, ни авторов и организации, ни дату публикации, ни доступность кода и датасета бенчмарка.

Почему это важно

Языковые модели всё увереннее пишут и правят код, и авторы фиксируют логичный следующий шаг: поручить им саму инженерную работу над инфраструктурой, которая эти модели обслуживает. До Φ-Bench проверить эту способность можно было только на узких задачах, изолированное вычислительное ядро, заранее заданный оператор, заранее определённая цель оптимизации: модели уже сказали, что именно и в каких границах улучшать. Φ-Bench важен тем, что проверяет более реалистичный сценарий, открытую, растянутую во времени инженерную работу, охватывающую весь стек, от одной функции до оптимизации системы целиком, то есть ближе к тому, как такая работа выглядит на практике.

Кому это важно

Тем, кто исследует, насколько передовые языковые модели готовы к самостоятельной инженерной работе над собственной инфраструктурой, низкоуровневыми вычислительными ядрами, операторами, системами, которые всё это обслуживают. Бенчмарк создан именно для систематической проверки этой способности, поэтому он адресован исследовательским лабораториям и командам, которые разрабатывают и оценивают модели для такой работы, а не конечным пользователям ИИ-продуктов.

Как это применить

Φ-Bench, не готовый инструмент, а исследовательский тест: набор задач разной сложности, от дописывания кода одного вычислительного ядра до сквозной оптимизации системы целиком. Прогнав через него конкретную модель, можно получить представление о том, где именно она справляется с инженерной работой над инфраструктурой языковых моделей, а где, нет. Аннотация не говорит, публикуются ли код и датасет бенчмарка и на каких условиях, так что возможность прогнать через него свою модель зависит от того, что раскрывает полный текст публикации.

Можно ли доверять

Источник, аннотация научной работы на HuggingFace Papers, то есть описание из первых рук от авторов, а не пересказ третьих лиц: постановка задачи и устройство бенчмарка изложены надёжно. Но аннотация, не вся публикация: в ней не названы ни авторы, ни организации, ни то, какие именно передовые модели тестировались, ни числовые результаты экспериментов, ни дата публикации, ни доступность кода и датасета. Проверить конкретные цифры и выводы можно только по полному тексту работы.

Риски и подводные камни

Аннотация сообщает, что эксперименты показали «нынешние возможности и ограничения» моделей, но не называет ни сами цифры, ни то, какие модели тестировались (см. «Можно ли доверять»), поэтому по одной аннотации нельзя судить, насколько передовые модели в реальности близки к самостоятельной инженерной работе над инфраструктурой. Отдельный вопрос, насколько задачи, построенные на реальных репозиториях кода, могли попасть в обучающие данные оценённых моделей: это общий риск для любого бенчмарка, который берёт материал из открытого кода, а не создаёт задачи с нуля. И раз сами авторы обозначают горизонт работы как «автономную оптимизацию ИИ-инфраструктуры будущего», это тема про модели, которые со временем сами дорабатывают системы, от которых сами же зависят.

«Языковые модели уже показали впечатляющие способности в рассуждении и генерации кода, а значит, в перспективе способны помогать в разработке и оптимизации той самой инфраструктуры, которая их же обслуживает.»

— авторы Φ-Bench, в аннотации к работе