Benchmark Radar объединил поиск, живой каталог и историю оценок ИИ-бенчмарков

Benchmark Radar объединил поиск, живой каталог и историю оценок ИИ-бенчмарков

Исследователи, работающие над бенчмарками, и разработчики больших языковых моделей и других ИИ-систем сталкиваются с одной и той же практической потребностью: найти подходящие уже существующие оценки, добраться до их датасетов и кода и понять, в каких именно условиях был получен опубликованный результат. Именно эту потребность авторы работы называют отправной точкой для Benchmark Radar, живой, постоянно обновляемой базы данных и поисковика для обнаружения бенчмарков ИИ, который охватывает оценку больших языковых моделей, агентные тесты, тесты на использование инструментов, программирование, рассуждение, безопасность и бенчмарки для отдельных предметных областей.

Система сочетает ежедневный автоматический сбор новых статей о бенчмарках, репозиториев, датасетов и релизов с поисковым каталогом самих бенчмарков, их упоминаниями в карточках моделей и технических отчётах, а также историей изменения оценок во времени. Ежедневный сбор идёт по 37 источникам: 13 прямых коннекторов и 24 фида от исследовательских и инженерных команд. Запись в каталоге сохраняет источник и цитату, это позволяет проверить конкретный бенчмарк и данные, стоящие за его оценкой, а не просто довериться агрегированному числу.

На момент публикации каталог содержит 1283 записи, собранные из четырёх существующих сборников бенчмарков, и 12 916 отдельных численных наблюдений результатов тестов, которые охватывают 790 из этих 1283 записей.

Помимо самой системы, авторы полностью проаудировали получившийся каталог и разбирают три темы: насыщение бенчмарков, выходят ли оценки моделей на потолок теста; тренды их использования, какие бенчмарки реально применяются и как долго; и границы того, насколько вообще сравнимы оценки, полученные на разных бенчмарках. Отдельно в работе разобран полный пример «поиска по предшествующим аналогам»: пошагово показано, как запросить каталог и изучить накопленные по бенчмарку данные при проектировании новой оценки.

Вместе с работой авторы выкладывают веб-дашборд, лидерборд по бенчмаркам, график Парето-фронта, сопоставляющий оценку с измеренным реальным использованием теста, отдельные представления насыщения и трендов, ежедневно обновляемые фиды новых бенчмарков и доступные для скачивания подтверждающие данные, а также интерфейс командной строки (CLI) для офлайн-запросов к каталогу и материалы для воспроизведения проведённого анализа.

Сама аннотация не называет ни одного автора, лаборатории или организации, стоящей за проектом: отдельное поле с именем в карточке публикации аннотацией не подтверждается. В тексте нет ни даты публикации или подачи работы, ни ссылки или инструкции для доступа к веб-дашборду и CLI, ни сравнения Benchmark Radar с другими каталогами или трекерами бенчмарков, ни сведений о том, кто поддерживает систему и как устроен запуск ежедневного сбора данных.

Ключевые факты

  • Benchmark Radar, живая, постоянно обновляемая база данных и поисковик для бенчмарков ИИ: охватывает оценку больших языковых моделей, агентные тесты, тесты на использование инструментов, программирование, рассуждение, безопасность и бенчмарки для отдельных предметных областей.
  • Ежедневный автоматический сбор новых статей о бенчмарках, репозиториев, датасетов и релизов идёт по 37 источникам, 13 прямых коннекторов и 24 фида от исследовательских и инженерных команд.
  • Каталог хранит 1283 записи, собранные из четырёх существующих сборников бенчмарков, и 12 916 отдельных численных наблюдений результатов тестов, охватывающих 790 из этих записей.
  • Запись сохраняет источник и цитату, можно проверить конкретный бенчмарк и данные, лежащие в основе его оценки, а не просто довериться агрегированному числу.
  • Авторы также полностью проаудировали каталог, разобрали насыщение и тренды использования бенчмарков и границы сравнимости их оценок, а на примере показали, как искать предшествующие аналоги перед созданием нового теста; вместе с работой вышли веб-дашборд с лидербордом, график Парето-фронта «оценка против использования» и CLI для офлайн-запросов.

Почему это важно

Бенчмарков для больших языковых моделей и других ИИ-систем становится больше, и авторы работы отталкиваются от конкретной практической потребности: тому, кто хочет оценить модель, сначала нужно найти подходящие уже существующие тесты, добраться до их датасетов и кода и понять, в каких именно условиях был получен опубликованный результат. Benchmark Radar устроен как ответ на эту потребность: ежедневный автоматический сбор новых статей о бенчмарках, репозиториев, датасетов и релизов из 37 источников превращается в поисковый каталог, где к записям привязаны источник и цитата, а не разрозненное число без контекста.

Кому это важно

В первую очередь, исследователям, которые проектируют новый бенчмарк: в работе разобран полный пример «поиска по предшествующим аналогам», как запросить каталог и изучить накопленные данные по близким тестам, прежде чем выпускать ещё один похожий. Во вторую, тем, кто читает чужие статьи и хочет понять, откуда взялась конкретная цифра в таблице результатов: каталог хранит историю оценок и цитату из источника, а не только само число. Разработчикам моделей полезен сам охват: оценка больших языковых моделей, агентные тесты, тесты на использование инструментов, программирование, рассуждение, безопасность и бенчмарки для отдельных предметных областей собраны в одном месте вместо разрозненных списков по каждой теме.

Как это применить

С системой можно работать двумя способами: через веб-дашборд, где есть лидерборд по бенчмаркам, график Парето-фронта, сопоставляющий оценку с измеренным реальным использованием теста, отдельные представления насыщения и трендов и ежедневно обновляемые фиды новых бенчмарков, либо через интерфейс командной строки (CLI) для офлайн-запросов к каталогу, что удобно, если поиск по бенчмаркам нужно встроить в собственный скрипт или пайплайн. Можно скачать подтверждающие данные и проверить, на чём основаны оценки, а материалы для воспроизведения анализа из самой работы выложены отдельно. Прямой ссылки на сам дашборд или CLI в тексте аннотации нет.

Можно ли доверять

Это публикация на Hugging Face Papers, агрегаторе препринтов, а не рецензируемая статья, и сама аннотация не называет ни одного автора, лаборатории или организации, стоящей за проектом: отдельное поле с именем в карточке публикации аннотацией не подтверждается, поэтому кто именно построил и поддерживает систему, по тексту не установить. В пользу подхода, то, что авторы не просто выкладывают каталог, а полностью его проаудировали и отдельно разбирают ограничения собственных данных, включая то, насколько вообще сравнимы оценки, полученные на разных бенчмарках, то есть сами не выдают агрегированные цифры за абсолютную истину. При этом покрытие количественных данных неполное: из 1283 записей каталога численные наблюдения результатов есть только у 790, а сравнения Benchmark Radar с другими каталогами или трекерами бенчмарков аннотация не приводит.

Риски и подводные камни

Главный риск, принять частичный каталог за полный: численные результаты привязаны лишь к 790 из 1283 записей, у остальных, судя по всему, есть только библиографические данные без оценок. Сами авторы отмечают ограниченность прямого сравнения оценок между разными бенчмарками, это стоит учитывать при чтении лидерборда, а не сглаживать. Аннотация не говорит, кто поддерживает систему и как устроен запуск ежедневного сбора данных, значит, неясно, что станет с каталогом и его актуальностью, если сбор остановится или сменится команда. Наконец, в тексте нет ни ссылки на сам дашборд или CLI, ни даты публикации работы, так что найти инструмент и оценить его свежесть по одной аннотации нельзя.