Artificial Analysis запустила Optima, платформу для ИИ-бенчмарков на своих данных

Artificial Analysis запустила Optima, платформу для ИИ-бенчмарков на своих данных

Artificial Analysis, независимая организация, известная своими оценками LLM и бенчмарками GDPval-AA и AA-Briefcase, выпустила платформу Optima. Идея простая: готовые публичные бенчмарки сравнивают модели по заранее заданным чужим задачам и критериям, но не показывают, какая модель лучше всего подходит именно под задачу конкретного пользователя. Optima закрывает этот разрыв: пользователи собирают тест под свой сценарий, прогоняют по нему актуальные ведущие модели и сравнивают результаты по качеству, стоимости и времени на задачу. Платформа уже доступна.

Собрать тест можно тремя способами: загрузить готовый датасет для оценки, из своих файлов или с Hugging Face; загрузить трейсы работы ИИ-агентов с платформ вроде Arize, Braintrust или Langfuse; либо, для разработчиков, поставить специальный модуль (skill), который сам соберёт данные из среды разработки и прошлых сессий. Если готовых данных нет, можно просто описать сценарий использования и привести примеры входов и выходов: Optima сама предложит тестовые задания, критерии оценки и примеры, а пользователь проверяет и уточняет их перед запуском.

Оценивать результаты можно двумя способами. Первый способ: оценка по заранее заданным объективным критериям. Второй способ: попарное сравнение, при котором пользователь сначала сравнивает выборку пар ответов и отмечает, какой ответ лучше, а Optima на основе этих предпочтений выстраивает полный рейтинг моделей по всему тестовому набору. Этот же метод Artificial Analysis использует в своих бенчмарках GDPval-AA и AA-Briefcase.

Помимо качества Optima считает стоимость и время выполнения задачи как отдельные, равноправные метрики сравнения. Это позволяет проверить, оправдывает ли прирост качества более высокую цену или более долгую обработку у конкретной модели. Для агентных сценариев голая цена токена мало что говорит: более дешёвая модель может в итоге обойтись дороже, если ей требуется больше попыток, она чаще ошибается или требует дополнительной чистки результата, поэтому стоимость именно завершённой задачи полезнее как показатель. По данным Artificial Analysis, ранние пользователи уже строили на Optima бенчмарки для финансовых и бухгалтерских агентов и нашли модель, которая сокращает расходы в 10 раз без значимой потери качества; другие проверяли, какая модель точнее воспроизводит стиль письма юристов или точнее выявляет элементы в закрытом наборе изображений.

Ценообразование построено на фактическом расходе токенов используемых моделей, без наценки Optima сверху. Оценка по критериям стоит $0,125 за критерий за модель, попарное сравнение $0,375 за сравнение. В начале создания бенчмарка, при каждом запуске теста и на каждом раунде оценки платформа резервирует баланс по предварительной оценке стоимости, а итоговое списание идёт по фактически потраченным токенам и стоимости оценки.

Optima отвечает на известную проблему ИИ-бенчмарков. По анализу Epoch AI, результаты бенчмарков сильно зависят от деталей реализации, которые почти никогда не раскрываются: разная формулировка промптов и разные настройки температуры заставляли одну и ту же модель показывать заметно разные баллы в зависимости от конфигурации теста. Для агентных бенчмарков вроде SWE-bench одна лишь замена «обвязки» агента (управляющего программного обеспечения и набора инструментов, которыми он пользуется) давала разброс результатов до 15 процентных пунктов. Ещё более масштабное исследование, изучившее 445 бенчмарк-статей с ведущих ИИ-конференций, нашло более системные проблемы: почти в каждой статье были методологические изъяны хотя бы по одному пункту, среди них нечёткие определения, нерепрезентативные выборки, отсутствие статистической проверки. Лишь около 10% изученных бенчмарков использовали полноценные реалистичные задачи, отражающие реальные сценарии применения, а ключевые понятия вроде «рассуждения» или «согласованности (alignment)» часто определялись расплывчато, что подрывает надёжность любых выводов на их основе.

Источник оговаривает и границы самой Optima: платформа решает проблему несоответствия общих бенчмарков конкретной задаче пользователя, но не убирает более глубокие методологические сложности бенчмаркинга как такового. Польза даже персонального теста по-прежнему зависит от того, насколько точно определены целевые способности модели, насколько репрезентативны тестовые случаи и насколько аккуратно реализована и задокументирована сама оценка. Есть и ещё один нюанс: стоимость и время на задачу ничего не говорят о том, сколько результат реально стоит для бизнеса. Дешёвый и быстрый ответ ИИ всё равно может быть неэффективным, если его приходится сильно дорабатывать вручную или он приносит мало пользы процессу, частью которого является.

Ключевые факты

  • Artificial Analysis (создатели бенчмарков GDPval-AA и AA-Briefcase) запустили Optima, платформу для сборки персональных ИИ-бенчмарков на своих данных, трейсах агентов или описании сценария; сервис уже доступен.
  • Собрать тест можно тремя способами: загрузить готовый датасет (свои файлы или Hugging Face), загрузить трейсы ИИ-агентов с Arize, Braintrust или Langfuse, либо поставить модуль (skill), который сам соберёт данные из среды разработки; без данных достаточно описать сценарий и привести примеры, Optima сгенерирует тестовые задания сама.
  • Два способа оценки: по заранее заданным критериям ($0,125 за критерий за модель) или попарным сравнением ответов ($0,375 за сравнение), из которого Optima строит общий рейтинг моделей; наценки на стоимость токенов платформа не берёт.
  • Кроме качества Optima измеряет стоимость и время выполнения задачи как отдельные метрики: ранние пользователи нашли модель, которая для финансовых агентов сократила расходы в 10 раз без значимой потери качества.
  • Причина запуска: известная слабость общих бенчмарков. По данным Epoch AI, замена одной лишь «обвязки» агента даёт разброс результатов до 15 процентных пунктов на тестах вроде SWE-bench, а исследование 445 бенчмарк-статей с ведущих конференций показало, что почти все имеют методологические изъяны и лишь около 10% используют полноценные реалистичные задачи.

Почему это важно

Публичные бенчмарки сравнивают модели по чужим, заранее заданным задачам, поэтому мало говорят о том, какая модель лучше справится именно с вашим сценарием, и вдобавок сами по себе ненадёжны. По анализу Epoch AI, одна лишь смена формулировки промпта или температуры меняет баллы модели, а замена только «обвязки» агента (управляющего ПО и набора инструментов) на тестах вроде SWE-bench даёт разброс результатов до 15 процентных пунктов. Более масштабное исследование 445 бенчмарк-статей с ведущих ИИ-конференций нашло методологические изъяны почти везде, а полноценные реалистичные задачи использовали лишь около 10% работ. Optima предлагает решение: тест строится не на чужих данных и не на чужих критериях, а на собственных данных и сценарии пользователя.

Кому это важно

Прежде всего командам, которые уже используют ИИ в продакшене и выбирают между моделями не абстрактно, а под конкретную рабочую задачу: агентные пайплайны в финансах и бухгалтерии, юридические тексты, разметка изображений в закрытых датасетах. Также разработчикам, которые хотят сравнивать модели по трейсам из Arize, Braintrust или Langfuse, и любому, кто принимает решение «дороже, но лучше» или «дешевле, но почти так же хорошо», то есть выбирает модель не по абстрактному качеству, а по соотношению цены, скорости и результата под свою задачу.

Как это применить

Тест собирается тремя способами: загрузить готовый датасет (свои файлы или Hugging Face), загрузить трейсы работы агентов с Arize, Braintrust или Langfuse, либо, для разработчиков, поставить модуль (skill), который сам вытащит данные из среды разработки и прошлых сессий. Без готовых данных достаточно описать сценарий и дать примеры входов и выходов: Optima сама предложит тестовые задания и критерии, которые можно проверить и поправить перед запуском. Оценивать можно по заданным критериям ($0,125 за критерий за модель) или попарным сравнением ответов ($0,375 за сравнение), из предпочтений в парах Optima строит общий рейтинг моделей. Наценки на токены нет: платформа резервирует баланс по оценке стоимости перед стартом и списывает по факту.

Можно ли доверять

Источник сведений об Optima: только заявления Artificial Analysis, независимого игрока с узнаваемым портфелем бенчмарков (GDPval-AA, AA-Briefcase), без независимой проверки этих конкретных цифр в статье. Какие именно модели входят в сравнение и кто были ранние пользователи, испытавшие Optima, источник не раскрывает, как и точную сумму, от которой считался «десятикратный» выигрыш по стоимости. Более масштабное исследование 445 статей упомянуто без указания автора или организации, его тоже стоит воспринимать как пересказанный, а не самостоятельно проверенный факт.

Риски и подводные камни

Персональный бенчмарк не решает методологические проблемы бенчмаркинга сам по себе: его полезность по-прежнему зависит от того, насколько точно определены измеряемые способности, насколько репрезентативны тестовые случаи и насколько аккуратно задокументирована сама оценка. Плохо спроектированный собственный тест вводит в заблуждение так же легко, как и плохой публичный. Стоимость и время на задачу не равны пользе для бизнеса: дешёвый и быстрый ответ модели всё равно может быть неэффективным, если результат требует серьёзной ручной доработки. Раздельная оплата за каждый критерий и каждое сравнение означает: подробный собственный бенчмарк на много моделей и критериев обходится в реальные, растущие деньги, а не бесплатно.