JevBench исключил classifier.dev из рейтинга: это модель Jev под чужим брендом

JevBench, открытый воспроизводимый бенчмарк для типизированных «моделей принятия решений» (decision models). Версия v1.3.0 прогоняет 534 решения (220 из них, сложные), штрафует системы с показателем Intelligence ниже 50, а итоговый балл считает как среднее геометрическое четырёх подпоказателей, Intelligence, Calibration, Speed и Cost, каждый с весом 25%. Официальный лидер рейтинга, модель Jev 1.13.0 компании TypeSafe, набравшая 74.4 балла и занявшая 1-е место.
Авторы бенчмарка отдельно проверили сервис classifier.dev, который на своём быстром («fast») тарифе набрал 83.6 балла (Intelligence 85.1, Calibration 77.9, Speed 87.6, Cost 84.3), выше, чем у Jev. Но в рейтинг эту оценку не поставили: по данным самого classifier.dev, его быстрый тариф, это и есть Jev 1.13.0, запущенный напрямую. Собственная страница бенчмарка classifier.dev прямо пишет: «Быстрый тариф, это Jev, модель компании TypeSafe», а API-ответ сервиса возвращает "model": "jev-1.13.0", ту же версию, что измеряет JevBench. Сравнивать classifier.dev с Jev означало бы сравнивать модель Jev саму с собой, поэтому начиная с версии JevBench v1.2.4 такие случаи идут как почётное упоминание, а не как ранжируемая позиция.
Смарт-тариф classifier.dev устроен иначе: это Jev плюс модель-рассуждатель (заявлен gemini-3.8-flash), которая переспрашивает только те ответы, где уверенность Jev была ниже 0.7. Но в этом прогоне измерили только быстрый тариф, эскалацию смарт-тарифа не тестировали вовсе, и оценки для неё нет.
По цене: $0.0033 за 1000 решений, это оценка при полной выработке платного тарифа Pro ($20 в месяц за 200 000 быстрых классификаций в день). При меньшей нагрузке цена за решение растёт: при использовании десятой части лимита это уже $0.033 за 1000. Сам прогон JevBench шёл на бесплатном тарифе (20 000 классификаций в день), который ничего не стоит. Собственная страница цен classifier.dev называет и другую цифру, около $0.005 за тысячу классификаций как стоимость самой модели за быстрым тарифом (нужен ключ TypeSafe), но это оценка для коротких однострочных запросов classifier.dev, а не для полноразмерных вопросов JevBench.
Разница в счёте между быстрым тарифом и самим Jev небольшая: 97.3% против 94.5% на «судейском» уровне сложности и 70.5% против 74.1% на сложном уровне. Собственное объяснение classifier.dev для такого рода расхождений, батчинг («быстрый тариф, это Jev, упакованный по тысяче запросов в один»); на двух своих внутренних тестовых наборах classifier.dev расценивает разницу такого масштаба как шум.
JevBench отдельно отмечает, что сам classifier.dev, легитимный и хорошо задокументированный продукт: бесплатен без регистрации, открытый код на GitHub, автор, Michael Ryaboy (@michael_chomsky). Среди открытых участников рейтинга (модели с опубликованным кодом или весами) лидируют SemIf (2-е место, 73.1), djev (3-е, 73.0), Winnow-12B Q8 (4-е, 71.2) и reflex 4B (5-е, 70.3). Материал также упоминает jev-router.com, сервис для самостоятельного хостинга открытых decision-моделей, которым управляют сами авторы бенчмарка; JevBench раскрывает это как конфликт интересов и уточняет, что jev-router.com не получает преимущества при оценке и не входит в число ранжируемых участников.
Ключевые факты
- Быстрый тариф сервиса classifier.dev, это модель Jev 1.13.0 компании TypeSafe, запущенная напрямую, а не собственная разработка classifier.dev
- Итоговый балл classifier.dev, 83.6 (выше официального лидера Jev с 74.4), но в рейтинг JevBench его не поставили: с версии v1.2.4 такие случаи идут как почётное упоминание, а не как позиция в таблице
- Смарт-тариф classifier.dev, это Jev плюс модель-рассуждатель (gemini-3.8-flash), переспрашивающая ответы с уверенностью ниже 0.7, но в этом прогоне измерили только быстрый тариф
- Цена: $0.0033 за 1000 решений при полной выработке платного тарифа Pro ($20/мес за 200 000 запросов в день), при 1/10 нагрузки, уже $0.033 за 1000; сам бенчмарк шёл на бесплатном тарифе (20 000 запросов в день) бесплатно
- Небольшая разница в счёте с оригинальным Jev (97.3% против 94.5% на «судейском» уровне, 70.5% против 74.1% на сложном) classifier.dev объясняет батчингом запросов и на своих тестах называет шумом
Почему это важно
История показывает, как легко хостинговый сервис поверх чужой модели может выглядеть как самостоятельный участник рейтинга, если бенчмарк не проверяет, что именно стоит за API. JevBench явно прописал в методологии правило для таких случаев (с версии v1.2.4) и применил его: сервис classifier.dev не ранжируется, потому что оказался тем же Jev 1.13.0 от TypeSafe, а не отдельной моделью.
Кому это важно
Разработчикам, которые выбирают сервис для классификации или типизированного принятия решений и сравнивают цену и качество разных провайдеров; тем, кто уже пользуется classifier.dev и хочет понимать, что именно исполняет их запросы; авторам других бенчмарков decision-моделей, которым приходится решать ту же проблему «обёрток» над чужими моделями.
Как это применить
Если нужен именно быстрый тариф classifier.dev, это фактически прямой доступ к Jev 1.13.0, и цена зависит от объёма: на бесплатном тарифе 20 000 запросов в день бесплатно, на платном Pro, $20 в месяц за 200 000 запросов в день ($0.0033 за 1000 при полной выработке лимита, но $0.033 за 1000 при десятикратно меньшей нагрузке). Смарт-тариф с эскалацией на модель-рассуждатель пока не тестировался JevBench, так что решать о нём судить не по чему. Тем, кто хочет запускать Jev-совместимые модели самостоятельно, в материале упомянут open-source вариант jev-router.com.
Можно ли доверять
Методология JevBench задокументирована открыто: харнесс и публичные задачи распространяются под MIT-лицензией, правила подсчёта (геометрическое среднее четырёх подпоказателей, штраф за низкий Intelligence) описаны явно. Материал сам раскрывает потенциальный конфликт интересов, jev-router.com принадлежит авторам бенчмарка, и прямо указывает, что этот сервис не получает преимущества при оценке. При этом все цифры, из одного прогона самих авторов бенчмарка, без независимой проверки со стороны.
Риски и подводные камни
Цена на быстрый тариф classifier.dev сильно зависит от объёма использования, на практике итоговая стоимость может оказаться в разы выше рекламной оценки $0.0033 за 1000 решений. Смарт-тариф с эскалацией не проверялся вовсе, и его реальное качество и цена не подтверждены этим бенчмарком. Открытый код или собственный EU-хостинг decision-моделей сам по себе не делает развёртывание соответствующим GDPR, это отдельно проговаривается в материале.
«Быстрый тариф, это Jev, модель компании TypeSafe»
— classifier.dev, собственная страница бенчмарка (classifier.dev/benchmark)