Artificial Analysis опубликовала бенчмарк компактных ИИ-моделей на iPhone 17 Pro
Artificial Analysis, компания, которая независимо тестирует и сравнивает ИИ-модели, опубликовала на своём сайте страницу «Benchmarking Pocket-Scale Inference» («Бенчмарк карманного инференса»): сравнение компактных ИИ-моделей, рассчитанных на работу прямо на смартфоне, а не в облаке. Компактной здесь считается любая модель, которая после квантования умещается в 8 ГБ памяти, вместе с KV-кэшем на контекст в 8 тысяч токенов. Идея страницы в том, чтобы не оценивать «интеллект» модели отдельно от скорости, как это обычно происходит в облачных бенчмарках, а сразу сопоставить оба параметра на одном и том же реальном устройстве.
Данные о скорости инференса на устройстве собирает партнёр, Liquid AI, который сам разрабатывает компактные модели для локального запуска; Artificial Analysis отдельно подчёркивает, что независимо проверила сам процесс этих измерений Liquid AI, а не просто опубликовала присланные партнёром цифры. На главном графике страницы модели сопоставлены по двум осям: средний балл по набору тестов, подобранных так, чтобы отражать реальные мобильные сценарии использования (лимит контекста, 16 тысяч токенов), и сквозное время генерации ответа. Сейчас эти измерения показаны для одного устройства, iPhone 17 Pro. Отдельно на странице считаются эффективность использования токенов (Token Efficiency) и то, как часто модель выходит за пределы отведённого ей бюджета контекста (Context Budget Overruns).
Набор тестов для мобильного сценария («Mobile Device Benchmark Set», тот же лимит в 16 тысяч токенов) включает шесть категорий: BFCL, вызов внешних инструментов (тот же поднабор вопросов, что и в основном Intelligence Index Artificial Analysis), IFBench, следование инструкциям, AA-Omniscience Accuracy, фактические знания модели, AA-Omniscience Non-Hallucination Rate, доля ответов без галлюцинаций (единица минус частота галлюцинаций), GPQA Diamond, научные рассуждения и MATH-500, количественные и математические рассуждения. Тем, кому нужен не узкий мобильный срез, а полный балл модели по общему Intelligence Index Artificial Analysis, страница даёт ссылку на отдельную карточку этой модели на сайте. Сами числовые результаты и список протестированных моделей оформлены на странице как интерактивные графики, в текстовой версии страницы конкретные баллы, названия моделей, дата публикации и автор не приведены.
Ключевые факты
- Artificial Analysis сравнивает компактные ИИ-модели, те, что после квантования умещаются в 8 ГБ памяти вместе с KV-кэшем на 8 тысяч токенов контекста, по интеллекту и по скорости ответа прямо на смартфоне
- Данные о реальной скорости инференса на устройстве собирает партнёр, Liquid AI; Artificial Analysis утверждает, что независимо проверила сам процесс этих измерений
- На графике «интеллект против скорости» сравниваются средний балл по набору тестов (лимит контекста, 16 тысяч токенов) и сквозное время генерации ответа; сейчас данные показаны для iPhone 17 Pro
- Мобильный набор тестов включает шесть категорий: BFCL (вызов инструментов), IFBench (следование инструкциям), AA-Omniscience Accuracy и Non-Hallucination Rate (знания и доля ответов без галлюцинаций), GPQA Diamond (научные рассуждения) и MATH-500 (математика); отдельно считаются эффективность использования токенов и превышения бюджета контекста
- Конкретные баллы и список моделей на странице показаны только в виде интерактивных графиков, в текстовой версии их нет; полный Intelligence Index каждой модели доступен на её отдельной странице на сайте Artificial Analysis
Почему это важно
Обычные бенчмарки ИИ-моделей меряют «интеллект» через облачный API и никак не учитывают, что произойдёт, если ту же модель запустить не на сервере, а прямо на телефоне: после квантования и в условиях ограниченной памяти качество ответов и скорость могут заметно измениться. Страница Artificial Analysis напрямую связывает эти два параметра для компактных моделей, тех, что умещаются в 8 ГБ памяти вместе с KV-кэшем на 8 тысяч токенов: один и тот же набор тестов даёт средний балл «интеллекта», а данные о скорости не смоделированы, а измерены на реальном iPhone 17 Pro. Отдельно считаются эффективность использования токенов и то, как часто модель выходит за пределы отведённого ей бюджета контекста, оба показателя тоже имеют смысл только на реальном устройстве с реальными ограничениями памяти.
Кому это важно
В первую очередь, разработчикам мобильных приложений и локальных, офлайн-ассистентов на основе ИИ: им нужно выбрать одну компактную модель из многих, и страница напрямую показывает, чем придётся пожертвовать, интеллектом или скоростью, при выборе конкретной модели под iPhone 17 Pro. Важно это и для Liquid AI, и для других разработчиков компактных моделей: именно их продукты попадают в эту витрину сравнения, а хорошее место на графике, прямой аргумент для их клиентов. Наконец, это интересно инженерам, которые проектируют под конкретное железо: страница показывает, что реальное устройство, а не абстрактный бенчмарк в дата-центре, может стать узким местом для готовой ИИ-функции.
Как это применить
Страница на сайте Artificial Analysis, это не готовое решение и не SDK, а инструмент сравнения. Чтобы выбрать модель под конкретный сценарий на телефоне, сначала проверяют, укладывается ли она в определение компактной (до 8 ГБ памяти после квантования вместе с KV-кэшем на 8 тысяч токенов контекста), затем смотрят её место на графике «интеллект против скорости» при лимите контекста в 16 тысяч токенов, а после, разбивку по категориям: вызов инструментов (BFCL), следование инструкциям (IFBench), знания и доля ответов без галлюцинаций (AA-Omniscience), научные и математические рассуждения (GPQA Diamond и MATH-500), а также эффективность использования токенов и частоту превышения бюджета контекста. Если нужен не узкий мобильный срез, а полный балл модели по общему Intelligence Index Artificial Analysis, страница даёт ссылку на отдельную карточку этой модели на сайте.
Можно ли доверять
Artificial Analysis, независимая компания, которая занимается именно сравнением ИИ-моделей, а не производитель, продвигающий собственный продукт; сайт и раньше публиковал похожие инструменты сравнения, например, платформу Optima. В пользу доверия говорит и то, что для измерений на устройстве компания не просто взяла цифры партнёра на веру: Artificial Analysis отдельно заявляет, что независимо проверила сам процесс измерений Liquid AI. Набор тестов тоже узнаваемый и внешний, а не только собственная метрика компании: BFCL, GPQA Diamond, MATH-500, устоявшиеся отраслевые бенчмарки. Оговорка на будущее: Liquid AI одновременно и разработчик собственных компактных моделей, и партнёр по сбору данных измерений на устройстве, а в доступном тексте страницы нет ни конкретных числовых результатов, ни списка протестированных моделей, ни даты публикации, ни автора, они оформлены как интерактивные графики, и перепроверить конкретные цифры по одному только тексту нельзя.
Риски и подводные камни
Главное ограничение видно уже из текста: хотя заголовок и раздел страницы говорят о «мобильных телефонах» во множественном числе, в доступном тексте фигурирует только одно устройство, iPhone 17 Pro; сравнения между разными телефонами, тем более между iOS и Android, по этому тексту не видно. Граница «умещается в 8 ГБ после квантования, включая KV-кэш на 8 тысяч токенов», условный порог, который выбрала сама Artificial Analysis: модель чуть крупнее просто не попадёт в это сравнение, даже если её тоже ставят на телефоны. Данные о скорости на устройстве собирает Liquid AI, участник рынка компактных моделей, а не полностью сторонняя лаборатория; Artificial Analysis говорит о проверке методики измерений, а не о том, что повторила каждое измерение с нуля самостоятельно. И поскольку конкретные баллы, список моделей, дата и автор в тексте страницы не приведены, судить, кто именно лидирует по интеллекту или по скорости, можно только открыв сами интерактивные графики.