Desert Ant Labs выпустила 18 локальных ИИ-моделей и SDK для разработчиков

Европейская компания Desert Ant Labs объявила о своём запуске: это ИИ-лаборатория, которая строит компактные специализированные модели для устройств, для работы со звуком, изображениями и текстом. Одновременно с запуском вышли первые 18 моделей (12 стабильных и 6 бета-версий), доступные через единый SDK (набор инструментов для разработчиков) для Swift, Kotlin и JavaScript. Каждая модель бесплатна до 100 тысяч активных устройств в месяц, без оплаты по токенам и без обязательной регистрации.
Среди представленных моделей: Voz расшифровывает 10 минут аудио за две секунды на iPhone, это в 4,7 раза быстрее Whisper, и проставляет тайм-коды начала и конца для каждого слова. Clear, модель весом 9 МБ, которая превращает пятиминутную запись с ноутбука в звук студийного качества за одну секунду. Redact в реальном времени маскирует имена, адреса и номера карт на 27 языках, чтобы эти данные вообще не попадали на серверы разработчика. Tongue по трём словам определяет один из 84 языков с помощью модели весом всего 2 МБ. Ещё для 14 моделей линейки компания опубликовала полные характеристики и бенчмарки на desertant.com/models и на Hugging Face.
Компания объясняет свой путь к этому запуску через собственное видеоприложение Detail, которое она пять лет развивает по принципу «сначала на устройстве». Но как только в приложении появлялись функции вроде автоматической нарезки коротких роликов (Auto Edit) или улучшения звука подкастов, команде приходилось переходить на облачные API, и по мере роста популярности Detail росли и счета за инфраструктуру. Готовых моделей под такие узкие задачи на рынке не находилось, и Desert Ant Labs начала обучать их сама. Так, модель Clear заменила в Detail сервис Dolby, а с моделью Voz расшифровка аудио внутри приложения ускорилась в 5 раз. Ещё одна модель, Clips (284 МБ), превращает 10-минутное видео примерно в дюжину клипов за 5 секунд, по данным компании, она заменила в Detail модель Claude Sonnet и работает в 10 раз быстрее, тратя в 470 раз меньше энергии при том же качестве. Следующая версия приложения, Detail 6, которая выйдет вместе с iOS 27, должна полностью заменить облачные API собственными моделями, работающими целиком на устройстве.
Свой расчёт Desert Ant Labs строит на разрыве между тем, где сегодня стоит вычислительная мощность, и тем, где её используют для ИИ: по оценке компании, индустрия потратит на дата-центры около $450 млрд в этом году, а мир поставит больше миллиарда телефонов, планшетов и ноутбуков с достаточно мощными чипами, то есть в руках у людей вычислений больше, чем во всех ИИ-дата-центрах вместе взятых. Ссылаясь на исследователей NVIDIA, изучивших три агентные системы, компания приводит их оценку: от 40 до 70% обращений к большим моделям в этих системах можно было бы направить на маленькую специализированную модель. Свою стратегию компания описывает метафорой мозга: первую сотню моделей она сравнивает с «мозжечком», который берёт на себя постоянную фоновую работу на устройстве бесплатно; дальше должен появиться слой-«кора», который сам решает, какая модель отвечает на запрос, сначала маленькая локальная, затем более крупная локальная и, только если задачу нельзя решить на устройстве, облачная. Отдельно компания подчёркивает, что строит всё это в Европе, где локальная обработка данных, норма по умолчанию: раз данные клиента никогда не покидают устройство, их нельзя получить ни через чужое облако, ни принудительным запросом.
Ключевые факты
- Европейская Desert Ant Labs запустилась сразу с 18 моделями для устройств, 12 стабильных и 6 бета-версий, для звука, изображений и текста; доступны через единый SDK для Swift, Kotlin и JavaScript, бесплатно до 100 тысяч активных устройств в месяц.
- Voz расшифровывает 10 минут аудио за 2 секунды на iPhone (в 4,7 раза быстрее Whisper) с тайм-кодами по каждому слову; Clear (9 МБ) превращает 5-минутную запись в звук студийного качества за секунду; Redact в реальном времени маскирует персональные данные на 27 языках; Tongue по трём словам определяет один из 84 языков моделью весом 2 МБ.
- Компания выросла из собственного видеоприложения Detail (пять лет на принципе «сначала на устройстве»): с ростом популярности приложения росли и счета за облачные API, и Desert Ant Labs начала обучать нужные модели сама, а не искать готовые.
- Модель Clips (284 МБ) заменила в Detail модель Claude Sonnet для нарезки видео на клипы, по данным компании, в 10 раз быстрее и с 470-кратной экономией энергии при том же качестве; следующая версия приложения, Detail 6 (выйдет вместе с iOS 27), должна перейти на собственные модели полностью на устройстве.
- Аргумент компании: индустрия потратит на дата-центры около $450 млрд в этом году, а мир поставит больше миллиарда достаточно мощных телефонов, планшетов и ноутбуков; ссылаясь на исследователей NVIDIA, изучивших три агентные системы, Desert Ant Labs приводит оценку 40, 70% вызовов к большим моделям, которые можно заменить маленькой специализированной.
Почему это важно
Desert Ant Labs формулирует ставку, которую в отрасли обсуждают давно, но редко подкрепляют цифрами: для большой доли обычных ИИ-задач, расшифровать аудио, снять шум, найти в тексте персональные данные, определить язык, не нужна большая облачная модель с оплатой по токену. Компания ссылается на исследователей NVIDIA, которые изучили три агентные системы и оценили, что от 40 до 70% обращений к большой модели в них можно было бы заменить маленькой специализированной. При этом, по подсчётам компании, индустрия в этом году потратит на дата-центры около $450 млрд, а мир поставит больше миллиарда телефонов, планшетов и ноутбуков с чипами, способными считать такие задачи бесплатно и локально. Если этот баланс сдвинется, часть спроса, который сегодня оплачивает облачный инференс по токену, может уйти на устройство, и именно на это целится запуск: не одна большая модель, а сразу 18 узких.
Кому это важно
Разработчикам приложений с частыми, простыми по сути вызовами к ИИ, расшифровка, чистка звука, поиск персональных данных в тексте, определение языка, которые сегодня платят за них облачным API по токену или упираются в задержку сети: SDK для Swift, Kotlin и JavaScript и бесплатный порог в 100 тысяч активных устройств в месяц снимают именно эту статью расходов. Европейским командам и компаниям, для которых важно, что данные клиента не покидают устройство, это прямо заявленное позиционирование Desert Ant Labs. Самой компании и её видеоприложению Detail, которое пять лет росло по модели «сначала на устройстве» и каждый раз упиралось в облачные счета при добавлении новой функции, этот запуск закрывает ровно ту проблему, из-за которой он появился.
Как это применить
Все 18 моделей, 12 стабильных и 6 бета-версий, подключаются одним SDK для Swift, Kotlin или JavaScript; полные характеристики и бенчмарки на все модели, включая 14, не описанные подробно в посте, компания публикует на desertant.com/models и на Hugging Face. Попробовать модели можно через CLI (интерфейс командной строки) на Mac или прямо в браузере на Hugging Face; документацию компания описывает как рассчитанную и на разработчиков, и на ИИ-агентов. Каждая модель бесплатна до 100 тысяч активных устройств в месяц без оплаты по токенам и без обязательной регистрации, что происходит с ценой выше этого порога, в посте не сказано. На уровне архитектуры компания предлагает своё видение развития: сегодняшние модели, это «мозжечок», постоянная фоновая работа на устройстве, а дальше должен появиться слой-«кора», который сам выбирает, какая модель отвечает на запрос, маленькая локальная, более крупная локальная или, только если задачу нельзя решить на устройстве, облачная.
Можно ли доверять
Это собственный пост компании о своём запуске, а не независимый разбор: все сравнения, Voz против Whisper, Clips против Claude Sonnet, Clear против Dolby, приведены со слов Desert Ant Labs, без ссылок на методологию или независимую проверку. Оценка NVIDIA (40, 70% вызовов можно заменить маленькой моделью) дана из вторых рук, источник не приводит ни ссылки на исследование, ни его названия; оценки «больше миллиарда» устройств и $450 млрд на дата-центры тоже даны без ссылки на источник. У поста нет названного автора: несмотря на рассказ от первого лица в разделе про историю компании, в тексте не указаны ни имя, ни должность, ни страна внутри Европы, где базируется компания, ни размер команды или финансирования. Наконец, в тексте есть две разные цифры об ускорении расшифровки аудио с помощью Voz, «в 4,7 раза быстрее Whisper» и отдельно «в 5 раз быстрее» для собственной расшифровки компании внутри Detail, и источник не поясняет, идёт ли речь об одном и том же сравнении.
Риски и подводные камни
Бесплатный порог в 100 тысяч активных устройств в месяц, это, по сути, воронка: что будет с ценой и лимитами после него, компания не говорит, и разработчик, который встроит SDK в продукт, узнает точные условия роста только когда до них дорастёт. Все заявленные преимущества по скорости, качеству и энергоэффективности, внутренние измерения самой компании; сторонних бенчмарков или воспроизводимых тестов в посте нет. У моделей Desert Ant Labs, в отличие от нейтральных моделей с оплатой за токен, есть выбранное компанией поведение по умолчанию, источник сам об этом говорит прямо, упоминая и рычаги, которые позволяют разработчику это умолчание сменить, и это стоит учитывать, если приложению важна предсказуемость поведения модели «из коробки».
«Данные никогда не покидают руки вашего клиента, функция никогда не зависит от чужого облака, а то, что никогда не было загружено, невозможно получить принудительно.»
— Desert Ant Labs, в посте о запуске