Ollaya: локальный аналог Ollama для моделей принятия решений
Ollaya, открытый локальный рантайм для запуска так называемых decision models («моделей принятия решений»): вместо генерации текста токен за токеном такая модель отвечает на типизированный вопрос по тексту или JSON за один проход вперёд (forward pass) и выдаёт калиброванный ответ с вероятностями за один шаг.
Главная особенность, совместимость «из коробки» с API коммерческого облачного сервиса TypeSafe Jev: Ollaya реализует те же эндпоинты /v1/systemone и /v1/models, и официальный Python SDK TypeSafe версии 0.7.1 работает без изменений, если просто подставить адрес локального сервера вместо облачного. По заявлению разработчиков, запрос из пяти вопросов к модели laya на собственной видеокарте RTX 4090 обрабатывается локально за 8, 10 мс, тогда как медианное время ответа хостингового API TypeSafe Jev составляет 236, 276 мс.
Ollaya умеет скачивать («pull», по аналогии с Ollama) готовые открытые модели разных авторов: laya от Convai Innovations (322m и 421m параметров, поддержка английского и более 100 языков), decider, модели-декодеры на базе Qwen3.5 от Mapika (decider:2b набирает 0,591 балла на типизированных решениях), nli, классификаторы zero-shot от Moritz Laurer, gliclass, классификатор от Knowledgator, qwen3guard, модель безопасности от команды Qwen, decision, модели от контрибьюторов vLLM Semantic Router (дообученный Qwen3.5 с дополнительной «головой», работает со строками до 16k токенов), kev, модели с LoRA-адаптером на базе Qwen3.5 от Jared Palmer, и von, модель на архитектуре ModernBERT-large от Victor Hugo Panisa, читающая контекст до 8192 токенов.
Весь стек позиционируется как приватный и локальный: сервер по умолчанию слушает только 127.0.0.1, веса моделей берутся напрямую из репозиториев их авторов на Hugging Face, привязаны к конкретному коммиту и проверяются по sha256, сама Ollaya веса не перевыкладывает. Рантайм распространяется под лицензией Apache-2.0, платы за токены нет, ограничение только в производительности собственного железа. Работать можно на CPU или NVIDIA GPU (нужен драйвер не старее R580, CUDA-библиотеки скрипты установки подтягивают только при обнаружении видеокарты); на Mac через MLX на Apple GPU ускоряются только модели laya и nli, остальные модели, видеокарты AMD/Intel и десктоп-приложения для Windows и Linux работают на CPU. Есть десктоп-приложения для macOS, Windows и Linux, консольная утилита и Docker-образ; запуск сводится к одной команде вида ollaya run laya.
Ключевые факты
- Ollaya, открытый локальный сервер для decision models: ответ выдаётся за один forward pass без пошаговой генерации токенов
- API полностью совместим с облачным TypeSafe Jev, официальный SDK 0.7.1 работает без изменений при переключении на localhost
- На RTX 4090 запрос из 5 вопросов обрабатывается за 8, 10 мс против 236, 276 мс медианного времени у хостингового API TypeSafe Jev
- Доступны открытые модели разных авторов: laya, decider (0,591 балла у decider:2b), nli, gliclass, qwen3guard, decision, kev и von (контекст до 8192 токенов)
- Веса проверяются по sha256 и берутся напрямую с Hugging Face, рантайм, Apache-2.0, платы за токены нет; для GPU-ускорения на NVIDIA нужен драйвер R580+, на Mac через MLX ускоряются только laya и nli
Почему это важно
Ollaya закрывает нишу, аналогичную появлению Ollama для больших языковых моделей, но для другого класса задач, типизированных решений (классификация намерения, модерация текста, выбор варианта из списка), которые сейчас часто решают через облачные API вроде TypeSafe Jev. Идея в том, что для такого рода коротких структурированных ответов не нужна полноценная генерация текста: один forward pass даёт калиброванный ответ быстрее и без платы за токены.
Кому это важно
Разработчикам, которые уже используют или рассматривают TypeSafe Jev для задач вроде определения намерения пользователя, модерации контента или скоринга ответов, и хотят перенести эту нагрузку на собственное железо ради задержки, приватности данных (тикеты, письма, сообщения пользователей) или отказа от платы за токены.
Как это применить
Достаточно одной команды вида ollaya run laya, чтобы поднять локальный сервер (по умолчанию порт 11435, слушает только 127.0.0.1). Существующий код на официальном TypeSafe SDK 0.7.1 переключается на него простой заменой переменных окружения (адрес сервера, произвольный API-ключ, имя модели) без изменения самого кода. Есть десктоп-приложения для macOS, Windows и Linux, консольная утилита и Docker-образ для серверов; для ускорения на NVIDIA нужен драйвер не старее R580, на Mac через MLX ускоряются только модели laya и nli, остальное считается на CPU.
Можно ли доверять
Материал взят с официального сайта самого продукта, поэтому все цифры, задержка 8, 10 мс, точность decider:2b в 0,591 балла, сравнение с латентностью TypeSafe Jev, это собственные заявления и бенчмарки разработчиков без независимой проверки или описания методологии измерений. При этом сам список открытых моделей и их авторов указан конкретно и проверяем через Hugging Face. Кто именно стоит за самим проектом Ollaya, на сайте не сказано, названы только авторы отдельных подключаемых моделей.
Риски и подводные камни
Заявленные цифры производительности и точности, внутренние измерения авторов без описанной методологии и независимого сравнения, к ним стоит относиться с поправкой на маркетинговый характер источника. Поддержка GPU-ускорения ограничена: на NVIDIA нужен относительно свежий драйвер (R580+), видеокарты AMD и Intel не задействуются вовсе, а на Mac через Apple GPU ускоряются только две модели из восьми, остальные, включая десктоп-приложения для Windows и Linux, считаются на CPU.