llama.cpp представил сайт llama.app для локального запуска ИИ
llama.app, новая витрина для llama.cpp, open-source движка для запуска ИИ-моделей на собственном железе пользователя. Сайт подаёт проект как способ работать с топовыми нейросетями полностью локально: без ключей API, без телеметрии и без ограничений, все модели и переписка остаются на компьютере владельца.
Установка запускается одной командой через curl-скрипт (curl -LsSf https://llama.app/install.sh | sh). После этого через команду llama serve поднимается локальный сервер модели. Сайт также показывает связку с локальным ИИ-агентом Pi: пользователь ставит плагин pi-llama и запускает Pi, тот сам находит запущенную модель без дополнительной настройки, а запросы не покидают машину.
Отдельно заявлена работа на любом железе: от ноутбука до кластера используется один и тот же бинарник, одни и те же модели и одинаковые «вручную настроенные» ядра для любых GPU и CPU.
Сайт перечисляет четыре модели, доступные через llama.cpp:
- Qwen 3.6, от Alibaba, названы моделями следующего поколения с изначальной мультимодальностью и рассуждением; сайт заявляет, что плотные и MoE-варианты соперничают с моделями, в разы превосходящими их по размеру, в задачах кодинга и работы с изображениями.
- Gemma 4, от Google, описана как самая мощная из открытых моделей компании, построена на технологиях Gemini 3; заявлена поддержка мультимодального рассуждения, агентных сценариев работы и более 140 языков.
- GPT-OSS, от OpenAI, первые открытые по весам модели компании со времён GPT-2; ориентированы на рассуждение, агентные задачи и разработку, с поддержкой вызова функций и инструментов.
- Gemma 3, от Google, мультимодальная модель на технологиях Gemini, поддерживает более 140 языков, работу с изображениями и текстом, контекст до 128 тысяч токенов, от периферийных устройств до облака.
Ключевые факты
- У llama.cpp появился отдельный сайт llama.app, который подаёт проект как способ запускать ИИ полностью локально: без ключей API, без телеметрии, без ограничений.
- Установка, одна команда curl-скрипта; модели и данные пользователя не покидают его машину.
- Плагин pi-llama связывает llama.cpp с локальным кодинг-агентом Pi: тот сам находит запущенную модель без ручной настройки.
- Заявлена работа одним и тем же бинарником и одинаковыми «вручную настроенными» ядрами, от ноутбука до кластера, на любых GPU и CPU.
- Сайт перечисляет четыре модели: Qwen 3.6 (Alibaba), Gemma 4 и Gemma 3 (Google, на технологиях Gemini), GPT-OSS (OpenAI, первые открытые веса со времён GPT-2).
Почему это важно
llama.cpp, давно устоявшийся инструмент для запуска больших языковых моделей на обычном железе без облака. Новый сайт llama.app не меняет технологию, но упаковывает её как единую точку входа: установка одной командой, готовая связка с агентом Pi через плагин pi-llama и витрина открытых моделей крупных лабораторий, Alibaba, Google и OpenAI, под одной крышей.
Кому это важно
Разработчикам, которые хотят гонять ИИ-модели и кодинг-агентов на своём железе без ключей API и без передачи запросов и данных наружу, а также тем, кто выбирает открытую модель под конкретную задачу, от текста и кода до изображений.
Как это применить
Поставить llama.cpp через curl-скрипт с сайта, поднять модель командой llama serve, при желании добавить локальный кодинг-агент, установить плагин pi-llama и запустить Pi, который сам обнаружит запущенную модель. Дальше, выбрать одну из перечисленных моделей (Qwen 3.6, Gemma 4, GPT-OSS, Gemma 3) под своё железо и задачу.
Можно ли доверять
Текст, это рекламная страница самого проекта, а не независимый обзор: заявления вроде «соперничают с моделями, в разы превосходящими их по размеру» на странице не подкреплены конкретными цифрами или сравнительными тестами. Автор или сопровождающая организация самого сайта llama.app на странице не указаны.
Риски и подводные камни
На странице нет данных о минимальных требованиях к железу для запуска перечисленных моделей, нет сведений о лицензионных условиях (кроме общей формулировки «open-source») и нет истории версий или дат релиза ни для самого сайта, ни для моделей, сравнить актуальность заявленного с реальным положением дел по одному только тексту нельзя.
«Никаких ключей API, никакой телеметрии, никаких ограничений.»
— сайт llama.app