llama.cpp представил сайт llama.app для локального запуска ИИ

llama.app, новая витрина для llama.cpp, open-source движка для запуска ИИ-моделей на собственном железе пользователя. Сайт подаёт проект как способ работать с топовыми нейросетями полностью локально: без ключей API, без телеметрии и без ограничений, все модели и переписка остаются на компьютере владельца.

Установка запускается одной командой через curl-скрипт (curl -LsSf https://llama.app/install.sh | sh). После этого через команду llama serve поднимается локальный сервер модели. Сайт также показывает связку с локальным ИИ-агентом Pi: пользователь ставит плагин pi-llama и запускает Pi, тот сам находит запущенную модель без дополнительной настройки, а запросы не покидают машину.

Отдельно заявлена работа на любом железе: от ноутбука до кластера используется один и тот же бинарник, одни и те же модели и одинаковые «вручную настроенные» ядра для любых GPU и CPU.

Сайт перечисляет четыре модели, доступные через llama.cpp:

  • Qwen 3.6, от Alibaba, названы моделями следующего поколения с изначальной мультимодальностью и рассуждением; сайт заявляет, что плотные и MoE-варианты соперничают с моделями, в разы превосходящими их по размеру, в задачах кодинга и работы с изображениями.
  • Gemma 4, от Google, описана как самая мощная из открытых моделей компании, построена на технологиях Gemini 3; заявлена поддержка мультимодального рассуждения, агентных сценариев работы и более 140 языков.
  • GPT-OSS, от OpenAI, первые открытые по весам модели компании со времён GPT-2; ориентированы на рассуждение, агентные задачи и разработку, с поддержкой вызова функций и инструментов.
  • Gemma 3, от Google, мультимодальная модель на технологиях Gemini, поддерживает более 140 языков, работу с изображениями и текстом, контекст до 128 тысяч токенов, от периферийных устройств до облака.

Ключевые факты

  • У llama.cpp появился отдельный сайт llama.app, который подаёт проект как способ запускать ИИ полностью локально: без ключей API, без телеметрии, без ограничений.
  • Установка, одна команда curl-скрипта; модели и данные пользователя не покидают его машину.
  • Плагин pi-llama связывает llama.cpp с локальным кодинг-агентом Pi: тот сам находит запущенную модель без ручной настройки.
  • Заявлена работа одним и тем же бинарником и одинаковыми «вручную настроенными» ядрами, от ноутбука до кластера, на любых GPU и CPU.
  • Сайт перечисляет четыре модели: Qwen 3.6 (Alibaba), Gemma 4 и Gemma 3 (Google, на технологиях Gemini), GPT-OSS (OpenAI, первые открытые веса со времён GPT-2).

Почему это важно

llama.cpp, давно устоявшийся инструмент для запуска больших языковых моделей на обычном железе без облака. Новый сайт llama.app не меняет технологию, но упаковывает её как единую точку входа: установка одной командой, готовая связка с агентом Pi через плагин pi-llama и витрина открытых моделей крупных лабораторий, Alibaba, Google и OpenAI, под одной крышей.

Кому это важно

Разработчикам, которые хотят гонять ИИ-модели и кодинг-агентов на своём железе без ключей API и без передачи запросов и данных наружу, а также тем, кто выбирает открытую модель под конкретную задачу, от текста и кода до изображений.

Как это применить

Поставить llama.cpp через curl-скрипт с сайта, поднять модель командой llama serve, при желании добавить локальный кодинг-агент, установить плагин pi-llama и запустить Pi, который сам обнаружит запущенную модель. Дальше, выбрать одну из перечисленных моделей (Qwen 3.6, Gemma 4, GPT-OSS, Gemma 3) под своё железо и задачу.

Можно ли доверять

Текст, это рекламная страница самого проекта, а не независимый обзор: заявления вроде «соперничают с моделями, в разы превосходящими их по размеру» на странице не подкреплены конкретными цифрами или сравнительными тестами. Автор или сопровождающая организация самого сайта llama.app на странице не указаны.

Риски и подводные камни

На странице нет данных о минимальных требованиях к железу для запуска перечисленных моделей, нет сведений о лицензионных условиях (кроме общей формулировки «open-source») и нет истории версий или дат релиза ни для самого сайта, ни для моделей, сравнить актуальность заявленного с реальным положением дел по одному только тексту нельзя.

«Никаких ключей API, никакой телеметрии, никаких ограничений.»

— сайт llama.app