Kog нацелился ускорить инференс больших моделей на обычных GPU

Kog нацелился ускорить инференс больших моделей на обычных GPU

Французский стартап Kog разрабатывает программную оптимизацию, которая должна выжимать из обычных дата-центровых GPU (AMD MI300X, Nvidia H200) намного больше скорости инференса, чем считалось возможным, без замены железа. В мае Kog вышел на первую страницу Hacker News с техническим превью, доказывавшим, что «экстремально быстрое декодирование одиночных запросов возможно на стандартных GPU дата-центров, которые уже есть у компаний». В демонстрации использовалась специально построенная небольшая модель на 2 млрд параметров, теперь открытая под названием Laneformer 2B, и она показала 3000 токенов в секунду на один запрос. Итоговая цель Kog амбициознее: 30-кратное ускорение инференса именно для больших языковых моделей (LLM), а не только для компактных демо-моделей.

По словам CEO и единственного основателя Kog Гаэля Делалло, превью привлекло «200 конкретных лидов от бизнеса». Изучив спрос, компания поняла, что потенциальные клиенты не готовы дообучать (fine-tune) маленькие модели, и с момента запуска Kog сосредоточилась на ускорении именно крупных моделей. Первый ожидаемый сценарий использования, разработка софта: пользователи Claude Code и похожих инструментов регулярно ждут результата часами, а Anthropic уже берёт с клиентов надбавку за более быстрый режим Fast Mode. Помимо разработчиков, у Kog есть партнёры, которые дают пользователям генерировать игры и приложения по промпту через движок Kog Inference Engine (KIE); для них ускорение напрямую означает больше выручки.

Подход Kog Делалло сравнивает с лабораторией Hazy Research Стэнфордского университета, с ещё более глубоким погружением в аппаратный уровень GPU, чем у другого французского стартапа ZML, который обходит CUDA Nvidia ради переносимости между чипами. Делалло, не исследователь по образованию: он изучал физику твёрдого тела в Политехнической школе Франции (École Polytechnique), после чего занимался наступательной кибербезопасностью (white hat hacking) и четырежды доходил до финала турнира CTF на DEFCON. По его словам, именно этот опыт реверс-инжиниринга «вплоть до ассемблера и бинарного кода» научил его использовать технику для целей, для которых она изначально не предназначалась, и теперь он прививает такой же подход команде из 11 человек.

Оборотная сторона метода, трудоёмкость: «для каждого нового GPU мы тратим несколько недель, а то и месяцев, чтобы по-настоящему разобраться в деталях и провести инженерное исследование именно этого железа», говорит Делалло. С командой из 11 человек это ограничивает число чипов, с которыми Kog способен работать в обозримом будущем. В перспективе компания надеется превратить методологию в агентные пайплайны, которые позволят охватить больше чипов и моделей, что вписывается и в стремление Европы к технологическому суверенитету: Kog уже поддерживает облачный провайдер Scaleway и получает финансирование от французского государственного фонда Bpifrance и программы French Tech 2030.

Первый институциональный раунд Kog, seed, соинвестировала фирма Varsity VC, которую возглавляет Камель Зеруаль, бывший сооснователь Делалло по его первому стартапу Stribe (участнику TechCrunch50 2009); сумма раунда не раскрывается. Ключевая веха впереди, сентябрь: «как только мы реализуем наш первый большой модель с десятикратным ускорением, что, думаю, случится в сентябре, мы сможем продемонстрировать интерес клиентов и после этого поднять раунд Series A», сказал Делалло.

Ключевые факты

  • Kog, французский стартап-одиночка (CEO Гаэль Делалло, команда 11 человек), ускоряющий инференс на обычных GPU программными методами, без замены железа.
  • Майское демо на HN показало 3000 токенов/с на запрос, но на специально построенной модели Laneformer 2B всего на 2 млрд параметров; цель, 30-кратное ускорение уже для больших LLM.
  • После демо Kog получила 200 деловых лидов; клиенты не готовы дообучать маленькие модели, поэтому компания сфокусировалась на ускорении крупных.
  • Первая цель на пути к масштабу, 10-кратное ускорение на одной крупной модели уже в сентябре; это должно стать основанием для раунда Series A.
  • Seed-раунд соинвестировала Varsity VC Камеля Зеруаля; сумма не раскрыта. Kog также поддерживают Scaleway, Bpifrance и French Tech 2030.

Почему это важно

Скорость и цена инференса стали узким местом всей индустрии ИИ, и рынок реагирует по-разному: производитель специализированных чипов Cerebras в мае тепло встретили на IPO, а Kog делает ставку на обратное, что обычного GPU, который уже стоит в дата-центре, достаточно, если довести программную оптимизацию до предела. Основатель Гаэль Делалло настаивает, что тезис «GPU плохо подходят для декодирования», заблуждение: у новых GPU растёт пропускная способность памяти, которую просто пока никто до конца не использует.

Кому это важно

В первую очередь, разработчикам, использующим инструменты вроде Claude Code, где на результат порой уходят часы, и провайдерам, которые уже берут надбавку за скорость (Fast Mode у Anthropic). Также, партнёрам Kog, дающим пользователям генерировать игры и приложения по промпту через Kog Inference Engine (KIE): для них более быстрый инференс напрямую конвертируется в выручку. Шире, операторам GPU-инфраструктуры на AMD и Nvidia и европейским игрокам, для которых софт над чужим железом, путь к технологическому суверенитету без строительства собственных чипов.

Как это применить

Практического продукта для широкого рынка пока нет: сегодняшний результат Kog доказан только на компактной модели Laneformer 2B (2 млрд параметров, открыта под открытой лицензией), а не на крупных LLM, о которых компания и говорит с клиентами. Следить стоит за конкретной вехой, реализацией первой крупной модели с десятикратным ускорением, которую Делалло обещает в сентябре; только после неё имеет смысл оценивать применимость к реальным нагрузкам.

Можно ли доверять

Материал построен на прямом интервью TechCrunch с CEO Kog, а майское демо было публичным техническим превью, попавшим на первую страницу Hacker News, то есть проверяемым сообществом фактом. При этом заявленные 30-кратное и 10-кратное ускорения для больших моделей, это ещё не достигнутый результат, а цель и обещание самого основателя; источник прямо формулирует их как то, что предстоит доказать, а не как свершившийся факт.

Риски и подводные камни

Метод Kog нарочито ручной и медленный на масштабирование: по словам Делалло, на каждый новый тип GPU уходит по несколько недель или месяцев инженерной работы, а команда, всего 11 человек, что ограничивает число чипов, которые компания вообще способна охватить. Компания пока не раскрывает ни сумму seed-раунда, ни то, кто именно из клиентов и партнёров стоит за 200 лидами и партнёрствами по генерации игр и приложений. Вся стратегия сбора Series A завязана на одной будущей вехе, сентябрьской демонстрации 10-кратного ускорения на крупной модели, которая на момент публикации ещё не наступила.

«Как только мы реализуем нашу первую крупную модель с десятикратным ускорением, что, думаю, случится в сентябре, мы сможем продемонстрировать интерес клиентов и после этого поднять раунд Series A»

— Гаэль Делалло, CEO и основатель Kog