Netlify запустила партнёрство с OpenRouter и сравнила модели по расходу кредитов

Netlify объявила о партнёрстве с OpenRouter. Через AI Gateway платформы теперь доступна вся линейка моделей OpenRouter, то есть если собственное веб-приложение пользователя использует ИИ-инференс для своих функций, выбор моделей под любую задачу и бюджет заметно расширился. Отдельно расширился и набор передовых моделей для написания кода, доступных через встроенный в Netlify чат-инструмент Agent Runners: туда добавили нашумевшие открытые модели, Kimi K3, GLM 5.2 и DeepSeek V4, доступные всем пользователям без ограничений. Agent Runners, по описанию Netlify, запускает внутри себя не урезанную версию, а полноценного агента, который сам пишет код; до этого обновления там работали Claude Agent, OpenAI Codex и Gemini CLI, каждый заточен под модели своего производителя. Чтобы эффективно управлять расширившимся набором моделей, Netlify добавила ещё одного агента, популярного OpenCode с открытым исходным кодом.
Вместе с партнёрством компания опубликовала сравнение того, как разные модели справляются с одинаковыми промптами при сборке сайта. Внутри Netlify для автоматической оценки моделей используют собственный инструмент AXIS (недавно выложен в открытый доступ): ему задают тестовые сценарии, построить сайт и затем доработать его, и набор проверок, по которым генерация оценивается. Проверки смотрят на корректность функциональности, а не на дизайн: например, использует ли сайт Netlify Database там, где это нужно, и не усложняет ли модель простой статический сайт там, где база данных не нужна. Если модель проваливает эти внутренние тесты, её не включают в Agent Runners; если модель регулярно ошибается в применении какого-то навыка (skill) или тратит на решение непропорционально много кредитов, проблема считается в самом навыке, и его дорабатывают.
Для более наглядного и, по признанию самой компании, куда более субъективного сравнения Netlify прогнала три сценария: одностраничный сайт для соседской кофейни (без базы данных, с доп.-промптом на бронирование столика), общий список задач на нескольких пользователей (нужна общая база данных, затем, загрузка фото к задаче) и сайт «что приготовить», сервис подбирает рецепт по введённым продуктам через AI Gateway. Разбираемый пост посвящён только первому сценарию, сайту кофейни; про два других обещаны отдельные посты. Сам промпт звучал так: «Сделай одностраничный сайт для соседской кофейни: часы работы, адрес, короткое меню и фото. Ничего на нём не меняется, если только я сам не отредактирую», последняя фраза была подсказкой модели, что полноценная CMS (система управления контентом) не нужна. У Agent Runners есть и встроенные дизайнерские рекомендации, в частности, как избежать типичных дизайн-ляпов вроде до оскомины знакомого шаблонного фиолетового стиля, который по умолчанию выдают многие модели.
Каждую модель прогнали по три раза с настройками по умолчанию и посчитали расход кредитов Netlify на каждый прогон.
Claude Opus 5: три прогона на один и тот же промпт стоили 1055, 253 и 249 кредитов. Самый дорогой прогон (1055 кредитов) обошёлся примерно в 4 раза дороже любого другого прогона во всём тесте, но и результат вышел самым детальным: анимируемый «печатный» элемент с кофейным зерном в центре, кастомная карта внизу страницы, тёмная тема работает из коробки. Автор поста отдельно отмечает: у Opus действительно есть склонность иногда срываться в чрезмерный расход кредитов относительно своей типичной базовой стоимости, чаще, чем у других моделей, хотя это не гарантирует ни худший, ни лучший результат.
Claude Sonnet 5: в среднем 143 кредита (81, 245 и 103 за три прогона). Детали в дизайне остаются, но их меньше, а векторная графика заметно проще, чем у Opus.
GPT 5.6 Sol: в среднем 141 кредит (173, 158, 92). Netlify по умолчанию запускает эту флагманскую модель OpenAI уровня Opus в облегчённом режиме (low effort), как более экономную альтернативу Opus, при этом уровень усилий можно настраивать вручную. По оценке автора, в базовом дизайнерском чутье эта модель в облегчённом режиме обходит модель Anthropic среднего уровня, Sonnet: контента больше, странных векторных форм нет, хотя изображения более шаблонные.
GPT 5.6 Terra: в среднем 39 кредитов (43, 23, 49). Terra на ступень ниже Sol в линейке OpenAI (порядок, Sol, затем Terra, затем Luna). Визуальный язык здесь другой, но не обязательно хуже; встречаются мелкие огрехи, пропавшая картинка в одном прогоне, низкий контраст текста поверх фото в другом.
Gemini 3.1 Pro: в среднем 53 кредита (без разбивки по отдельным прогонам). По словам автора, смотреть тут особо не на что: модель выполнила промпт буквально и ничего сверх этого.
Gemini 3.6 Flash: в среднем 103 кредита (109, 91, 111). Ощущается как модель другого, более нового поколения: результат приятнее и ближе к тому, что делают современные модели, но, по наблюдению автора, эта модель может повторяться в тексте даже больше остальных.
Kimi K3: в среднем 102 кредита (125, 95, 86). Модель позиционируется прежде всего как передовая для длинных агентных задач, это, по словам поста, подтверждают тесты и обзоры, и создавалась скорее как ответ модели Fable 5, чем Claude Opus 5. В этой узкой дизайнерской задаче она не блещет; для более сложного веб-приложения Netlify обещает отдельный пост с другими промптами.
Kimi K2.7 Code: в среднем всего 19 кредитов. Это заметный шаг назад в архитектуре относительно K3, и, несмотря на шумиху вокруг визуальных способностей линейки Kimi после релиза модели K2.6, здесь по части дизайна или содержания смотреть особо не на что.
GLM 5.2: в среднем 27 кредитов (15, 42, 24, именно в таком порядке слева направо). Три прогона получились на удивление разными, будто их делали разные модели; при такой низкой цене автор советует прогонять GLM 5.2 несколько раз перед тем, как остановиться на результате (и просит не обращать внимания на то, что GLM то и дело добавляет кленовые мотивы, судя по всему, это узнаваемая черта модели). В нынешней версии GLM 5.2, текстовая модель, не принимающая изображения на вход; на этом месте захваченный текст поста обрывается, не уточняя, чего именно модель из-за этого не может, как и данные по ещё не показанным моделям (включая DeepSeek V4, упомянутый выше только в контексте партнёрства) и итоговый вывод по сценарию.
Для ориентира по ценам: на бесплатном плане Netlify, 300 кредитов, на плане Personal, 1000 кредитов, на плане Pro, 3000 кредитов, а дополнительные пакеты кредитов для Pro стоят $10 за 1500 кредитов.
Отдельно стоит иметь в виду: заголовок исходного поста заявляет сравнение 11 моделей, но в захваченном тексте по имени и результатам для этого сценария разобраны девять; какие ещё модели в него входили и тестировали ли в этом сценарии, например, младшую модель линейки OpenAI, GPT 5.6 Luna, текст не сообщает.
Ключевые факты
- Netlify и OpenRouter объявили партнёрство: в AI Gateway доступна вся линейка моделей OpenRouter, а Agent Runners получил новые модели, Kimi K3, GLM 5.2 и DeepSeek V4; появился и новый открытый агент, OpenCode.
- Netlify прогнала промпт «сделай одностраничный сайт для кофейни» на девяти моделях, Claude Opus 5, Claude Sonnet 5, GPT 5.6 Sol, GPT 5.6 Terra, Gemini 3.1 Pro, Gemini 3.6 Flash, Kimi K3, Kimi K2.7 Code и GLM 5.2, каждую по три раза, и сравнила расход кредитов и качество результата.
- Один из трёх прогонов Claude Opus 5 стоил 1055 кредитов, примерно в 4 раза больше любого другого прогона во всём тесте, хотя итог получился визуально самым детальным (кастомная карта, анимируемый «печатный» элемент, тёмная тема из коробки).
- Дешевле всех обошлась Kimi K2.7 Code, в среднем 19 кредитов за прогон; у GLM 5.2 (27 кредитов в среднем) при этом три прогона дали заметно разные по качеству результаты при одинаковом промпте.
- На бесплатном плане Netlify, 300 кредитов, на Personal, 1000, на Pro, 3000; дополнительные пакеты кредитов для Pro стоят $10 за 1500 кредитов.
Почему это важно
Пост наглядно показывает то, что раньше было общими ощущениями сообщества, а теперь подкреплено цифрами: у ИИ-агентов для веб-разработки нет одной «лучшей» модели, цена и качество расходятся не только между разными моделями, но и между тремя прогонами одной и той же модели с одинаковым промптом. Самый яркий пример, Claude Opus 5: один из трёх прогонов этой модели на один и тот же промпт стоил 1055 кредитов, примерно в 4 раза больше любого другого прогона во всём тесте, хотя промпт был идентичным. Одновременно партнёрство с OpenRouter и появление сразу нескольких новых открытых моделей, Kimi K3, GLM 5.2, DeepSeek V4, в Agent Runners показывает, как быстро растёт число моделей, между которыми разработчику приходится выбирать: именно об этой «FOMO» (страхе упустить модель получше) пишет сам пост.
Кому это важно
В первую очередь, разработчикам и командам, которые строят продукты на Netlify и выбирают, каким агентом и какой моделью пользоваться внутри Agent Runners: от выбора зависит не только качество сайта, но и конкретный счёт в кредитах. Также, командам, которые через AI Gateway встраивают сторонние модели в собственные приложения и одним подключением получили доступ ко всей линейке OpenRouter. И тем, кто в принципе выбирает между дорогими флагманскими моделями (Claude Opus 5, GPT 5.6 Sol) и дешёвыми открытыми (Kimi K2.7 Code, GLM 5.2) для типовых, не самых сложных задач вроде посадочной страницы.
Как это применить
Для простого сайта без сложной логики, по данным поста, дешёвые модели вроде GPT 5.6 Terra (в среднем 39 кредитов) или GLM 5.2 (27) справляются на приемлемом уровне, но GLM 5.2 стоит прогонять несколько раз: три её прогона в тесте дали заметно разный по качеству результат при одном и том же промпте. Если нужен максимально детальный, «конкурсный» визуал, самый насыщенный результат в тесте дала модель Claude Opus 5, но в бюджет стоит закладывать не среднюю, а худшую цену: единичный прогон может стоить в разы дороже типичного. Уровень усилий (effort) для флагманских моделей вроде GPT 5.6 Sol, отдельный рычаг экономии, не завязанный на выбор самой модели; Netlify даёт им управлять вручную, хотя по умолчанию Sol запускается в облегчённом режиме.
Можно ли доверять
Это собственный блог Netlify, и материал одновременно продвигает бизнес-партнёрство компании с OpenRouter и её же продукт, Agent Runners и AI Gateway, то есть источник напрямую заинтересован в том, какие модели он показывает и в каком свете. Автоматические проверки функциональности опираются на внутренний инструмент AXIS, который Netlify недавно открыла, его логику в принципе можно проверить независимо. Но именно дизайнерское сравнение из этого поста сам автор называет «гораздо более субъективным тестом», чем внутренние тесты компании, всего по три прогона на модель, и прямо просит читателей поделиться своим мнением о результатах, то есть не выдаёт его за строгий статистический бенчмарк. Ни автор поста, ни его должность в тексте не названы. Наконец, захваченный текст обрывается посреди раздела о GLM 5.2, это не весь материал целиком: по словам поста, полный отчёт с результатами всех моделей опубликован на отдельном сайте.
Риски и подводные камни
Главный риск, непредсказуемость расходов: у Claude Opus 5 один прогон обошёлся примерно в 4 раза дороже любого другого прогона в тесте, а значит планирование бюджета по «средней» цене может сильно разойтись с реальным счётом на конкретном проекте. Дешёвая модель, не значит стабильная: GLM 5.2 при низкой цене (15, 42 кредита за прогон) выдавала заметно разные по качеству версии одного и того же сайта. Сам тест ограничен узкой и простой задачей, статичной одностраничной визиткой без сложной логики; автор прямо говорит, что результат ничего не говорит, например, о способности Claude Sonnet 5 писать сложный код, и обещает отдельные посты для более требовательных сценариев (общий список задач с базой данных, сервис подбора рецептов). И поскольку бенчмарк ведёт сама Netlify, компания, которая по итогам таких тестов решает, какие модели включать в свой продукт, стоит учитывать встроенный конфликт интересов в том, как выбираются и подаются результаты.
«У Opus действительно есть склонность иногда срываться в чрезмерный расход кредитов относительно своей типичной базовой стоимости, чаще, чем у других моделей. Гарантии, что результат будет хуже или лучше, это не даёт, но происходит довольно часто.»
— блог Netlify