Inception Labs выпустила Mercury 2.5, на 40% умнее предыдущей версии

Inception Labs выпустила Mercury 2.5, на 40% умнее предыдущей версии

Inception Labs выпустила Mercury 2.5, самую мощную из своих продакшен-моделей на сегодня. Это диффузионная языковая модель (dLLM): в отличие от обычных LLM вроде GPT, она генерирует текст не токен за токеном, а параллельно, что и даёт низкую задержку и низкую стоимость при той же архитектуре серверов. По заявлению компании, Mercury 2.5, самая мощная диффузионная LLM на рынке и, насколько известно самой Inception Labs, крупнейшая из когда-либо обученных диффузионных языковых моделей.

Качество выросло на 40% по сравнению с Mercury 2, по утверждению компании, это ставит новую модель в один ряд с недорогими флагманами конкурентов: GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Скорость генерации, 1107 токенов в секунду на широко доступных GPU NVIDIA, контекстное окно, 260 тысяч токенов. Стандартная цена, $0,20 за миллион входных токенов и $0,75 за миллион выходных; на старте действует скидка 80%, то есть $0,04 и $0,15 соответственно. Модель умеет настраивать глубину рассуждений, делать параллельные вызовы инструментов и отдавать JSON, строго соответствующий заданной схеме.

С момента выхода Mercury 2 её использовали тысячи разработчиков, десятки компаний довели интеграции до продакшена, а нагрузка выросла больше чем на порядок. Компания перечисляет три сценария применения. Поисковые ИИ-агенты и RAG-конвейеры: один поисковый запрос может порождать десятки вызовов модели, планирование, переформулировку запроса, переранжирование, структурирование фактов, суммаризацию источников и проверку ответа, и несколько крупных поисковых инфраструктурных компаний уже держат Mercury в проде именно для этого. Голосовые агенты: сервис OpenCall, который строит ИИ-агентов для телефонных звонков, перешёл на Mercury и сообщает, что медианная задержка ответа модели упала почти до 170 миллисекунд, задержка P99 сократилась с нескольких минут до одной секунды, а P50, с 0,4 секунды до менее 0,2 секунды. Кодовые агенты: компания Augment Code использует Mercury для сжатия контекста, маршрутизации между моделями и поиска инструментов по протоколу MCP, перенос сжатия контекста на Mercury сократил задержку на 82% (со 150 до 27 секунд) и снизил стоимость на 90% без потери качества, а сводки по поиску инструментов возвращаются меньше чем за секунду.

Вместе с Mercury 2.5 компания показала превью двух новых продуктов: Mercury Voice, диффузионную модель, оптимизированную под голосовых агентов с задержкой до первого токена (TTFT) менее 170 миллисекунд, и Mercury Router, модель, которая понимает входящий запрос и направляет его к лучшей из доступных моделей (открытых и закрытых) по сочетанию качества, скорости и цены.

Mercury 2.5 доступна через собственный API Inception, а также через Baseten и OpenRouter; для корпоративных клиентов предусмотрены выделенные мощности, автоскейлинг, контроль соответствия требованиям и настраиваемое хранение данных. Попробовать модель можно бесплатно, компания даёт 100 миллионов токенов, а компаниям из портфеля Y Combinator предлагает $500 000 в виде кредитов на развёртывание. Отдельно Inception Labs сообщает, что уже начала обучение следующей, ещё более крупной модели, и рассчитывает выпустить её в ближайшие месяцы.

Ключевые факты

  • Mercury 2.5, диффузионная языковая модель (dLLM) для продакшена, на 40% умнее Mercury 2; по заявлению компании, сопоставима по качеству с недорогими флагманами GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
  • Скорость, 1107 токенов в секунду на широко доступных GPU NVIDIA, контекстное окно, 260 тысяч токенов.
  • Цена, $0,20 за миллион входных токенов и $0,75 за миллион выходных; на старте действует скидка 80% ($0,04 и $0,15).
  • OpenCall, перейдя на Mercury, сократил P99-задержку голосовых ответов с нескольких минут до одной секунды; Augment Code ускорил сжатие контекста на 82% и снизил его стоимость на 90%.
  • Вместе с Mercury 2.5 представлены превью Mercury Voice (задержка первого токена до 170 мс) и Mercury Router, который распределяет запросы между открытыми и закрытыми моделями.

Почему это важно

Диффузионные языковые модели (dLLM), альтернатива обычным авторегрессионным LLM вроде GPT: они генерируют текст параллельно, а не токен за токеном, что и даёт выигрыш в скорости и стоимости. Mercury 2.5, по заявлению Inception Labs, самая мощная диффузионная LLM на рынке и, насколько известно самой компании, крупнейшая из когда-либо обученных диффузионных моделей, с приростом качества на 40% при сохранении скорости и цены Mercury 2. Это показывает, что архитектура на диффузии дошла до продакшен-уровня, а не осталась исследовательским прототипом.

Кому это важно

Разработчикам latency-чувствительных продуктов: поисковых ИИ-агентов и RAG-конвейеров, голосовых ассистентов, кодовых агентов и их вспомогательных подпроцессов, маршрутизации запросов, сжатия контекста, поиска инструментов, где счёт идёт на миллисекунды и каждый лишний вызов модели заметен конечному пользователю.

Как это применить

Mercury 2.5 доступна через API Inception, а также через Baseten и OpenRouter; для корпоративных клиентов есть выделенные мощности, автоскейлинг, контроль соответствия требованиям и настраиваемое хранение данных. Попробовать можно бесплатно, компания даёт 100 миллионов токенов на тесты, а компании из портфеля Y Combinator могут получить $500 000 в виде кредитов на развёртывание. Отдельно открыто превью Mercury Voice (для голосовых агентов, задержка первого токена до 170 мс) и Mercury Router, который сам выбирает модель под конкретный запрос.

Можно ли доверять

Цифры о качестве и скорости взяты из собственного анонса Inception Labs: методика замера 40%-го прироста интеллекта в тексте не раскрыта, как и параметры модели, которые подтвердили бы статус «крупнейшей диффузионной LLM». Обе цитаты в посте, от сотрудника NVIDIA, партнёра по инфраструктуре, и от клиента OpenCall, размещены в блоге самой компании, то есть это маркетинговый материал, а не независимый тест.

Риски и подводные камни

Скидка запуска 80% на цену дана без указания срока действия, сколько она продержится, не сказано. Компания не называет ни дату выхода следующей, ещё более крупной модели (обещаны лишь «ближайшие месяцы»), ни бенчмарки, на которых получен прирост в 40%, сравнить заявленное качество с независимыми тестами конкурентов пока не на чем.

«После того как мы перешли на Mercury, наше время отклика P99 упало с нескольких минут до одной секунды, а P50, с 0,4 секунды до менее 0,2 секунды, значительно быстрее, чем у любого другого провайдера, который мы видели, включая модели с рассуждениями.»

— Оливер Сильверстин, сооснователь и CEO OpenCall