xAI выпустила Grok 4.6: сравнялась с GPT-5.6 Sol по интеллекту

xAI выпустила Grok 4.6: сравнялась с GPT-5.6 Sol по интеллекту

xAI выпустила модель Grok 4.6, построенную на базе Grok 4.5. Главный акцент разработчики сделали на длинных агентных задачах и более амбициозной визуальной и интерактивной работе: модель должна дольше удерживать контекст сложной многошаговой задачи, будь то исследование темы, анализ информации, работа с кодовой базой целиком или превращение идеи в готовое приложение.

По утверждению xAI, Grok 4.6 показывает интеллект уровня фронтира на нескольких бенчмарках, связанных с агентным кодингом и интеллектуальной работой, и сравнялась с GPT-5.6 Sol на Artificial Analysis Intelligence Index, композитном индексе, который считается по девяти бенчмаркам. Конкретные баллы обеих моделей и состав этих девяти тестов в источнике не раскрываются.

По описанию xAI, модель прошла более длительный дополнительный этап обучения, чем Grok 4.5, с использованием отобранных данных, сгенерированных моделями, для рассуждений и продвинутых технических концепций, а также качественных инженерных данных, улучшенного оптимизатора и рецепта обучения. На следующем этапе Grok 4.5 использовался для регенерации SFT-траекторий по разным уровням рассуждений, агентным окружениям и доменам, STEM, разработка ПО, интеллектуальная работа, с отфильтровыванием проблемных примеров автоматическими проверками. Далее модель обучали на широком наборе агентных задач с подкреплением, включая специализированные окружения, оптимизацию под конкретное железо (kernel optimization), веб-разработку, автоматизированное проектирование (CAD) и другие.

При тестировании на проектах, рассчитанных на многошаговую работу, по словам xAI, модель особенно хорошо превращает общую идею продукта в рабочую первую версию: исследует незнакомую предметную область, выстраивает структуру приложения, реализует основные взаимодействия и дорабатывает результат по итогам нескольких раундов обратной связи. На длинных траекториях команда также стала замечать больше самопроверки, модель чаще проверяет собственную работу перед тем, как двигаться дальше. По визуальным и интерактивным проектам первые версии, по утверждению xAI, получаются заметно сильнее, чем у Grok 4.5: модель способна с одного захода задать структуру и визуальный язык приложения.

xAI также сообщает об улучшении и калибровке защитных механизмов модели под её возросшие возможности, с расширенным набором предразвёртывающего тестирования и дополнительными проверками после выпуска, включая тестирование независимыми сторонами.

Grok 4.6 доступна уже сегодня в Cursor, Grok Build, через API, а также у партнёров OpenRouter, Vercel и Cloudflare. Цена через API начинается от $2 за миллион входных токенов и $6 за миллион выходных; есть более быстрый вариант модели, который стоит вдвое дороже. Первую неделю xAI даёт двойной лимит включённого использования в Grok Build и Cursor, чтобы пользователи могли опробовать 4.6.

Ключевые факты

  • xAI выпустила Grok 4.6, модель на базе Grok 4.5, заточенную под длинные агентные задачи и визуальную/интерактивную работу
  • По Artificial Analysis Intelligence Index (композит из девяти бенчмарков) Grok 4.6 сравнялась с GPT-5.6 Sol; конкретные баллы не раскрыты
  • Модель училась дольше, чем Grok 4.5, на курируемых сгенерированных данных для рассуждений и инженерных задач, плюс SFT-траектории, регенерированные Grok 4.5
  • Доступна сегодня в Cursor, Grok Build, через API и у партнёров OpenRouter, Vercel, Cloudflare
  • Цена API: $2 за млн входных токенов и $6 за млн выходных; быстрый вариант, вдвое дороже; первую неделю в Grok Build и Cursor дают двойной лимит использования

Почему это важно

Grok 4.6, очередной шаг xAI в гонке моделей, ориентированных не на разовый ответ, а на долгую самостоятельную работу над задачей: код, исследование, сборка приложения от идеи до рабочей версии. По собственному заявлению компании, модель по интегральному индексу интеллекта поравнялась с GPT-5.6 Sol, то есть xAI позиционирует Grok как одну из моделей уровня фронтира, а не догоняющую.

Кому это важно

В первую очередь разработчикам и командам, которые уже используют агентные инструменты для кодинга и сборки приложений, модель сразу доступна в Cursor и в собственном инструменте xAI Grok Build. Также интересна тем, кто оценивает API по цене и планирует long-running агентные сценарии, исследование, анализ, многошаговую разработку.

Как это применить

Grok 4.6 доступна через API у самой xAI и у партнёров OpenRouter, Vercel и Cloudflare, а также встроена в Cursor и Grok Build. Цена, $2 за миллион входных и $6 за миллион выходных токенов, у более быстрого варианта, вдвое дороже. Первую неделю после релиза в Cursor и Grok Build действует удвоенный лимит включённого использования, что позволяет опробовать модель без дополнительных затрат.

Можно ли доверять

Все данные в источнике, из официального анонса xAI, без независимого подтверждения: сравнение с GPT-5.6 Sol сделано по внешнему бенчмарку (Artificial Analysis Intelligence Index), но сами баллы и состав девяти тестов в тексте не приводятся, а детали обучения приведены в общих словах, без цифр по длительности или объёму данных.

Риски и подводные камни

Компания говорит об улучшенных защитных механизмах и расширенном тестировании перед выпуском, но конкретики о характере рисков или результатах этого тестирования в анонсе нет. Заявления о превосходстве над предыдущей версией и паритете с конкурентом сделаны самой xAI и пока не подкреплены независимыми бенчмарками или практическими отзывами пользователей.