OpenAI выпустила GPT-6.1 Sol: почти уровень Astra за пятую часть цены

OpenAI выпустила GPT-6.1 Sol: почти уровень Astra за пятую часть цены

OpenAI (анонс опубликован на openai.com) представила GPT-6.1 Sol, обновление GPT-6 Sol. По утверждению компании, модель почти сравнивается с GPT-6 Astra по интеллекту в агентном программировании, работе с компьютерными приложениями и профессиональных задачах, а стандартные цены за входные и выходные токены составляют одну пятую от цен Astra. Цена кешированного входа, $0,10 за миллион токенов: это на 95% ниже стандартной цены входа и на 50% ниже, чем у GPT-6 Sol.

В анонсе приведены результаты на нескольких тестах. На DeepSWE v1.1 (сложные инженерные задачи в реальных кодовых базах) GPT-6.1 Sol, как сказано, соответствует GPT-6 Astra примерно при одной пятой стоимости и превосходит лучший результат GPT-6 Sol на 6,4 процентного пункта при меньших усилиях рассуждения и меньшей стоимости. На GDP.pdf (ответы на профессиональные вопросы по сложным PDF-документам с таблицами, диаграммами и мелким шрифтом) модель набирает больше, чем Opus 5.5 с fallback-механизмами, при стоимости задачи менее половины от него на всех проверенных настройках рассуждения; к результату Astra приближается примерно при одной пятой стоимости задачи.

На AutomationBench (корректное выполнение агентами многошаговых бизнес-процессов) GPT-6.1 Sol на 2,2 п. п. выше Opus 5.5 при среднем уровне рассуждения и примерно при трети стоимости; относительно GPT-6 Sol на той же настройке рост составляет 4,8 п. п. На offline-наборе OSWorld 2.0 (сложные сценарии работы с компьютером) модель обходит GPT-6 Sol на семь п. п. при максимальном уровне рассуждения и менее чем вдвое меньшей стоимости, а от результата Astra отстаёт на 2,1 п. п. при примерно одной седьмой стоимости задачи.

На Terminal-Bench Science 0.1 (научные рабочие процессы: анализ данных, симуляции, доказательство теорем) GPT-6.1 Sol более чем вдвое превосходит балл GPT-6 Sol при максимальном уровне рассуждения и менее чем вдвое меньшей стоимости задачи. Средняя стоимость задачи, $5,47 против $23,21 у Opus 5.5 и $23,80 у Astra, то есть более чем на 75% дешевле любой из этих моделей. Однако GPT-6 Astra по-прежнему показывает наивысший результат среди протестированных моделей, 68,1%, и, как сказано в анонсе, должна применяться для самых сложных научных исследовательских задач.

По фактической точности на сложных запросах: при низком уровне рассуждения доля ответов с фактической ошибкой снизилась с 11,4% у GPT-6 Sol до 7,7% у GPT-6.1 Sol (снижение примерно на 32%). На проверенных настройках доля ошибок не более чем на 1,9 п. п. отличается от показателя Astra, при стоимости задачи менее пятой части. Оценка проводилась на обезличенных диалогах, где пользователи отметили ошибку прежней модели; компания оговаривает, что такие намеренно трудные запросы не показательны для обычного использования.

В оценках согласованности поведения (alignment) модель, по словам компании, заметно улучшилась относительно GPT-6 Sol и приблизилась к Astra: чаще честно сообщает о своих ограничениях, надёжнее соблюдает намерения пользователя и ограничения безопасности. Ниже доля сбоев по сравнению с GPT-6 Sol в честности при неработающих поисковых инструментах, соблюдении явных запретов и недопущении несанкционированных результатов в агентных задачах. Попыток обойти автоматического проверяющего по безопасности не замечено, как и у Astra и GPT-6 Sol. Подробности вынесены в дополнение к системной карточке.

Доступность: с момента анонса модель открыта всем пользователям Plus, Pro, Business, Enterprise и Edu в ChatGPT Work и Codex; в обычном Chat её пока нет. Разработчикам она доступна через API под именем gpt-6.1-sol по цене $2 за миллион входных токенов, $0,10 за миллион кешированных входных и $10 за миллион выходных. В ближайшие дни компания также обещает GPT-6.1 Sol Ultrafast, до 8 раз быстрее генерации токенов по сравнению со стандартной скоростью в Codex.

Ключевые факты

  • GPT-6.1 Sol, обновление GPT-6 Sol: по заявлению компании, почти на уровне GPT-6 Astra в агентном кодинге, работе с компьютером и профессиональных задачах при цене токенов в пять раз ниже.
  • API-цены gpt-6.1-sol: $2 за млн входных токенов, $0,10 за млн кешированных входных, $10 за млн выходных.
  • На Terminal-Bench Science 0.1 задача стоит в среднем $5,47 против $23,21 у Opus 5.5 и $23,80 у Astra, но Astra остаётся лидером по баллу (68,1%).
  • Доля ответов с фактической ошибкой на сложных запросах при низком уровне рассуждения снизилась с 11,4% до 7,7% (примерно на 32%).
  • Доступна в ChatGPT Work и Codex для платных тарифов и через API; в Chat пока нет; версия Ultrafast (до 8 раз быстрее в Codex) обещана в ближайшие дни.

Почему это важно

OpenAI позиционирует GPT-6.1 Sol как новый баланс возможностей и стоимости: результаты близки к старшей GPT-6 Astra, а токены стоят в пять раз дешевле. Особенно заметно это в агентных сценариях, где контекст многократно переиспользуется: кешированный вход подешевел на 50% относительно GPT-6 Sol. На ряде тестов модель, по данным анонса, опережает и Opus 5.5 при заметно меньшей стоимости задачи.

Кому это важно

Разработчикам и командам, которые строят или запускают агентов для программирования, работы с документами, бизнес-процессов и управления компьютерными приложениями, для них главный аргумент в снижении стоимости. Также пользователям тарифов Plus, Pro, Business, Enterprise и Edu, у которых модель доступна в ChatGPT Work и Codex.

Как это применить

Через API модель вызывается как gpt-6.1-sol; стандартные цены: $2 за миллион входных токенов, $0,10 за миллион кешированных входных, $10 за миллион выходных. В продуктах OpenAI она открыта в ChatGPT Work и Codex для платных тарифов; в Chat пока недоступна. Версия GPT-6.1 Sol Ultrafast с ускорением генерации до 8 раз в Codex обещана в ближайшие дни. Для самых сложных научных исследовательских задач анонс рекомендует GPT-6 Astra.

Можно ли доверять

Материал, официальный анонс самого разработчика, и все результаты, его собственные измерения. Оценки моделей OpenAI проводились в исследовательской среде или через API и могут немного отличаться от рабочего ChatGPT из-за системных подсказок, инструментов и настроек. Результаты конкурентов взяты из публичных отчётов. Независимая проверка в анонсе не упоминается. Многие результаты даны как разница в процентных пунктах или соотношение стоимости, а не как абсолютные баллы.

Риски и подводные камни

Формулировки анонса осторожнее заголовка: модель «почти» соответствует Astra, а на части тестов лишь «приближается» к нему; на Terminal-Bench Science 0.1 Astra остаётся лучшей. Оценка фактической точности использует намеренно трудные запросы, не показательные для обычного использования, а оценки alignment проверяют сложные ситуации и не измеряют частоту сбоев в типичной работе. Ultrafast пока только обещан, а в обычном Chat GPT-6.1 Sol ещё нет.

«GPT‑6.1 Sol предлагает новый баланс возможностей и стоимости для важной повседневной работы.»

— Из анонса GPT‑6.1 Sol на openai.com