Perplexity доверила GPT-6 Astra сквозные продакшн-системы

Perplexity доверила GPT-6 Astra сквозные продакшн-системы

OpenAI опубликовала на своём блоге историю клиента, сервиса Perplexity, ИИ-поисковика, который ищет ответы на вопросы пользователей и делает акцент на точности поиска и обработке больших объёмов информации. По словам Джонни Хо, сооснователя и директора по стратегии Perplexity, компания использует модель OpenAI GPT-6 Astra не только для работы с информацией, но и для операционных задач: модель пишет служебные коммуникации, вносит изменения в программное обеспечение и следит за продакшн-системами компании. Результаты работы модели Perplexity проверяет заметно реже, чем результаты предыдущих поколений моделей, точную частоту проверок «до» и «после» в материале не называют.

Хо отмечает: каждый раз, когда модель становится лучше в написании кода, вместе с ней подтягивается и сам поисковый продукт Perplexity, модель пишет более удачные программы, которые ищут информацию в интернете и во внутренних данных компании и лаконично её резюмируют.

Настоящей сложностью, по словам Хо, оказалась не работа с информацией сама по себе, а перенос этих возможностей на реальные системы, и именно это, по его словам, стало проще с GPT-6 Astra: «Мы можем поручить модели готовить коммуникации, вносить изменения в боевые системы и следить за нашим продакшн-ПО так, как не могли предыдущие поколения моделей».

Один из примеров применения, тестирование кода. У Хо не хватает времени тестировать вручную, поэтому он просит GPT-6 Astra построить вокруг приложения небольшую тестовую программу: модель генерирует правдоподобные ответы, какие прислал бы другой сервис, например, API языковой модели или коннектор, подменяя собой эти сервисы и позволяя проверить реакцию приложения и протестировать весь процесс целиком, от начала до конца. «Мы действительно можем доверить ей целые сквозные системы и проверять её результаты гораздо реже, чем у предыдущих поколений моделей», говорит Хо.

Ключевые факты

  • Perplexity использует модель OpenAI GPT-6 Astra для написания служебных коммуникаций, правки программного обеспечения и мониторинга продакшн-систем.
  • Компания проверяет результаты модели заметно реже, чем результаты предыдущих поколений моделей; точная частота проверок в источнике не приведена.
  • Сооснователь и директор по стратегии Perplexity Джонни Хо отмечает: улучшение модели в написании кода одновременно улучшает и поисковый продукт компании.
  • Для тестирования кода Хо просит GPT-6 Astra строить программы, которые имитируют ответы других сервисов, например, API языковой модели или коннектора, так проверяется весь процесс работы приложения от начала до конца.
  • Материал опубликован на блоге OpenAI и не содержит цифр: ни частоты проверок, ни данных об ошибках модели, ни названий предыдущих версий, с которыми сравнивают GPT-6 Astra.

Почему это важно

OpenAI выпустила не бенчмарки GPT-6 Astra, а клиентскую историю: Perplexity поручает модели самостоятельно писать коммуникации, вносить изменения в боевые системы и следить за продакшн-ПО, проверяя её работу заметно реже, чем у предыдущих поколений моделей. Это показывает сдвиг в том, как компании применяют модели, не только для генерации текста или кода в изоляции, а для операций с реальной инфраструктурой при меньшем контроле человека. По словам сооснователя Perplexity Джонни Хо, рост качества кода модели напрямую улучшает и продукт компании: модель пишет более удачные программы для поиска и обработки информации, а значит, качество кодогенерации и качество основного продукта Perplexity растут вместе.

Кому это важно

В первую очередь, командам, которые строят продукты поверх чужих моделей (как Perplexity, поверх моделей OpenAI) и решают, сколько автономии дать модели в собственной инфраструктуре, от переписки до правки боевого кода. Материал полезен и тем, кто ищет способ автоматизировать рутинные операционные задачи и тестирование при нехватке ресурсов на ручную проверку. Для OpenAI это ещё и способ показать потенциальным корпоративным клиентам, что GPT-6 Astra готова к сценариям с меньшим контролем со стороны человека.

Как это применить

Конкретный приём из истории Perplexity: вместо ручного написания тестовой инфраструктуры попросить модель построить вокруг приложения небольшую тестовую программу, она сгенерирует правдоподобные ответы, какие прислал бы другой сервис (например, API языковой модели или коннектор), подменит собой эти сервисы и позволит проверить реакцию приложения и весь процесс работы целиком, от начала до конца. Это особенно полезно, когда на ручное тестирование не хватает времени. Тем же путём модель можно подключать к рутинным задачам, черновикам коммуникаций и точечным правкам ПО, постепенно снижая частоту проверок по мере роста доверия к результатам.

Можно ли доверять

Это история клиента на официальном блоге OpenAI, рассказ поставщика модели о собственном продукте через слова одного клиента, без независимой проверки или сравнения с другими моделями. В тексте нет ни одной цифры: ни частоты проверок «раньше» и «теперь», ни доли ошибок модели, ни того, какие именно продакшн-системы и коммуникации она затрагивает. «Предыдущие поколения моделей», с которыми сравнивают GPT-6 Astra, нигде не названы и не датированы. Само OpenAI в тексте не упоминается, оно известно только по домену публикации и по названию модели. Это не делает описанное неправдой, но перед нами маркетинговый материал, а не независимо проверенный отчёт о результатах.

Риски и подводные камни

Право редактировать боевые системы и следить за продакшн-ПО при более редких проверках повышает цену возможной ошибки модели, а данных о частоте таких ошибок материал не приводит. Формулировка «проверяем реже» ничем не измерена: неясно, идёт ли речь о разовых точечных правках или о постоянной автономной работе. Отдельный риск, сам метод тестирования: модель имитирует ответы внешних сервисов, и такая имитация может не воспроизвести реальные сбои или пограничные случаи, которые показал бы настоящий сервис, создавая ложное чувство полноты тестового покрытия.

«Мы действительно можем доверить ей целые сквозные системы и проверять её результаты гораздо реже, чем у предыдущих поколений моделей.»

— Джонни Хо, сооснователь и директор по стратегии Perplexity