OpenAI может быстро повторить ИИ-классификатор Jev от TypeSafe

Разработчик Джон Берримен, ранее работавший в GitHub над Copilot, опубликовал в своём блоге разбор под заголовком «Съест ли OpenAI обед Jev?», о новом продукте стартапа TypeSafe. Jev, это модель-классификатор: вместо обычного текстового ответа она смотрит на вероятности всего нескольких токенов (например «true»/«false» для да-нет-вопроса или букв A/B/C/D для вопроса с вариантами ответа) и превращает их в откалиброванную вероятностную оценку. По словам компании Vercel, Jev внедрили в её AI Gateway быстрее, чем любую другую модель за всю историю сервиса. Издание Latent Space сообщает, что многие ранние клоны Jev действительно построены на обычных больших языковых моделях.
Центральный тезис Берримена: OpenAI уже много лет негласно использует свои языковые модели как классификаторы, просто не оформляла эту способность в отдельный продукт. Он ссылается на собственные наблюдения 2024 года над служебным протоколом OpenAI ChatML: первый токен после начала ответа ассистента, это по сути классификатор «нужно ли вызывать инструмент», следующий токен выбирает конкретный инструмент из списка, а специальный токен завершения реплики, классификатор «закончил ли я говорить». По его рассказу, ранняя внутренняя версия API GPT-4, с которой он работал в Copilot, не умела корректно предсказывать токен завершения и генерировала прощальные фразы, пока не упиралась в лимит токенов ответа.
Если у Jev нет архитектурного рва, а Берримен считает, что это, вероятно, обычная языковая модель, то у OpenAI, по его оценке, есть навыки, вычислительные мощности и деньги, чтобы скопировать продукт. Более того, компания может пойти дальше и встроить откалиброванный классификатор прямо в цепочку рассуждений модели через гипотетический служебный тег вида
Главный ров TypeSafe, как считает автор, не в архитектуре, а в данных и методике их подготовки для калибровки. Сооснователь TypeSafe Диого Алмейда описал подход к обучающим данным так: нужен большой массив примеров с уже известным исходом, обращения в поддержку и то, как их на самом деле маршрутизировали, резюме и то, наняли ли кандидата, отзывы о товарах и их реальные оценки, очереди модерации и вынесенные по ним решения, прогнозные рынки и то, чем они реально разрешились, каждый пример в паре с вопросом, правильный ответ на который заранее известен. Отдельный элемент, обучение с подкреплением, детали которого Берримен не знает и прямо об этом пишет.
Автор подчёркивает: точность Jev, единственное, что трудно проверить со стороны, и он уже находил области, где вероятности Jev расходятся с реальностью. Весь раздел про «следующий шаг OpenAI», личное предположение Берримена: никаких официальных заявлений OpenAI о копировании или встраивании Jev-подобной классификации в статье нет, как нет и даты запуска Jev или числовых показателей его точности.
Ключевые факты
- TypeSafe выпустила Jev, модель-классификатор, которая вместо текста выдаёт откалиброванную вероятность ответа по нескольким токенам (true/false или A/B/C/D)
- По данным Vercel, Jev внедрили в AI Gateway быстрее любой другой модели за всю историю сервиса
- Бывший инженер Copilot Джон Берримен утверждает: OpenAI уже годами неявно использует свои модели как классификаторы, через токены выбора инструмента и завершения ответа в ChatML
- Берримен предполагает гипотетический служебный тег
, который позволил бы модели самой оценивать вероятность утверждений прямо внутри цепочки рассуждений, это его личная идея, а не анонсированная функция OpenAI - Реальный ров TypeSafe автор видит не в архитектуре, а в данных для калибровки, сооснователь Диого Алмейда описал принцип их сбора; официальных подтверждений планов OpenAI по копированию Jev в статье нет
Почему это важно
Если тезис Берримена верен, способность выдавать откалиброванную вероятность ответа, то, что сейчас продаётся как отдельный продукт TypeSafe, может стать встроенной функцией обычных языковых моделей. Автор проводит прямую параллель с тем, как OpenAI уже превратила вызов инструментов в скрытый классификатор внутри ChatML: следующий шаг, то же самое, но для произвольных вопросов «да/нет» и «выбери из списка». Это меняет расклад не потому, что OpenAI официально что-то анонсировала (не анонсировала), а потому что автор показывает: техническая база для такого шага у OpenAI уже есть.
Кому это важно
Инженерам, которые проектируют маршрутизацию между моделями, модерацию и защитные ограничения, Берримен описывает именно эти сценарии как выгодоприобретателей встроенной классификации. Командам, которые уже интегрировали или оценивают Jev через AI Gateway Vercel, для них ключевой вопрос в том, насколько глубок архитектурный ров TypeSafe. И тем, кто следит за паттерном «стартап показал нишевую фичу, крупная лаборатория быстро её повторяет», знакомым по истории с function calling и агентами.
Как это применить
Автор описывает механику, а не готовый рецепт: чтобы получить откалиброванную вероятность из модели, вместо обычного жадного или top-p семплирования нужно на конкретной позиции генерации взять логиты только двух (или нескольких) конкретных токенов-кандидатов (например true/false), отнормировать их друг относительно друга через softmax и записать получившееся число в текст вместо обычного следующего токена. Это тот же принцип управляемого декодирования, что уже используют библиотеки для структурированного вывода, просто применённый к вероятностям, а не к грамматике формата.
Можно ли доверять
Это личный аналитический блог-пост одного разработчика, а не заявление OpenAI, Vercel или TypeSafe. Фактическая часть, существование Jev, скорость его внедрения по словам Vercel, цитата сооснователя TypeSafe, подкреплена ссылками и цитатами. Но весь раздел про будущий шаг OpenAI, включая тег
Риски и подводные камни
Главный риск для TypeSafe, который называет сам автор: если у Jev нет рва в архитектуре и вся его ценность, в обучающих данных и методике калибровки, воспроизвести продукт технически сильному конкуренту с деньгами и вычислительными мощностями может быть проще, чем кажется. Для читателя статьи риск в другом: спутать гипотезу автора об OpenAI с реальным анонсом. В тексте нет ни одной цифры точности самого Jev, ни даты его запуска, оценивать зрелость продукта по этой статье не получится.
«Jev внедрили быстрее, чем любую другую модель за всю историю AI Gateway.»
— Vercel