Privatemode превратила GLM-5.3-Flash в модель решений уровня Jev без дообучения
Компания Privatemode опубликовала пост Йоханнеса Хёттера (VP Growth) и Марко Розенмюллера (PhD, Technical Lead AI), в котором описан приём для превращения обычной языковой модели GLM-5.3-Flash в «System One»-модель принятия решений, по образцу специализированных Jev (от TypeSafe) и Laya (от Convai). Такие модели получают на входе состояние и набор именованных вариантов ответа и за один проход выдают выбранный вариант вместе с вероятностью (уверенностью) по каждому из вариантов, без генерации целого JSON-объекта.
Суть техники: варианты ответа нумеруются и передаются в промпте вместе с состоянием и вопросом; ответ модели заранее «предзаполняется» строкой choice_index:, так что первым токеном модель обязана выдать индекс варианта; вместо чтения самого токена авторы считывают вероятности, которые модель присвоила всем индексам вариантов именно на этой позиции, и нормализуют их. Подход реализован на GLM-5.3-Flash, развёрнутой на vLLM внутри Privatemode, через эндпоинт /chat/completions с параметрами continue_final_message и add_generation_prompt: false, это позволяет модели продолжать предзаполненную реплику и одновременно передавать изображения вместе с текстом. Дообучение при этом не требуется, используется модель «как есть», в отличие от Jev и Laya, специально натренированных под эту задачу. Код техники и бенчмарка выложен в открытых репозиториях edgelesssys/privatemode-decisions и privatemode-decisions-benchmark.
Авторы сравнили три системы на 29 публичных размеченных датасетах (от 2 до 151 варианта ответа: маршрутизация запросов, тональность, классификация тем, модерация, вопросно-ответные задачи, юридические тексты, сканированные документы). На 28 текстовых датасетах GLM-5.3-Flash и Jev показали сопоставимый результат: каждая система точнее на 10 датасетах, ещё на 8 расхождение меньше одного процентного пункта; медианный разрыв, 0,7 п.п. в пользу Jev, что статистически незначимо (p = 0,64). Laya (модель на 421 млн параметров, запускавшаяся локально) уступала обеим системам почти везде: медианный разрыв 13, 15 п.п., уже статистически значимый (p < 0,001). На трёх датасетах, где одни и те же вопросы размечены и грубо, и детально, рост числа вариантов сильнее влиял на точность, чем выбор между Jev и GLM-5.3-Flash: например, на TREC при переходе с 6 до 42 вариантов точность Jev упала с 92,1% до 85,6%, GLM-5.3-Flash, с 91,2% до 79,6%, а Laya, с 88,4% до 51,2%.
По задержке: из Германии Privatemode отвечал за 180 мс против 264 мс у Jev (хостится в США), а из США порядок обратный, 164 мс у Jev против 299 мс у Privatemode. По цене Jev дешевле: миллион решений по прайс-листам обходится примерно в 62 евро на GLM-5.3-Flash и около 16 евро на Jev, в основном из-за разной цены входного токена и другого способа упаковки запроса (у Jev фиксированные накладные расходы около 270 токенов плюс 10 токенов на вариант, у GLM-5.3-Flash, около 55 токенов плюс 20 на вариант; ниже примерно 21 варианта промпт GLM-5.3-Flash компактнее, выше, тяжелее).
Бонусом подход работает и с изображениями: GLM-5.3-Flash, vision-модель, поэтому вопрос может сопровождаться сканом счёта, фото повреждённой посылки или скриншотом, а ответ остаётся тем же токеном с распределением вероятностей. Ни Jev (текстовая модель), ни Laya (текстовый энкодер) изображения не принимают. На наборе из 1600 сканированных бизнес-документов в 16 классах (RVL-CDIP) GLM-5.3-Flash достигла точности 70,2%, при этом изображение добавляет около 1350 входных токенов, а миллион таких решений с изображениями обходится примерно в 270 евро.
При большом числе вариантов у каждой системы обнаруживается свой потолок. Бюджет названий вариантов у Laya, 192 токена, чего хватает на 77 намерений banking77, но не хватает на 151 намерение CLINC150. Развёртывание GLM-5.3-Flash в Privatemode возвращает не более 128 записей в logprob_token_ids, поэтому для 151 варианта библиотека отправляет запрос дважды и объединяет результаты первых 128 и оставшихся 23 вариантов; это удваивает время ответа. На CLINC150 GLM-5.3-Flash таким способом достигла точности 87,5% против 78,4% у Jev, но решение занимает 719 мс против 249 мс у Jev. Абсолютный потолок метода, 191 индекс варианта, который GLM-5.3-Flash способна закодировать одним токеном. Часть расхождений с эталонной разметкой авторы объясняют неоднозначностью самих датасетов: около 17% примеров banking77 допускают два защитимых варианта ответа (например, get_physical_card и order_physical_card), так что потолок точности там, примерно 85%, а не 100%.
Отдельно проверили режим с «размышлением» (reasoning) у GLM-5.3-Flash: он точнее базового подхода в каждом диапазоне числа вариантов, от 89,9% против 85,5% при двух вариантах до 82,0% против 79,2% при 21, 80 вариантах, но пишет сотни токенов вместо одного и обходится примерно в 350 евро за миллион решений против 62 евро у базового подхода. Авторы также отмечают, что даже при температуре 0 ответы GLM-5.3-Flash и Jev расходились между идентичными повторными прогонами до 3,5% случаев из-за батчинга и особенностей floating-point вычислений на загруженном сервере.
Ключевые факты
- Privatemode показала, что GLM-5.3-Flash через специальный промпт (без дообучения) может за один проход выдавать вероятность по каждому варианту ответа, как специализированные модели решений Jev и Laya
- На 28 текстовых датасетах точность GLM-5.3-Flash и Jev статистически неотличима (медианный разрыв 0,7 п.п. в пользу Jev, p=0,64); Laya (421 млн параметров) уступала обеим системам заметно сильнее (разрыв 13-15 п.п., p<0,001)
- В отличие от Jev и Laya, GLM-5.3-Flash умеет принимать типизированные решения по изображениям: на наборе из 1600 сканированных документов (RVL-CDIP, 16 классов) точность составила 70,2%
- По цене Jev дешевле (около 16 евро против 62 евро за миллион решений по прайс-листам), а при более 21 варианта ответа - ещё и компактнее по токенам; включение «размышления» у GLM-5.3-Flash повышает точность во всех диапазонах, но поднимает стоимость до 350 евро за миллион
- У подхода есть потолок применимости: свыше 191 варианта GLM-5.3-Flash не может закодировать индекс одним токеном, а для 151 варианта (CLINC150) требуется два объединённых запроса, что удваивает время ответа до 719 мс против 249 мс у Jev
Почему это важно
Специализированные «System One»-модели вроде Jev и Laya создавались отдельно и обучались именно для быстрой типизированной классификации с вероятностью по каждому варианту, в отличие от обычных LLM, которым для похожей задачи приходится генерировать целый JSON-объект, что медленно и дорого, особенно в высоконагруженных сценариях. Privatemode показала, что обычную модель GLM-5.3-Flash можно заставить делать то же самое без какого-либо дообучения, достаточно правильно составить промпт и считать вероятности с позиции индекса варианта. По результатам бенчмарка на 29 датасетах точность и скорость такого подхода оказались сопоставимы со специально обученной Jev, а вдобавок метод работает и с изображениями, чего у Jev и Laya нет.
Кому это важно
В первую очередь, разработчикам, встраивающим LLM в высоконагруженные пайплайны принятия решений: маршрутизация тикетов поддержки, модерация контента, классификация документов, интент-роутинг в диалоговых системах. Для них важны и скорость ответа, и понятная вероятность (уверенность) модели, а не только сгенерированный текст. Также материал интересен тем, кто уже использует или рассматривает специализированные decision-модели типа Jev или Laya и ищет альтернативу на базе обычного LLM без отдельного обучения.
Как это применить
Техника и код опубликованы в открытых репозиториях edgelesssys/privatemode-decisions (библиотека: подготовка промпта, маскирование и нормализация вероятностей для любого vLLM-совместимого эндпоинта) и privatemode-decisions-benchmark (методология, датасеты, все цифры из поста воспроизводимы). Для работы нужен доступ к параметрам вроде continue_final_message, add_generation_prompt: false и logprob_token_ids на стороне сервера. По прайс-листам решение через GLM-5.3-Flash стоит около 62 евро за миллион решений (около 270 евро, если решения включают изображения, например сканы документов), тогда как Jev обходится примерно в 16 евро за миллион; включение режима «размышления» у GLM-5.3-Flash повышает точность, но поднимает стоимость до примерно 350 евро за миллион.
Можно ли доверять
Пост опубликован самой Privatemode, компанией, которая продаёт защищённый (confidential computing) хостинг для GLM-5.3-Flash, поэтому материал нельзя считать независимой экспертизой. При этом методология описана подробно: сравнение проведено на 29 публичных размеченных датасетах, приведены статистические значимости различий (p-значения), а бенчмарк и код техники выложены в открытом доступе для самостоятельной проверки и воспроизведения каждой цифры из поста.
Риски и подводные камни
Авторы отмечают, что даже при температуре 0 ответы GLM-5.3-Flash и Jev расходились между идентичными повторными прогонами до 3,5% случаев из-за батчинга и особенностей floating-point вычислений на загруженном сервере, часть различий между системами стоит списывать на этот шум. У метода есть потолок по числу вариантов: развёртывание GLM-5.3-Flash в Privatemode возвращает не более 128 записей вероятностей за раз, поэтому для датасета с 151 вариантом (CLINC150) пришлось отправлять запрос дважды и объединять результаты, что удвоило время ответа (719 мс против 249 мс у Jev); а свыше 191 варианта индекс уже не кодируется одним токеном, что и является абсолютным ограничением подхода. Часть расхождений с эталонной разметкой датасетов, не ошибка моделей, а неоднозначность самой разметки: например, около 17% примеров banking77 допускают два защитимых варианта ответа, так что предельная точность там, около 85%, а не 100%.
«Число вариантов ответа влияет на точность сильнее, чем выбор между Jev и GLM-5.3-Flash.»
— Йоханнес Хёттер и Марко Розенмюллер, Privatemode