Разработчик выпустил Laya, open-source модель решений в 6, 8 раз быстрее Jev

Автор поста (на Hacker News под ником nandakishor_ml, на GitHub, NandhaKishorM) рассказывает, что ещё в марте 2025 года построил неавторегрессивную архитектуру моделей решений на обучении с подкреплением (RL): она не генерирует текст, а сразу выдаёт вероятностные предсказания по заданной схеме. Тогда он опубликовал статью на arXiv (arXiv:2503.23303), выложил веса модели и датасет на Hugging Face, собрал пакет для PyPI и написал об этом на Reddit. В сентябре 2025 года вышла вторая статья (arXiv:2510.01237), формализующая этот подход. В сентябре 2026 года хорошо профинансированная лаборатория TypeSafe AI, основанная Диогу Алмейдой, одним из создателей ChatGPT в OpenAI, выпустила продукт Jev с той же идеей неавторегрессивных решений, но без технических статей, открытых весов и датасетов. Jev использует метод, который TypeSafe AI называет RLCD (Reinforcement Learning for Calibrated Decisions), стоит $0,042 за миллион входных токенов и отвечает примерно за 150 мс.

В ответ автор выпустил семейство открытых моделей Laya на лицензии Apache 2.0. По его замерам, модель работает 32,8 мс на одном GPU (7,2 мс на вопрос при батчинге), в 6, 8 раз быстрее Jev, с поддержкой более 100 языков и без платы за API. Идея в том, что множество задач в ИИ-конвейерах, не творческие, а рефлекторные: определить очередь для тикета поддержки, отличить фишинг от спама, оценить срочность обращения, и для них незачем гонять большую генеративную LLM, которая к тому же выдаёт "уверенность" без реальной математической калибровки. Laya поддерживает три типа вопросов: выбор одного варианта из списка (choice), оценка по порядковой шкале (score) и булев вопрос с калиброванной вероятностью (noul). Поскольку модель выдаёт только числа и вероятности, а не текст, она физически не может галлюцинировать или нарушить формат ответа.

Автор выпустил три чекпоинта (специализации), объединённые в один репозиторий на Hugging Face: пользователь скачивает нужный поднабор весов через subfolder, например, только английскую модель (~808 МБ) или только многоязычную (~647 МБ) вместо полного набора в 2,5 ГБ. Тест на 51 языке (бенчмарк MASSIVE, случайная точность, 0,050) показал, что англоязычная модель полностью проваливается на нелатинских алфавитах: на кхмерском, 0% точности при 95,2% средней уверенности, на армянском, 5% (уровень случайного угадывания) при 88,5% уверенности, на иврите, 6% при 96,4%, на бенгальском, 8% при 94,5%, на хинди, 10% при 94,1%. При этом средняя уверенность английского чекпоинта по всем 51 языкам не опускается ниже 88,5%, независимо от того, 82% точность или 0%, то есть собственная уверенность модели не сигнализирует о провале. Поэтому Laya включает встроенный маршрутизатор, который определяет алфавит входного текста (22 системы письма) и выбирает подходящий чекпоинт ещё до прогона модели; накладные расходы на маршрутизацию, 0,09 мс для латиницы, 0,54 мс для деванагари, 0,73 мс для крупных вложенных JSON-документов, то есть менее 2% на фоне 33-миллисекундного прогона самой модели.

В сравнении с Jev на реальных задачах Laya показывает: 99,3% точности на фильтрации спама (датасет Enron), 98% на детекции фишинга, 75,5, 76,2% на выявлении джейлбрейков и вредных запросов (held-out ToxicChat, до 93,1% при выборочном покрытии 50%), 65,7% на фильтрации релевантности пассажей для RAG и 52,2% на маршрутизации тикетов поддержки по 10 очередям. Автор прямо приводит и слабые места: на стресс-тесте Banking77 (77 вариантов выбора) Laya набрала 0,425 против 0,870 у Jev, токенный бюджет в 192, 256 токенов на вопрос оставляет всего 3, 4 токена на вариант при таком количестве опций, поэтому схемы выбора рекомендуется держать до 20 вариантов или разбивать на два этапа. Без дообучения базовые модели показывают на бенчмарке typed-decisions около 0,35 (почти случайный уровень), тогда как заявленные 0,766 достигаются только после дообучения на тренировочной части того же бенчмарка. Калибровка тоже требует настройки: подгонка одного температурного коэффициента на тип вопроса снижает ожидаемую ошибку калибровки с 0,466 до 0,081.

Ключевые факты

  • Автор ещё в марте 2025 года опубликовал статью на arXiv, открытые веса и датасет для неавторегрессивной модели решений на RL, на год раньше похожего продукта TypeSafe AI
  • В сентябре 2026 TypeSafe AI (основатель, Диогу Алмейда, один из создателей ChatGPT в OpenAI) выпустила Jev без статей, открытых весов и датасетов; цена $0,042 за млн входных токенов, отклик ~150 мс
  • В ответ автор выпустил открытую модель Laya (Apache 2.0): 32,8 мс на GPU (7,2 мс в батче), в 6, 8 раз быстрее Jev, поддержка более 100 языков
  • На бенчмарке MASSIVE (51 язык) англоязычный чекпоинт проваливается на нелатинских алфавитах (0% точности на кхмерском при 95%+ уверенности), поэтому в Laya встроен маршрутизатор по алфавитам
  • Честно указанные ограничения: на Banking77 (77 вариантов выбора) Laya набирает 0,425 против 0,870 у Jev, а без дообучения оценка на typed-decisions падает до ~0,35 против 0,766 после дообучения

Почему это важно

История показывает разрыв между тем, что попадает в хайп, и тем, кто это придумал первым: автор опубликовал статью, веса и датасет на год раньше, чем похожую идею представила профинансированная лаборатория TypeSafe AI, без статей и открытых весов. Технически идея интересна сама по себе: множество ИИ-задач (маршрутизация тикетов, фильтрация спама, оценка срочности) не требуют генеративной LLM с её задержкой в сотни миллисекунд и неоткалиброванной "уверенностью" в токенах, их можно решать моделью, которая за один проход выдаёт настоящую вероятность.

Кому это важно

Инженерам, которые строят конвейеры с высоким объёмом простых структурированных решений: маршрутизация обращений поддержки, фильтрация спама и фишинга, guardrails против джейлбрейков, отбор релевантных фрагментов для RAG. Также важно тем, кто делает мультиязычные продукты и мог не заметить, что англоязычная модель классификации молча проваливается на нелатинских языках, сохраняя высокую уверенность.

Как это применить

Модель ставится через pip install laya>=0.3.3, веса лежат в едином репозитории convaiinnovations/laya на Hugging Face с выбором нужного чекпоинта (английский, многоязычный или typed-decisions) через subfolder. Библиотека даёт три примитива вопроса, choice (выбор варианта), score (оценка по шкале) и noul (булева вероятность), и встроенный Router, который сам определяет язык/алфавит входа и с preload=True держит все чекпоинты в памяти, чтобы не терять 7, 10 секунд на переключение между языками.

Можно ли доверять

Это личный пост автора, а не независимый обзор: почти все числа по Laya, самозамеры ("Every Laya number is measured"), сторонней проверки этих результатов в источнике не упомянуто. Цифры по Jev автор берёт из публикаций TypeSafe AI и двух сторонних независимых исследований (AbdelStark, nibzard), а не из собственных тестов конкурента. Сама история о приоритете, версия одной стороны: реакции TypeSafe AI или Диогу Алмейды на заявление о первенстве в источнике нет.

Риски и подводные камни

Метод плохо масштабируется на схемы с большим числом вариантов выбора: при 77 опциях (тест Banking77) точность падает до 0,425 против 0,870 у Jev, токенного бюджета в 192, 256 токенов не хватает на длинные списки. Без дообучения базовая модель работает на уровне, близком к случайному (~0,35), и раскрывает заявленную точность только после дообучения на целевых данных. Калибровка "из коробки" тоже сырая, базовые веса требуют дополнительной настройки температуры, иначе ошибка калибровки заметно выше.

«Собственная уверенность модели не может защитить: решение о том, какую модель использовать, нужно принимать до прогона, а не после.»

— автор Laya, из поста