Castform заявил: RL-дообученные открытые модели обходят GPT-5.6 Sol в поиске

Castform заявил: RL-дообученные открытые модели обходят GPT-5.6 Sol в поиске

Neon (в материале, «Lakebase Postgres») и стартап Castform опубликовали в блоге Neon совместный кейс о том, как RL-дообучение (обучение с подкреплением) небольших открытых моделей поднимает их качество в задачах поиска. По утверждению материала, после такого дообучения открытые модели сравниваются или превосходят топовые закрытые модели вроде GPT-5.6 Sol на задачах поиска, оставаясь при этом на порядки дешевле в пересчёте на запрос. Сооснователь Castform Ying Hang Seah поясняет идею так: лучшие обучающие данные у большинства команд уже лежат в их базах данных, но превратить сырые данные во что-то пригодное для обучения сложно, а дать агентам дёшево читать, искать и изменять данные в большом масштабе, требует продвинутой инфраструктуры; связка Castform и Neon снимает обе проблемы разом.

Материал описывает, как менялся поиск для ИИ-систем. Примерно с 2022 года индустрия массово перешла на поиск по эмбеддингам: такую функцию добавил почти каждый провайдер баз данных, а pgvector стал самым скачиваемым расширением Neon; чтобы дать LLM нужный контекст, инженеры вручную собирали конвейеры RAG, по сути, разновидность поиска по смысловой близости. Примерно с 2025 года стали быстро набирать популярность ИИ-агенты: вместо одного запроса модели начали планировать и искать в несколько шагов по кругу («агентный поиск»), а каждая итерация такого цикла, это ещё один вызов топовой модели, то есть дополнительная стоимость и задержка. По данным статьи, типичный многоходовой поисковый запрос к GPT-5.6 Sol занимает больше 10 секунд и обходится примерно в $0,03 «от начала до конца», на практике это слишком медленно и дорого при масштабировании. При этом малые открытые модели без дообучения дешевле закрытых API-моделей примерно в 100 раз, но уступают им по качеству «из коробки»; RL-дообучение, как утверждает материал, должно закрыть этот разрыв именно на конкретных задачах вроде поиска, насколько именно дешевле выходит запрос к уже дообученной модели, в тексте не указано, экономия названа лишь как «на порядки».

Дальше материал объясняет устройство самого Castform. Для RL-дообучения нужны три компонента: задача (например, ответить на вопрос пользователя), среда для агента (например, инструмент поиска по корпусу компании) и функция вознаграждения (например, правильный ли получился ответ). Проблема в том, что у большинства компаний нет готового чистого набора задач и функций вознаграждения для дообучения, при этом сырых проприетарных данных обычно много: внутренняя документация, карточки товаров, статьи поддержки, история обращений клиентов, вики, рабочие базы данных. Из-за этого команды часто отказываются от дообучения моделей по одной из двух причин, «у нас нет данных для обучения» или «дообучение слишком сложное, нужна инфраструктура, которой у нас нет». Castform, по описанию материала, снимает обе причины: превращает существующий корпус компании в обучающие примеры и сам ведёт цикл RL-обучения. В качестве иллюстрации в материале приведён пример: из внутреннего документа о правилах бронирования поездок (проезд через Navan оплачивается корпоративной картой GitLab, класс места, только «стандарт», бронировать нужно минимум за 14 дней) автоматически получаются эталонный ответ и синтетический вопрос пользователя, из которых складывается обучающий пример; это иллюстрация устройства пайплайна, а не указание на то, что GitLab или Navan, клиенты Castform или Neon: в тексте это нигде не утверждается. Функция вознаграждения в такой схеме задаёт, чего именно должна добиться модель, в примере из статьи это извлекать нужные фрагменты текста, ссылаться на верные источники и давать правильный итоговый ответ. Отдельно Castform даёт разработчику полную наблюдаемость за ходом обучения: можно следить, как растёт вознаграждение на каждом шаге, и «заходить» в отдельные задачи и промпты, чтобы вручную посмотреть, как рассуждает модель, и поймать проблемы вроде сломанных инструментов или reward hacking (когда модель обманывает функцию вознаграждения вместо того, чтобы решать задачу по сути).

Отдельный блок материала объясняет, почему для этого выбран именно Neon. Во время обучения агент раз за разом обращается к Lakebase Search, пока не наберёт достаточно контекста для ответа; при тысячах параллельных прогонов обучения, каждый из которых может делать десятки таких вызовов, нагрузка получается крайне неравномерной, с резкими всплесками. Автомасштабирование Neon, по утверждению материала, гасит эти всплески без необходимости держать инфраструктуру Castform постоянно рассчитанной на пиковую нагрузку: во время всплеска спроса поиск отвечает быстро, а в простое вычислительные мощности снижаются. Ценность такой связки растёт ещё больше, когда агенты не просто ищут, а начинают изменять данные: обучение агентов с состоянием требует изолированных сред, которые дёшево создавать и сбрасывать, чтобы действия одного прогона обучения не задевали другой и не касались продакшена. Функция ветвления Neon (branching) даёт каждому прогону изолированное состояние базы данных, а «запросы в прошлое» (time-travel queries) позволяют восстановить и изучить, в каком именно состоянии агент столкнулся с задачей. Вместе с автомасштабированием и обнулением вычислений в простое (scale-to-zero) это, по словам авторов материала, открывает путь к обучению тысяч агентов с состоянием без необходимости держать тысячи постоянно работающих окружений.

Материал заканчивается прямым призывом дообучить свою первую модель на castform.com. Это совместный промо-кейс в блоге Neon, а не независимая публикация: центральное заявление о том, что дообученные открытые модели «сравниваются и превосходят» топовые модели в поиске, не подкреплено в тексте ни одним бенчмарком или числом точности; конкретная стоимость и задержка запроса указаны только для GPT-5.6 Sol, но не для собственной дообученной модели Castform, а какое именно семейство открытых моделей дообучает сервис, в материале не названо.

Ключевые факты

  • Стартап Castform и Postgres-платформа Neon совместно опубликовали в блоге Neon кейс: RL-дообучение малых открытых моделей на данных компании поднимает их качество в поиске до уровня закрытых моделей вроде GPT-5.6 Sol, так утверждает материал.
  • По данным статьи, типичный многоходовой поисковый запрос к GPT-5.6 Sol занимает больше 10 секунд и стоит около $0,03 «от начала до конца»; малые открытые модели без дообучения дешевле закрытых примерно в 100 раз, но уступают им по качеству, RL-дообучение должно закрыть этот разрыв именно на задачах вроде поиска.
  • Для RL-дообучения нужны три компонента, задача, среда (инструмент поиска по корпусу) и функция вознаграждения; Castform автоматически превращает существующий корпус компании (документацию, тикеты поддержки, вики, рабочие базы данных) в обучающие примеры и сам ведёт цикл обучения.
  • Обучение идёт через новое поисковое расширение Neon, Lakebase Search: тысячи параллельных прогонов, каждый с десятками поисковых вызовов, а автомасштабирование и ветвление базы Neon дают каждому прогону изолированное состояние без постоянно работающей инфраструктуры под пиковую нагрузку.
  • Материал не приводит ни одного бенчмарка или числа точности в подтверждение того, что дообученные модели «сравниваются и превосходят» топовые модели, не называет открытую модель, которую дообучает Castform, и не даёт цены или задержки для собственной модели сервиса, это кейс от самого вендора, а не независимый тест.

Почему это важно

Агентный поиск умножает вызовы дорогой топовой модели: каждый шаг многоходового запроса, это ещё один платный вызов вроде GPT-5.6 Sol, и стоимость с задержкой растут вместе с числом шагов. Если RL-дообученные открытые модели действительно способны заменить топовую модель хотя бы на части этих шагов, экономика агентных продуктов с поиском по большим объёмам данных меняется на порядок, не нужно прогонять каждый шаг цикла через дорогой закрытый API. Это часть более широкого сдвига, который описывает материал: от разового поиска по эмбеддингам (примерно с 2022 года) к многошаговому агентному поиску (примерно с 2025 года), где стоимость каждого дополнительного шага складывается в итоговый счёт.

Кому это важно

В первую очередь, командам, которые строят ИИ-агентов и поиск по собственным большим массивам данных и упираются в стоимость вызовов топовых моделей на каждом шаге поиска. Отдельно, пользователям Postgres и особенно Neon, для которых интеграция через Lakebase Search становится готовым путём подключения. И ML-инженерам без глубокой экспертизы в RL и работе с GPU: материал прямо называет целью Castform сделать дообучение моделей таким же доступным, как промпт-инжиниринг, то есть задачу адресуют командам, у которых уже есть много проприетарных данных (документация, вики, тикеты поддержки), но нет ни готового датасета для обучения, ни своей ML-инфраструктуры.

Как это применить

Схема из материала: для RL-дообучения нужны три компонента, задача, среда (инструмент поиска по своему корпусу) и функция вознаграждения. Castform сам превращает существующий корпус компании в обучающие примеры (документ → эталонный ответ → синтетический вопрос) и запускает цикл обучения по заданным инструментам и функции вознаграждения; в процессе доступна наблюдаемость, рост вознаграждения по шагам и возможность зайти в конкретную задачу или промпт, чтобы вручную разобрать, как рассуждает модель, и поймать сломанные инструменты или reward hacking. Технически конвейер обучения работает через Neon: поисковый инструмент, это расширение Lakebase Search, а изоляцию между параллельными прогонами обучения дают ветвление базы (branching) и запросы в прошлое (time-travel queries). Точка входа, регистрация на castform.com; ни цены, ни условий тарифного плана материал не называет.

Можно ли доверять

Это совместный промо-материал в блоге Neon, написанный вместе с сооснователем Castform, продукта, который в тексте и продвигают. Центральное заявление, что RL-дообученные открытые модели «сравниваются и превосходят» топовые модели вроде GPT-5.6 Sol на поиске, сформулировано качественно, без единого бенчмарка, числа точности или результата прямого сравнения. Конкретные цифры (задержка больше 10 секунд, стоимость около $0,03 за запрос) даны только для GPT-5.6 Sol; для собственной дообученной модели Castform ни цена, ни задержка не приведены, так что проверить заявленную экономию по тексту невозможно. Какое именно семейство открытых моделей дообучает Castform, не названо. Пример с GitLab и Navan в материале, иллюстрация того, как работает генерация обучающих примеров, а не подтверждение того, что эти компании, клиенты Castform или Neon. Стоит читать это как кейс вендора в свою пользу, а не как независимый тест.

Риски и подводные камни

Материал сам называет риск, с которым явно сталкивается RL-дообучение, reward hacking, когда модель учится обманывать функцию вознаграждения вместо того, чтобы решать задачу по сути; именно поэтому Castform строит вокруг обучения наблюдаемость, чтобы такие случаи ловить вручную. Модель, дообученная на поиск по конкретному корпусу компании, рискует не переноситься на задачи за его пределами. Выбор такого стека означает зависимость сразу от двух вендоров, Castform для дообучения и Neon для инфраструктуры поиска и хранения данных. Наконец, схема требует скормить модели на обучение внутренние источники, документацию, тикеты поддержки, историю обращений клиентов, рабочие базы данных, и материал никак не обсуждает, как при этом защищены чувствительные или персональные данные, которые могут в них встретиться.

«Лучшие обучающие данные у большинства команд просто лежат в их базах данных. Проблема в том, что превратить сырые данные во что-то пригодное для использования, сложно, а дать агентам дёшево читать, искать и изменять данные в большом масштабе, требует продвинутой инфраструктуры. Если направить Castform на Neon, обе проблемы снимаются.»

— Ying Hang Seah, сооснователь Castform