Дообучение 9B-модели за $500 обошло топовые ИИ на разборе каталога

В тесте на разбор товарного каталога открытую модель на 9 миллиардов параметров дообучили методом reinforcement learning (обучение с подкреплением), то есть модель обучали не на готовых примерах, а на оценённой версии рабочего процесса, где каждый её ответ получал баллы. Стоимость такого дообучения авторы оценивают в $500. Итог: дообученная модель набрала 87,3% от максимально возможного балла против 76,9% у лучшей топовой модели и 64,2% у той же 9-миллиардной модели без дообучения, то есть на 10,4 процентных пункта выше лучшей топовой модели (относительный прирост, около 13,5%).
Авторы называют это устоявшимся за последние два года приёмом: берётся открытая модель, добавляются закрытые данные компании о конкретной задаче, и модель дообучается через RL против оценённой версии рабочего процесса. Результат, узкоспециализированная модель, которая на своей задаче обходит универсальные топовые модели и при этом стоит в разы дешевле в эксплуатации.
В подтверждение приводятся три реальных случая. Bridgewater Associates, один из крупнейших хедж-фондов мира, ежедневно просеивает поток статей, документов и писем, отбирая то, что относится к инвестиционному тезису фонда. Никакими промптами не удавалось объяснить топовым моделям внутренние критерии релевантности Bridgewater, поэтому фонд дообучил открытую модель на разметке собственных экспертов-инвесторов. Дообученная модель делает примерно на 30% меньше ошибок, чем лучшая топовая модель, и обходится значительно дешевле по инференсу.
Harvey строит ИИ-агентов для юридических фирм. Самые сложные его задачи, due diligence по сделкам (юридическая проверка) и подготовка юридических меморандумов, где агенту приходится работать с большими массивами документов, а ошибки накапливаются на длинных цепочках шагов; даже топовые модели на максимальном уровне рассуждений не дотягивали до нужной планки качества. Harvey дообучил открытую модель методом RL и получил юридического агента, который по собственным критериям компании обходит и GPT-5.5, и Claude Opus 4.8.
Intercom, платформа поддержки клиентов, чей ИИ-агент Fin закрывает почти два миллиона обращений в неделю. При таком объёме решает экономика: цена одного обращения у топовых моделей быстро складывается в заметную сумму, а каждый процентный пункт доли решённых обращений на счету. Команда ИИ Intercom дообучила собственную вертикальную модель поддержки, Fin Apex, на миллиардах диалогов с клиентами. Компания сообщает, что Fin Apex решает больше обращений, чем лучшие топовые модели, и обходится дешевле в работе.
Авторы утверждают, что похожая схема повторяется ещё как минимум в восьми компаниях, которые они разбирают в приложении к материалу, но подробностей по этим кейсам в доступном тексте нет.
Ключевые факты
- Открытую модель на 9 млрд параметров дообучили методом RL за $500 и получили результат 87,3% от максимума против 76,9% у лучшей топовой модели и 64,2% у той же модели без дообучения.
- Playbook: открытая модель + закрытые данные компании + RL против оценённой версии рабочего процесса, вместо промптинга топовых моделей.
- Bridgewater Associates дообучил открытую модель на разметке своих аналитиков и снизил ошибки отбора документов примерно на 30% относительно лучшей топовой модели.
- Harvey получил юридического агента на открытой модели, который по внутренним критериям компании обходит GPT-5.5 и Claude Opus 4.8 на due diligence и меморандумах.
- Intercom дообучил модель поддержки Fin Apex на миллиардах диалогов: она решает больше обращений, чем топовые модели, и дешевле в эксплуатации при почти двух миллионах обращений в неделю.
Почему это важно
Материал документирует сдвиг: для узких, но массовых бизнес-задач дешёвая дообученная открытая модель на практике обходит универсальные топовые модели, причём не в лабораторном тесте, а в реальной эксплуатации у крупных компаний. Это меняет расчёт «просто взять топовую модель через API» на «дообучить свою» там, где задача повторяется миллионы раз.
Кому это важно
В первую очередь, компаниям с большим объёмом однотипных, повторяющихся задач: финансовый анализ документов (Bridgewater), юридические агенты (Harvey), клиентская поддержка (Intercom). Также, командам, которые считают unit-экономику ИИ-продукта и упираются в стоимость обращения к топовой модели при больших объёмах.
Как это применить
Схема из материала: взять открытую модель подходящего размера, собрать закрытые данные компании по конкретной задаче (разметку экспертов, историю диалогов, каталог примеров), превратить рабочий процесс в оцениваемую метрику и дообучить модель методом reinforcement learning против этой метрики. На выходе, узкий специалист дешевле и часто точнее универсальной топовой модели именно на своей задаче.
Можно ли доверять
Цифры по трём компаниям (Bridgewater, Harvey, Intercom), это заявления самих компаний и авторов материала, без независимой проверки методологии. По тесту на разбор каталога в обсуждении на Hacker News звучал скептицизм: бенчмарк, судя по всему, создан теми же авторами, что публикуют результат, а модель дообучалась напрямую против его функции оценки, то есть модель училась именно на том, на чём её затем измеряли, что завышает разрыв с топовыми моделями, не видевшими этот конкретный бенчмарк.
Риски и подводные камни
Такие дообученные модели узкоспециализированы: они выигрывают на конкретной повторяющейся задаче, но не заменяют топовую модель там, где нужны новые рассуждения или незнакомые ситуации. Сравнение идёт с «лучшей топовой конфигурацией» без раскрытия деталей промптинга и настройки конкурента, что затрудняет независимую проверку. Восемь дополнительных кейсов упомянуты только как факт существования, без деталей, что не позволяет оценить, насколько широко приём работает за пределами трёх разобранных примеров.
«Никакие промпты не заставили топовые модели надёжно усвоить это внутреннее чутьё.»
— из материала Fermisense о кейсе Bridgewater