Thomson Reuters построила юридическую ИИ-модель Thomson на базе Qwen за $40 млн вместо аренды у OpenAI и Anthropic

Thomson Reuters построила юридическую ИИ-модель Thomson на базе Qwen за $40 млн вместо аренды у OpenAI и Anthropic

Компания Thomson Reuters выпустила «Thomson», свою первую собственную языковую модель для юридической работы, построенную на открытой модели Qwen3.5-397B от Alibaba. По словам компании, на разработку ушло около $40 млн: на зарплаты сотрудников и вычислительные мощности за более чем два года. Широко растиражированная цифра в $450 тыс. покрывает только финальный прогон обучения текущей версии, а не весь проект. Настоящий капитал за моделью, десятилетия контента сервисов Westlaw, Practical Law, Checkpoint и Reuters, а также рабочее время сотен профильных экспертов компании; пока в обучение вложено меньше 10% доступного контента.

Сначала вместе с Имперским колледжем Лондона (Imperial College) команда переобучила китайскую модель Qwen по безопасности, этике и политической нейтральности, эта промежуточная версия получила название «Snowdon» (в честь горы в Уэльсе). Затем последовало предобучение на собственном контенте компании, дообучение с участием профильных экспертов и агентное обучение с подкреплением внутри собственных рабочих инструментов компании. Технический директор Джоэл Хрон говорит, что команда «меняла отправную точку с открытым исходным кодом уже, наверное, около полудюжины раз»; руководитель исследований Джонатан Шварц добавляет, что главный результат, «не столько сама модель, сколько фабрика моделей, которую мы построили».

Собственные бенчмарки компании рисуют более сдержанную картину, чем маркетинговый пост. На Stanford LegalBench Thomson набирает 0,823 балла и уступает Gemini 3.1 Pro и GPT-5.5. На Harvey Legal Agent Benchmark модель идёт сразу за Opus 4.8. Thomson лидирует в следовании инструкциям и на сложном PrBench Legal, но заметно проседает в рассуждениях и особенно в написании кода. Сравнение к тому же неравное: Thomson соревнуется с использованием test-time scaling (наращивания вычислений на этапе ответа), тогда как GPT-5.5 в тесте работал без режима рассуждений.

На собственном бенчмарке компании Deep Research, при доступе только к вебу, Thomson показывает 0,53 балла фактической точности против 0,65 у GPT-5.4. И лишь при доступе к собственному контенту компании Thomson едва обгоняет GPT-5.4, 0,83 против 0,82. Руководитель отдела оценки Эндрю Бин признаёт: с доступом только к вебу Thomson «находится в диапазоне остальных моделей, но пока точно не лидер». По его словам, «большой прирост даёт именно возможность обучаться и практиковаться на собственных инструментах», том, чего у сторонних провайдеров нет. При этом показательно, что GPT-5.4 улучшается почти так же резко при доступе к тому же контенту: значит, доступ к данным даёт почти столько же, сколько специализированное обучение. Более новые модели компания не тестировала; преимущество Thomson может вырасти, если перейти на более сильную основу вроде Qwen3.8 и выйти далеко за отметку в 10% контента.

Почему строить модель самим, а не донастраивать модель OpenAI или Anthropic на юридических данных? Thomson Reuters называет три причины. Экономика: стандартная тонкая настройка «имеет сильную тенденцию ухудшать общие способности модели», говорит Шварц, а компания при этом остаётся привязанной к провайдеру по стоимости инференса и планам развития, тогда как небольшая собственная модель окупается именно на объёмной работе вроде проверки документов. Данные: прирост качества даёт именно обучение внутри собственных инструментов вроде Westlaw, это подтверждают бенчмарки, и компания не намерена открывать этот доступ никому. Накопительный эффект: Хрон сравнивает это с «арендой дома против покупки дома», «вы создаёте капитал в том, чем владеете сами, и с годами это накапливается», тогда как при работе со сторонними моделями эта ценность оседает у провайдера.

Подход работает для Thomson Reuters потому, что компания сочетает три редких фактора: эксклюзивные массивы данных, сотни штатных профильных экспертов и рабочие процессы, где качество можно измерить объективно. Для компаний с таким профилем, отмечается в материале, кейс показывает, что открытое сообщество отстаёт от лабораторий-лидеров всего на месяцы и что $40 млн может быть достаточно для конкурентоспособной специализированной модели. Компании же без собственных уникальных данных и без способа объективно оценивать результат, построив свою модель, по большей части просто получают постоянные расходы на её содержание. По словам Хрона, следующее конкурентное преимущество в ИИ «будет исходить из умения оркестрировать интеллект и понимания, какой именно интеллект достаточно важен, чтобы им владеть».

Первым делом Thomson заменит модель в функции Tabular Analysis сервиса CoCounsel Legal, где экономически оправдана именно небольшая и дешёвая модель. Продукт остаётся мультимодельным, администраторы могут переключаться между моделями; Thomson не задуман как оркестратор, а решает подзадачи вроде проверки цитирований. Данные клиентов в обучение не идут, заявляет компания. Уменьшенная версия модели с открытыми весами появится на Hugging Face под некоммерческой лицензией, следом выйдут технический отчёт и портал для разработчиков. По словам Хрона, уже идут ранние, пока ни к чему не обязывающие переговоры с юридическими фирмами о прямом лицензировании модели.

Ключевые факты

  • Thomson Reuters потратила около $40 млн за два с лишним года на создание своей ИИ-модели Thomson на базе Qwen3.5-397B от Alibaba; растиражированная цифра $450 тыс. покрывает только финальный прогон обучения.
  • Модель обучена на собственном контенте Westlaw, Practical Law, Checkpoint и Reuters и опыте сотен экспертов компании, но пока задействовано меньше 10% доступного контента.
  • На собственных бенчмарках компании Thomson уступает GPT-5.5, Gemini 3.1 Pro и Opus 4.8 по большинству показателей и заметно слабее в рассуждениях и коде, хотя лидирует в следовании инструкциям и на сложном PrBench Legal; преимущество появляется только при доступе к собственным инструментам компании, и тогда модель едва обгоняет GPT-5.4 (0,83 против 0,82).
  • Первое применение, функция Tabular Analysis в CoCounsel Legal; компания также готовит уменьшенную открытую версию модели для Hugging Face под некоммерческой лицензией и ведёт ранние переговоры о лицензировании с юридическими фирмами.
  • Причины строить модель самим: тонкая настройка чужих моделей ухудшает их общие способности и привязывает к провайдеру, доступ к собственным данным и инструментам не с кем делить, а владение моделью со временем накапливает ценность, по сравнению с арендой чужой.

Почему это важно

Это конкретный, подкреплённый цифрами пример того, что специализированную модель мирового уровня можно построить не в лаборатории ИИ, а в обычной компании, если у неё есть эксклюзивные данные, профильные эксперты и способ объективно измерять качество. Кейс Thomson Reuters показывает: открытые модели вроде Qwen отстают от передовых лабораторий на месяцы, а не годы, и $40 млн может хватить, чтобы закрыть этот разрыв в узкой нише за счёт данных, которых нет ни у кого другого.

Кому это важно

Юридическим и другим компаниям сферы профессиональных услуг с большими архивами эксклюзивного контента, которые взвешивают выбор между арендой моделей OpenAI/Anthropic и постройкой своей; клиентам и партнёрам Thomson Reuters, использующим CoCounsel Legal; разработчикам, которые получат уменьшенную открытую версию модели на Hugging Face.

Как это применить

Модель первой заменит используемый движок в функции Tabular Analysis сервиса CoCounsel Legal, продукт остаётся мультимодельным, и администраторы могут переключаться между моделями. Уменьшенная версия Thomson выйдет на Hugging Face под некоммерческой лицензией вместе с техническим отчётом и порталом для разработчиков; юридические фирмы уже могут вступить в переговоры о прямом лицензировании, они пока на раннем, необязывающем этапе.

Можно ли доверять

Цифры и цитаты в материале, из собственных бенчмарков и заявлений Thomson Reuters, а не независимой проверки, но компания не приукрашивает результат: её же руководитель по оценке прямо признаёт, что при доступе только к вебу модель «пока точно не лидер». При этом сравнение методологически неравное, Thomson тестировали с наращиванием вычислений на этапе ответа, а GPT-5.5 без режима рассуждений, и более новые модели-конкуренты компания не проверяла вовсе.

Риски и подводные камни

Преимущество Thomson над GPT-5.4 в лучшем сценарии, доли балла (0,83 против 0,82), и оно держится только при доступе к собственным инструментам компании; на открытом вебе и особенно в рассуждениях и коде модель заметно отстаёт от конкурентов. Подход требует редкого сочетания условий, эксклюзивных данных, сотен штатных экспертов и измеримого качества результата; без этого, признаёт сама компания, постройка своей модели обычно оборачивается для других компаний не конкурентным преимуществом, а постоянными расходами на поддержку.

«Вы создаёте капитал в том, чем владеете сами, и с годами это накапливается»

— Джоэл Хрон, технический директор Thomson Reuters