GPT-5.6 Sol снизил расход токенов на 21, 36% в финансовых агентах Model ML

GPT-5.6 Sol снизил расход токенов на 21, 36% в финансовых агентах Model ML

Model ML, платформа для финансовых команд, которую основали братья Арни и Чез Энглендер: после двух успешных выходов из бизнеса они начали инвестировать через собственный семейный офис и, как это часто бывает у предпринимателей, писали программы для себя, из них выросла нынешняя платформа. Её агенты проводят финансового специалиста через весь процесс: от исходного запроса, через исследование и расчёты, до готовой презентации PowerPoint или таблицы Excel. Центральный агент планирует работу, выбирает нужные инструменты, сверяет данные, выполняет вычисления и направляет каждый шаг той модели, которая подходит лучше всего, чаще всего это GPT-5.6 Sol. Среди инструментов, собственная система Model ML для создания «родных» файлов PowerPoint и Excel с прослеживаемыми источниками данных.

В собственном тесте Model ML под названием Composite, который прогоняет заявку от исходного брифа через исследование и расчёты до готовой презентации или таблицы, а затем проверяет цифры, источники, формулы, структуру и визуальное качество, GPT-5.6 Sol использовала на 21% меньше токенов на одну презентацию PowerPoint, чем модель Fable 5, и на 36% меньше токенов на одну таблицу Excel, чем модель Opus 5. По PowerPoint GPT-5.6 Sol завершила рабочий процесс в 100% тестовых случаев против 76% у Opus 5 и прошла введённый Model ML «порог профессиональной готовности» (проверку, готов ли результат к содержательному разбору) в 43,3% случаев против 26,7% у Opus 5, разрыв в 16,6 процентного пункта. Модель также обошла Opus 5 по качеству презентаций, соответствию брифу, иерархии слайдов и единообразию оформления.

Экономия сказалась и на реальных задачах. В одной крупной управляющей компании подготовка индивидуальной инвестиционной справки (tearsheet), на которую у аналитика раньше уходил примерно час, теперь занимает около пяти минут. В другом случае агенты Model ML за один проход обработали виртуальные комнаты данных (data room) объёмом больше 100 000 строк и сотни файлов.

Model ML называет свой продукт независимым от интерфейса (surface-agnostic): финансист может начать работу с письма или в приложении Model ML, а продолжить в плагинах для Microsoft Office, не объясняя задачу заново. Это касается и готового результата, платформа движется к интерактивным результатам в браузере, которые остаются связаны с моделями и исходными данными: например, в инвестиционной сводке можно перейти к финансовой модели, стоящей за конкретной цифрой, и работать с агентом прямо на этой странице.

К нынешней конфигурации агентной инфраструктуры компания пришла через совместные сессии с OpenAI на месте: команды проследили, как агент планирует презентации, выбирает инструменты и удерживает контекст, и по итогам донастроили инструкции агента и правила подключения наборов инструментов. По словам Энглендера, «готовность к настоящей работе означает, что пользователь может сразу перейти к содержательной проверке: цифры отслеживаются до источника, таблица пересчитывается, слайд редактируется». Он же отмечает: «PowerPoint, Excel и Word создавались для мира, где интеллектуальная работа делалась вручную. ИИ изменил это допущение, теперь меняется и само программное обеспечение».

По итогам тестов Composite Model ML расширила использование GPT-5.6 Sol в продакшене, заменив ей в части рабочих процессов более раннюю модель Opus 4.8. В самой статье не указаны ни дата публикации, ни цена, ни сроки доступности GPT-5.6 Sol, ни то, проверялись ли результаты Model ML независимой стороной.

Ключевые факты

  • GPT-5.6 Sol использует на 21% меньше токенов на презентацию PowerPoint, чем Fable 5, и на 36% меньше токенов на таблицу Excel, чем Opus 5, по тесту Model ML Composite.
  • По PowerPoint GPT-5.6 Sol завершила рабочий процесс в 100% тестов против 76% у Opus 5 и прошла «порог профессиональной готовности» Model ML в 43,3% случаев против 26,7% у Opus 5 (разрыв 16,6 процентного пункта).
  • В одной управляющей компании подготовка инвестиционной справки сократилась с часа до пяти минут; агенты Model ML за один проход обработали данные объёмом свыше 100 000 строк и сотни файлов.
  • Model ML, платформа для финансовых команд, основанная братьями Арни и Чезом Энглендер; её агенты создают редактируемые файлы PowerPoint и Excel с прослеживаемыми источниками.
  • По итогам тестов Model ML расширила применение GPT-5.6 Sol в продакшене, заменив ей часть рабочих процессов, которые раньше вела Opus 4.8.

Почему это важно

Кейс показывает не абстрактный бенчмарк, а результат применения GPT-5.6 Sol в реальном коммерческом агентном продукте для финансовой отрасли: модель сравнивают напрямую с Opus 5 и Fable 5 на задачах, которые требуют точности, цифры, формулы, прослеживаемые источники, а не только связного текста. Такими историями клиентов OpenAI показывает разработчикам агентов, чем новая модель отличается от предыдущих на практике, а не только в общих бенчмарках.

Кому это важно

Финансовым аналитикам и командам сделок, которые готовят презентации и модели для клиентов и инвестиционных комитетов; компаниям, которые строят собственных ИИ-агентов поверх моделей OpenAI и выбирают, какую модель маршрутизировать на какой шаг; управляющим компаниям и семейным офисам, рассматривающим похожие инструменты для документооборота.

Как это применить

Model ML встраивает GPT-5.6 Sol в собственный агентный контур: центральный агент планирует работу, выбирает инструменты, сверяет данные и вызывает нужную модель на каждом шаге. Работу можно начать в письме или в приложении Model ML и продолжить в плагинах для Office без повторного объяснения задачи. Для похожих задач стоит проверять модель не на одном показателе, а на всём цикле, от брифа до готового файла, как это делает тест Composite, и учитывать расход токенов на результат, а не только точность.

Можно ли доверять

Все цифры, из собственного теста Model ML (Composite), результаты которого публикует OpenAI как историю успеха клиента; независимой проверки цифр в статье нет. Методика теста раскрыта не полностью, известно только, что для PowerPoint она охватывает «сотни» сгенерированных презентаций. Две из четырёх цитат в статье не подписаны именем, а для двух других не уточняется, кто именно из братьев Энглендер, Арни или Чез, их произнёс. Дата публикации и стадия доступности GPT-5.6 Sol в тексте не указаны.

Риски и подводные камни

Заявленная экономия токенов и рост «профессиональной готовности» получены поставщиком продукта на собственном бенчмарке, это не независимый тест. Ни цена, ни условия доступа к GPT-5.6 Sol, ни сроки в статье не названы. Сам текст подчёркивает, что финансовый специалист обязан проверять предположения, источники и итоговое сообщение, прежде чем поделиться работой с клиентом или командой сделки, то есть даже с ростом автоматизации человеческая проверка остаётся обязательной.

«Готовность к настоящей работе означает, что пользователь может сразу перейти к содержательной проверке. Цифры отслеживаются до источника, таблица пересчитывается, слайд редактируется.»

— Энглендер, сооснователь Model ML