Synthesia создала интерактивный ИИ-аватар автора материала TechCrunch

Synthesia, стартап по генерации видео-аватаров (изначально из Великобритании, среди конкурентов D-ID, HeyGen, Colossyan), в этом году достигший оценки в $4 млрд, а годом ранее заявивший о выручке свыше $100 млн в год. Ранее компания уже сделала интерактивный аватар своего главы по корпоративным связям Александра Войки для общения с прессой. В сентябре Synthesia пригласила автора материала TechCrunch в новый офис в Нью-Йорке и предложила сделать такой же аватар, по словам компании, это первый подобный случай для журналиста и вообще для кого-либо, кроме самого Войки.
В мини-студии внутри офиса сняли серию фотографий и двухминутную запись голоса. На основе этого материала команда Synthesia за пару дней собрала четыре аватара: два «персональных», они просто зачитывают заданный текст, и два «интерактивных», способных слушать вопросы и отвечать; каждый вариант сделан в очках и без. Технологический стек интерактивного аватара, это связка из модели распознавания речи, агентной языковой модели, модели синтеза речи и видеомодели, которая анимирует лицо во время разговора; видео- и голосовые модели у аватара, собственные разработки Synthesia, но клиентам компания также позволяет подключать сторонние модели голоса и языка, Cartesia, ElevenLabs, Google или OpenAI. Хостинг аватара можно разместить в облаке клиента или доверить самой Synthesia.
Интерактивный аватар автора детерминированный: он обучен исключительно на её (его) статье о том, почему стартапы с венчурным финансированием чаще совершают мошенничество, чем стартапы без него, и на любые другие вопросы просто перенаправляет собеседника к этой теме. У Synthesia в целом три типа продуктов: платформа для создания и распространения обычных видео со сценарием, агентная платформа Sessions для опросов и ролевых тренировок (включая недавно запущенный продукт Roleplay Sessions для отработки, например, продажных питчей) и API-платформа, где видео- и голосовые модели можно комбинировать с другими сервисами для сборки собственных интерактивных аватаров.
Персональный аватар показали друзьям, те нашли его интересным, но жутковатым, а голос не слишком похожим на настоящий. Мать автора назвала результат «потрясающим» и вместе с отцом пыталась подловить аватар вопросами, ответы на которые «знали бы только они», но модель каждый раз просто отсылала их обратно к статье про мошенничество в стартапах. «Я не помню, чтобы рожала вас двоих», пошутила мать после теста.
Опыт натолкнул автора на размышления о будущем журналистики: готовы ли люди, чтобы новости им зачитывал ИИ-аватар вместо человека? Один из опрошенных инвесторов сразу ответил «нет». Автор отмечает, что доверие, ключевая часть профессии журналиста, и его вряд ли можно передать искусственному интеллекту, хотя вне журналистики идея «клонировать себя», например, чтобы аватар отвечал на вопросы, пока человек в отпуске, выглядит привлекательной для корпоративного применения. Автор также предупреждает, что, в отличие от детерминированных аватаров вроде его собственного, недетерминированные версии на основе чат-ботов, способных «фантазировать» произвольно, рискуют вызывать у пользователей своего рода «ИИ-психоз».
Ключевые факты
- Synthesia (оценка $4 млрд, выручка свыше $100 млн в год) сделала для автора материала TechCrunch четыре аватара: два персональных (читают заданный текст) и два интерактивных (слушают и отвечают), каждый в очках и без
- Интерактивный аватар детерминированный, обучен только на статье автора о мошенничестве в венчурных стартапах и на любые другие вопросы просто перенаправляет к этой теме
- Технологии: связка voice-to-text, агентной языковой модели, text-to-voice и видеомодели Synthesia; клиенты могут подключать сторонние модели голоса и языка от Cartesia, ElevenLabs, Google или OpenAI
- Мать автора назвала аватар «потрясающим» и пыталась подловить его вопросами, которые могла знать только она, но модель каждый раз перенаправляла разговор к статье
- Автор поднимает вопрос о будущем журналистики: готовы ли зрители к новостям от ИИ-аватара вместо человека, один из опрошенных инвесторов сразу ответил «нет»
Почему это важно
История показывает, насколько далеко продвинулась коммерциализация видео-аватаров: Synthesia уже оценивается в $4 млрд и зарабатывает свыше $100 млн в год, а её продукты вышли за рамки классических «зачитывающих сценарий» роликов, компания строит интерактивные, агентные аватары для тренингов, PR и потенциально других применений.
Кому это важно
Компаниям, которые используют обучающие видео и тренировку продажных питчей (продукт Roleplay Sessions), PR-отделам, рассматривающим аватары как альтернативу личному общению с прессой (как в случае с Александром Войкой), разработчикам, которые могут собирать похожие продукты через API Synthesia с внешними голосовыми моделями, и журналистам, которым приходится думать о том, как ИИ-аватары могут повлиять на их профессию.
Как это применить
Создание аватара заняло у команды Synthesia пару дней и потребовало фотосессии и двухминутной записи голоса; итоговый интерактивный аватар можно сделать детерминированным (отвечает строго по заданной теме) или подключить к нему сторонние модели голоса и языка через API; хостинг доступен как на облаке клиента, так и на инфраструктуре Synthesia.
Можно ли доверять
Материал, личный опыт автора TechCrunch, который получил аватар бесплатно по приглашению самой Synthesia во время визита в её офис; это скорее демонстрационный кейс от лица издания, чем независимый тест, а отзывы (друзья, родители) носят анекдотический характер, а не систематическую оценку качества.
Риски и подводные камни
Автор прямо указывает на риск: недетерминированные версии подобных аватаров, построенные на чат-ботах без ограничений, могут провоцировать у пользователей своеобразный «ИИ-психоз», а сама идея представлять новости или общаться с прессой через аватар вместо живого человека уже вызывает отторжение, один из инвесторов, опрошенных автором, сразу отверг такую возможность, ссылаясь на важность доверия в журналистике.
«Я не помню, чтобы рожала вас двоих»
— мать автора материала, после теста интерактивного аватара