Tencent представила Gander, модель, которая говорит и одновременно решает задачи в фоне

Tencent представила Gander, модель, которая говорит и одновременно решает задачи в фоне

Tencent's Hunyuan Speech team вместе с исследователями из нескольких университетов представила Gander, модель, которая одновременно принимает речь, изображения и текст и способна вести разговор, не прерываясь на решение сложных задач. По словам разработчиков, сегодняшние голосовые ассистенты в основном говорят по очереди с пользователем, тогда как в живом разговоре люди перебивают друг друга, дают короткую реакцию и слушают, продолжая говорить. Gander устроен так, чтобы справляться именно с этим: он непрерывно обрабатывает видео, речь и текст, даже когда говорит сам, пользователь может вмешаться в любой момент, а модель, сама задать уточняющий вопрос или сообщить о ходе работы без запроса.

Авторы делят систему на две роли по аналогии с человеческой анатомией, «мозжечок» и «мозг». «Мозжечок» отвечает за разговор в реальном времени, «мозг», за рассуждение и сложные фоновые задачи. По их аргументации, одной модели трудно одновременно быть быстрой и хорошо рассуждать, поэтому работа разделена. «Мозг» можно заменить на агентную систему вроде Codex или Claude Code без переобучения разговорной части; в тестах эту роль играла неназванная модель из семейства GPT-5.6 от OpenAI. По мере того как базовая модель для «мозга» становится сильнее, выигрывает вся система.

«Мозжечок» делит разговор на односекундные отрезки и на их основе решает, слушать, говорить или замолчать, если пользователь перебивает, без отдельного модуля для определения начала и конца речи, используя как память примерно последние две минуты разговора. Специального бенчмарка для моделей такого типа пока не существует, поэтому исследователи взяли устоявшийся тест Full-Duplex-Bench v3, проверяющий голосовых ассистентов на разных сценариях. По отчёту, у Gander лучший результат по времени реакции: модель начинает говорить в нужный момент во всех 100 сценариях и перебивает пользователя в 8% случаев, против 13,5% у GPT-Realtime и почти 48% у самого слабого из конкурентов. Авторы отмечают, что Gander использует сравнительно небольшую модель, но конкурирует с такими коммерческими системами, как GPT-Realtime, Gemini Live и Grok.

По точности решения задач Gander немного отстаёт: тест оценивает систему целиком, поэтому ошибки распознавания и синтеза речи тоже засчитываются против неё, а «мозг» показывает результат заметно лучше, если получает текст напрямую. Хуже обстоит дело и с пониманием видео и звука: в одном из тестов Gander уступил собственной базовой модели, что исследователи объясняют обучением, которое отдаёт приоритет плавности разговора в ущерб точности восприятия, например, в задачах на подсчёт объектов и их поиск на изображении.

Gander обучен примерно на 2,7 млн примеров, часть которых учит модель молчать при фоновом шуме или когда в групповом разговоре обращаются не к ней. Сами исследователи называют работу ранней: как масштабировать Gander дальше, открытый вопрос, а стандартного способа оценивать подобные системы пока не существует. Команда планирует опубликовать веса модели и обучающие данные после завершения процесса перехода в открытый доступ; репозиторий с кодом на GitHub уже есть, там же выложены демонстрации.

Gander выходит вслед за июльским релизом Tencent, открытой языковой моделью Hy3, которая, как сообщалось, сократила отставание от конкурентов, особенно в агентных задачах, и уже работает в WorkBuddy, Yuanbao и WeChat. Параллельно Tencent ведёт переговоры о получении крупнейшей доли в агентном стартапе Manus, после того как власти Китая заблокировали его покупку компанией Meta; в Tencent считают сделку удачно вписывающейся в собственные планы, включая агента, встроенного в WeChat.

Другие компании тоже делят агентную работу между моделями через оркестраторы: у OpenAI система GPT-Live отделяет разговор от рассуждения, передавая веб-поиск и агентные задачи фоновой модели, пока продолжается диалог; у Sakana AI модель Fugu вызывает другие модели из расширяемого пула. OpenAI также тестирует проактивных агентов, которые сами создают последующие задачи и обращаются к пользователю без запроса. Обработка перебиваний и задержек остаётся практической проблемой: по данным анализа Anthropic, опытные пользователи перебивают Claude Code примерно в 9% рабочих шагов против примерно 5% у новичков, а команды, разрабатывающие голосовых и текстовых диалоговых агентов, по данным одного из опросов, особенно часто жалуются на задержки.

Ключевые факты

  • Gander совмещает разговор в реальном времени с фоновым решением сложных задач через связку «мозжечок» (диалог) и сменный «мозг» (рассуждение); «мозг» можно заменить на Codex или Claude Code без переобучения
  • На бенчмарке Full-Duplex-Bench v3 Gander начинает говорить вовремя во всех 100 сценариях и перебивает пользователя в 8% случаев, против 13,5% у GPT-Realtime и почти 48% у самого слабого конкурента
  • Модель отстаёт по точности решения задач и хуже собственной базовой модели справляется с пониманием видео и звука
  • Gander обучен примерно на 2,7 млн примеров; Tencent планирует опубликовать веса и обучающие данные, код уже выложен на GitHub
  • Разработка идёт на фоне переговоров Tencent о крупнейшей доле в агентном стартапе Manus и распространения открытой модели Hy3 в WeChat, WorkBuddy и Yuanbao

Почему это важно

Gander предлагает конкретное архитектурное решение старой проблемы голосовых ассистентов: разговор в реальном времени и сложное рассуждение плохо совмещаются в одной модели. Разделение на быстрый «мозжечок» и сменный «мозг», не единственный такой подход: OpenAI делает похожее в GPT-Live, отделяя разговор от фоновой модели, которая занимается веб-поиском и агентными задачами, а Sakana AI в Fugu вызывает другие модели из расширяемого пула. Это складывается в заметный тренд: агентные системы всё чаще строят не как одну модель, а как связку специализированных компонентов.

Кому это важно

Разработчикам голосовых и диалоговых ассистентов и агентных систем, Gander показывает рабочую схему разделения ролей и обещает открытые веса. Компаниям, использующим Codex или Claude Code как основу для агентных задач, именно такие системы Tencent называет кандидатами на роль «мозга». Самой Tencent, Gander встраивается в её более широкую агентную стратегию рядом с Hy3 и предполагаемой сделкой по Manus.

Как это применить

Пока применить можно ограниченно: веса и обучающие данные Tencent обещает выпустить только после завершения «процесса перехода в открытый доступ», конкретной даты нет. Уже сейчас доступен репозиторий с кодом на GitHub и демонстрации на странице проекта, с них можно начать знакомство с архитектурой. Ключевая практическая идея, которую можно перенять уже сейчас: «мозг» отделён от разговорного слоя и заменяем без переобучения, это описанный в отчёте архитектурный паттерн, применимый и к другим агентным системам.

Можно ли доверять

Материал написан по техническому отчёту Tencent, источник полный, не тонкий и не деградированный. Заявленные результаты проверены на признанном тесте Full-Duplex-Bench v3, хотя специального бенчмарка именно для таких гибридных систем пока не существует, это ограничение признают сами авторы. В отчёте не раскрыты число параметров, вычислительный бюджет, конкретные университеты-участники и точная версия модели GPT-5.6, игравшей роль «мозга» в тестах, пересказ явно называет эти пробелы, а не додумывает их.

Риски и подводные камни

Заявленное преимущество Gander касается только тайминга разговора: по точности решения задач модель уступает конкурентам, а понимание видео и звука у неё хуже, чем у собственной базовой модели, сами исследователи признают это платой за плавность диалога. Обещание открыть веса и данные привязано к нечёткому «процессу перехода в открытый доступ» без даты, так что раннее решение о переходе на Gander может остаться без опоры на публичные веса ещё долго. Исследователи прямо называют работу ранней и не считают вопрос масштабирования решённым.

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.