Tencent Gander: как AI учится говорить и работать одновременно
Tencent Gander ведёт живой разговор и параллельно выполняет задачи в фоне: разбираем архитектуру «мозжечок + мозг», перебивание в 8% случаев на Full-Duplex-Bench v3, слабые места модели и планы открыть код.
Что такое Tencent Gander и почему о ней говорят
Tencent Gander - исследовательская AI-модель, которая одновременно ведёт живой разговор и выполняет сложные задачи в фоне. Пока пользователь говорит, модель ищет файлы, пишет код или исправляет ошибки, не прерывая беседу. Разработкой занимается команда Tencent's Hunyuan Speech вместе с исследователями из нескольких университетов (The Decoder, 20 сентября 2026).
Суть в одном предложении: раньше голосовые ассистенты либо говорили, либо работали. Привычные помощники обрабатывают запрос по шагам - сначала слушают, потом отвечают, и только затем берутся за задачу, если попросить отдельно. Gander совмещает оба процесса: разговор идёт своим ходом, а фоновая работа не ставит его на паузу.
Агентские задачи, о которых говорят разработчики, - это работа, которую AI выполняет сам, шаг за шагом: находит нужные файлы, пишет код, проверяет результат. Пользователь при этом может перебить модель или изменить задачу прямо по ходу разговора, не дожидаясь, пока она договорит.
Стадия проекта ранняя. Репозиторий с кодом уже существует, а веса модели и данные обучения команда только планирует открыть. До продукта, который можно поставить на смартфон, пока далеко.
Кто стоит за разработкой Gander
Gander сделала команда Tencent's Hunyuan Speech совместно с исследователями из нескольких университетов. Tencent - одна из крупнейших технологических компаний Китая, но конкретно этот проект остаётся исследовательским, а не коммерческим продуктом.
Практический вывод: за моделью стоит лаборатория с опытом в обработке речи, поэтому результаты стоит воспринимать серьёзно, но с оговоркой. Это научная работа, а не релиз сервиса, который завтра появится в подписке.
Почему это не просто ещё один голосовой ассистент
Ключевое отличие Gander от привычных ассистентов в параллельности. Siri, Alexa и голосовой режим ChatGPT работают последовательно: слушают, отвечают, выполняют. Пока идёт длинная задача, диалог фактически замирает.
В Gander диалог и работа идут одновременно. Модель обрабатывает речь, изображения и текст в одном потоке. Уточнить задачу можно на любом шаге, и фоновая работа от этого не остановится.
Как устроена архитектура Gander: «мозжечок» и «мозг»
Внутри модели две роли, и их названия подсказывают, кто за что отвечает.
«Мозжечок»: диалог в реальном времени
«Мозжечок» (cerebellum) держит разговор. Он разбивает речь на односекундные сегменты, поэтому модель постоянно обрабатывает короткие куски и быстро реагирует на новые реплики. Такая нарезка позволяет пользователю вмешаться в любой момент: система замечает это почти сразу, а не после того, как договорит заранее заготовленный ответ.
«Мозг»: сменный исполнитель сложных задач
«Мозг» (brain) берёт на себя фоновую работу: поиск файлов, написание кода, исправление багов. Его можно заменить на сторонние агентские системы, например Codex или Claude Code, и переобучать диалоговую часть для этого не нужно. В тестах роль «мозга» исполняла неуказанная модель из семейства OpenAI GPT-5.6.
Гибкость здесь практичная: разговорная часть и рабочая часть независимы. Если завтра появится более сильный агент, его можно подключить, не ломая диалог. Как подбирать модель под конкретную задачу агента и какие настройки API при этом экономят деньги, разбираем в материале GPT-5.6 для стартапов: как собрать быстрого и недорогого AI-агента.
Функциональная аналогия простая: «мозжечок» - диспетчер, который всегда на связи, а «мозг» - исполнитель, которого нанимают под задачу.
Как это работает на практике: перебивание и смена задачи на ходу
Сценарий выглядит так. Пользователь просит найти файлы в папке и начинает говорить о другом. Фоновый агент продолжает работу, а «мозжечок» отвечает на новую реплику. Если нужно, модель сама задаёт уточняющий вопрос или сообщает о прогрессе, не дожидаясь запроса.
Пример с кодом: пользователь просит исправить баг, затем по ходу разговора добавляет требование совместимости с Python 3.12, и оба условия попадают в одну задачу. Второй пример: модель ждёт появления конкретного слайда в презентации и при этом поддерживает беседу.
Ценность в том, что не нужно ставить разговор на паузу, чтобы уточнить детали. Но помнить о статусе: это исследовательская модель, а не готовый продукт для повседневной работы.
Результаты тестов: где Gander выигрывает и где уступает
Что показывает Full-Duplex-Bench v3
Full-Duplex-Bench v3 - это бенчмарк, то есть набор стандартизированных тестов, для живого диалога. Он проверяет, как модель ведёт себя, когда пользователь может перебивать, а ответ должен следовать быстро. Один из измеряемых показателей - как часто модель перебивает человека сама.
На этом тесте Gander перебивала пользователя лишь в 8% случаев, реже конкурентов, включая GPT-Realtime. Меньше перебиваний означает, что модель не навязывается и даёт договорить.
Сравнение с GPT-Realtime и другими конкурентами
Расстановка сил неоднозначная. По вежливости в диалоге Gander впереди: 8% перебиваний против более высоких значений у соперников. По точности выполнения задач модель уступала конкурентам (The Decoder).
Это компромисс, а не победа по всем пунктам: сильнее в разговоре, слабее в результате работы. Какая модель лучше в целом, зависит от задачи, а сравнение шло в исследовательских условиях, а не в массовом продукте. Итог работы «мозга» зависит и от его настроек: на другом тесте два параметра API помогли GPT-5.6 втрое улучшить результат на бенчмарке ARC-AGI-3.
Слабые места Gander: что пока не работает
- Понимание видео и аудио: в тестах модель показала здесь слабые результаты.
- Точность выполнения задач: Gander уступала конкурентам.
- Стадия проекта: это исследовательская модель, а не готовый сервис.
- Открытость: веса и данные обучения ещё не выпущены, команда только планирует это сделать.
- Условия тестов: роль «мозга» исполняла неуказанная модель из семейства OpenAI GPT-5.6, и это могло повлиять на итоговые цифры.
Что это значит на практике: ждать, что Gander завтра заменит рабочего ассистента, не стоит. Направление при этом перспективное, и часть ограничений связана со зрелостью проекта, а не с самой идеей.
Открытые веса, код и что это значит для рынка
Репозиторий с кодом Gander уже существует на GitHub, а команда планирует открыть веса модели и данные обучения (The Decoder). Если планы выполнят, исследователи и разработчики смогут изучать архитектуру и предлагать улучшения, а не разбирать только статью с описанием.
Открытость стала заметным трендом в AI: она ускоряет проверку результатов и снижает порог входа для небольших команд. Здесь важно не забегать вперёд, потому что пока это планы, а не опубликованные файлы.
Куда движутся ассистенты, видно по самой идее Gander: разговор и работа перестают мешать друг другу. Для пользователя это означает меньше ожидания и меньше переключений между окнами.
Что это значит для вас: простыми словами
Gander - шаг к ассистентам, которые не заставляют ждать и не мешают работать. Даже если вы не программист, тренд касается вас: AI учится вести себя естественнее в общении и полезнее в делах.
Бытовой пример: вы обсуждаете с ассистентом план поездки, он параллельно ищет билеты и отели, а вы прямо в разговоре меняете даты и добавляете условие про багаж. Ничего не нужно перезапускать и повторять заново.
Сегодня это исследование. Направление понятное: ассистент становится участником разговора и исполнителем одновременно. Следить за такими новостями полезно, чтобы не потеряться в потоке сообщений об AI и понимать, какие изменения действительно меняют работу.
Коротко: главное о Tencent Gander
- Gander - исследовательская AI-модель Tencent, которая ведёт диалог и выполняет задачи в фоне одновременно.
- Разработала её команда Tencent's Hunyuan Speech вместе с исследователями из нескольких университетов.
- Архитектура делится на «мозжечок» (разговор в реальном времени, односекундные сегменты) и «мозг» (фоновые агентские задачи).
- «Мозг» можно заменить на Codex или Claude Code без переобучения диалоговой части.
- На Full-Duplex-Bench v3 модель перебивала пользователя в 8% случаев, реже конкурентов, включая GPT-Realtime.
- По точности выполнения задач Gander уступала, а в понимании видео и аудио показала слабые результаты.
- Репозиторий с кодом уже есть, веса и данные обучения команда планирует открыть.
Есть вопрос или заметили неточность? Напишите нам.