Gemini 3.5 Transcribe: как Google улучшает голосовой ввод и что это значит для пользователей
Gemini 3.5 Transcribe распознаёт речь на 70% быстрее, убирает слова-паразиты и поддерживает 85 языков. Разбираем, где модель уже работает, какие у неё ограничения и кому она подойдёт.
Google представила новую модель распознавания речи Gemini 3.5 Transcribe. Она приходит на смену Chirp 3 и решает три задачи: ускоряет преобразование речи в текст, снижает количество ошибок и автоматически очищает сказанное от слов-паразитов. Модель уже работает в функции Rambler на смартфонах Pixel 11 и в приложении Gemini для macOS. Разработчики получат доступ через AI Studio и Gemini API.
Главное изменение касается скорости. Gemini 3.5 Transcribe обрабатывает аудио примерно на 70% быстрее предшественника. Уровень ошибок при распознавании живой речи снижен с 7,32% у Chirp 3 до 5,5%. Это заметный шаг вперёд для голосового ввода, который долгое время уступал ручному набору по точности и удобству.
Модель поддерживает 85 языков и умеет различать до трёх говорящих в записанном аудио. Для пользователей это означает меньше ручной правки после диктовки и возможность работать с многоязычными записями без смены инструмента.
Что такое Gemini 3.5 Transcribe и почему это важно
Gemini 3.5 Transcribe - это модель машинного обучения, которая переводит устную речь в письменный текст. Она входит в экосистему Gemini и ориентирована на повседневные сценарии: диктовка сообщений, заметок, расшифровка встреч и интервью, голосовое управление.
Проблема традиционного распознавания речи в том, что люди говорят не так, как пишут. В устной речи много повторов, пауз, слов-паразитов и оговорок. Обычные системы переносят всё это в текст, и пользователю приходится тратить время на вычистку. Gemini 3.5 Transcribe меняет подход: модель редактирует сказанное на лету, выдавая более чистый и читаемый текст.
Это важно для тех, кто использует голосовой ввод в работе: журналистов, аналитиков, менеджеров, студентов. Чем меньше ручной правки, тем быстрее готов итоговый документ.
Ключевые улучшения по сравнению с Chirp 3
Конкретные цифры выглядят так:
- Скорость обработки выросла примерно на 70%.
- Уровень ошибок при живой речи снижен с 7,32% до 5,5%.
- Автоматическое удаление «э-э», «м-м» и других слов-паразитов.
- Исправление оговорок без участия пользователя.
- Поддержка специализированной лексики из пользовательского словаря.
- Распознавание до трёх говорящих в одном аудиофайле.
- Поддержка 85 языков.
Снижение ошибок на 1,82 процентных пункта может показаться небольшим, но на длинных записях это десятки исправленных слов. Для человека, который расшифровывает часовое интервью, разница между 7% и 5,5% ошибок - это несколько минут ручной правки.
Отдельно стоит выделить работу с пользовательским словарём. Если вы регулярно диктуете термины, названия продуктов или фамилии, модель запоминает их и перестаёт путать с похожими словами. Это снижает количество систематических ошибок, которые сложнее всего вылавливать при вычитке.
Где уже работает Gemini 3.5 Transcribe
Модель доступна в двух продуктах Google. Первый - функция Rambler на смартфонах Pixel 11. Rambler обрабатывает голосовой ввод в реальном времени, и теперь делает это быстрее и точнее. Второй - приложение Gemini для macOS, где модель используется для диктовки и расшифровки аудио.
Google анонсировала расширение доступности: в будущем Gemini 3.5 Transcribe появится в браузере Chrome и других продуктах компании. Точные сроки не названы, но обычно Google сначала обкатывает новые модели на своих устройствах, а затем распространяет на более широкую аудиторию.
Для пользователей Pixel 11 это уже реальность. Остальным придётся подождать или попробовать модель через API.
Доступ для разработчиков
Разработчики могут подключить Gemini 3.5 Transcribe через два канала: AI Studio и Gemini API. AI Studio - это веб-инструмент Google для экспериментов с моделями, где можно протестировать распознавание без написания кода. Gemini API - полноценный программный интерфейс для интеграции модели в свои приложения и сервисы.
Такой подход позволяет встроить распознавание речи в CRM-системы, сервисы транскрипции, чат-ботов и другие продукты. Для бизнеса это способ автоматизировать расшифровку звонков, совещаний и клиентских обращений без разработки собственной модели.
Если вас интересует, как Google развивает другие направления экосистемы Gemini, посмотрите разбор обновлений Gemini Intelligence или материал о Gemini 3.7 Flash.
Ограничения и подводные камни
Главное ограничение модели заложено в её преимуществе. Gemini 3.5 Transcribe редактирует сказанное: убирает слова-паразиты, исправляет оговорки, делает текст более гладким. Для бытового голосового ввода это удобно. Для задач, где важна дословная передача речи, это проблема.
Представьте юридическую консультацию или медицинский приём. Если модель «исправит» оговорку или уберёт паузу, смысл сказанного может измениться. В таких сценариях нужна не чистота текста, а максимальная точность. Пользователь должен понимать: Gemini 3.5 Transcribe - это инструмент для быстрого ввода, а не для стенографирования.
Ещё один момент - доступность. Модель пока работает только на Pixel 11 и в приложении для macOS. Пользователи Android на других устройствах и владельцы Windows не могут её использовать. Расширение на Chrome и другие продукты анонсировано, но без конкретных дат.
Стоит учитывать и то, что данные о точности и скорости основаны на внутренних тестах Google. Независимые сравнения появятся позже, и реальные показатели могут отличаться.
Что это значит для пользователей и рынка
Для обычных пользователей Gemini 3.5 Transcribe означает более быстрый и удобный голосовой ввод. Меньше ошибок - меньше времени на исправления. Автоматическая очистка речи убирает рутину, которая раздражает при диктовке длинных текстов. Поддержка 85 языков расширяет аудиторию, которая может пользоваться моделью на родном языке.
Для бизнеса это возможность сократить затраты на транскрипцию. Расшифровка интервью, совещаний, звонков поддержки - трудоёмкий процесс. Модель, которая делает это быстрее и с меньшим количеством ошибок, экономит часы работы сотрудников.
Для рынка распознавания речи это усиление конкуренции. Google делает ставку на скорость и очистку текста. Другие игроки развивают свои сильные стороны: OpenAI недавно представила GPT Transcribe с фокусом на низкую цену и высокую скорость обработки файлов. Whisper от OpenAI остаётся открытой альтернативой, о которой мы писали в отдельном разборе.
Сравнение с аналогами
Прямое сравнение моделей распознавания речи затруднено: компании используют разные методики тестирования и метрики. По данным теста AA-WER, Google Gemini 3 Pro показывает 2,9% ошибок, ElevenLabs Scribe v2 - 2,3%, а GPT Transcribe от OpenAI - 3,31%. Gemini 3.5 Transcribe с её 5,5% ошибок при живой речи находится в другой категории: это модель для потокового распознавания, а не для обработки заранее записанных файлов.
Ключевое отличие Google - автоматическое редактирование речи. Конкуренты чаще фокусируются на дословной точности, оставляя очистку пользователю. Какой подход лучше - зависит от задачи. Для заметок и сообщений удобнее вариант Google. Для судебных протоколов и научных расшифровок - дословные модели.
Google также развивает смежные технологии на Pixel 11. Например, перевод жестового языка в текст, о котором мы рассказывали в материале про SL2T. Вместе с Gemini 3.5 Transcribe это формирует комплексную систему доступности и голосового взаимодействия.
Заключение: стоит ли ждать Gemini 3.5 Transcribe?
Если вы пользуетесь Pixel 11 или работаете на macOS с приложением Gemini, модель уже доступна. Попробуйте продиктовать длинное сообщение или расшифровать запись встречи - разница с предыдущими версиями заметна по скорости и чистоте текста.
Если ваша задача - дословная расшифровка речи, Gemini 3.5 Transcribe может не подойти. Автоматическое редактирование меняет исходный текст, и для юридических или медицинских целей это риск. В таких случаях лучше использовать модели с фокусом на точность, а не на чистоту.
Для всех остальных модель заслуживает внимания. Google решает реальную проблему голосового ввода: текст после диктовки требует меньше правок. Это экономит время и делает голосовой ввод более привлекательной альтернативой клавиатуре. Расширение на Chrome и другие продукты сделает модель доступной широкой аудитории, и тогда можно будет оценить её в повседневной работе.