Google запускает перевод с жестового языка на текст: как это изменит общение глухих и слышащих

Google запускает перевод с жестового языка на текст: как это изменит общение глухих и слышащих

Google DeepMind запустила SL2T — модель, которая переводит жестовый язык в текст в реальном времени прямо на смартфоне. Узнайте, как это работает, где доступно и какие ограничения есть у технологии.

Google DeepMind представила модель SL2T (sign-language-to-text), которая в реальном времени переводит американский жестовый язык (ASL) в английский текст. Технология уже встроена в приложения Gboard и Live Transcribe на смартфонах Pixel 11. Пользователь направляет камеру на себя, показывает жесты, и система преобразует их в текст. Это первая модель такого типа, работающая прямо на устройстве без отправки видео в облако.

Для людей, которые общаются на жестовом языке, это меняет повседневные сценарии: набор сообщений, поиск в интернете, общение с голосовым ассистентом Gemini. Вместо того чтобы печатать каждое слово, можно просто показать жест. Технология пока поддерживает только пару ASL-английский, но сам подход задаёт направление для будущих разработок.

В этой статье разберём, как работает SL2T, где её можно использовать, какие у неё ограничения и как Google планирует развивать перевод жестового языка.

Что такое SL2T и как она работает?

SL2T - это модель машинного обучения, которую разработала Google DeepMind. Её задача - переводить американский жестовый язык в английский текст в реальном времени. В отличие от систем, которые распознают речь, здесь входные данные - это движения тела, рук и мимика. Жестовые языки устроены иначе, чем звуковые: в них смысл передаётся через форму руки, положение в пространстве, направление движения и выражение лица.

Модель обучалась на 100 000 часах видео с более чем 50 жестовыми языками. Это дало ей базу для понимания общих принципов жестовой коммуникации. Однако рабочая версия сейчас сфокусирована на ASL и английском тексте. Такой подход позволяет сначала отточить качество на одной языковой паре, а затем масштабировать на другие.

Принцип работы: от жеста к тексту

Камера смартфона захватывает движения пользователя. Модель определяет 130 ключевых точек на лице, теле и руках. Эти координаты преобразуются в текст. Видео не сохраняется и не передаётся: система анализирует только положение точек. Это снижает нагрузку на процессор и защищает приватность. Обработка происходит локально на устройстве, поэтому данные не покидают смартфон.

Такой подход принципиально отличается от распознавания по видеопотоку. Видео содержит много лишней информации: фон, одежду, освещение. Координаты точек - это компактное представление движения, достаточное для распознавания жеста. Мимика и движения корпуса учитываются, потому что в ASL они несут грамматическую нагрузку.

Где доступна технология?

SL2T встроена в два приложения на смартфонах Pixel 11: клавиатуру Gboard и приложение Live Transcribe. В Gboard пользователь может показывать жесты вместо набора текста. В Live Transcribe жесты преобразуются в текст, который виден собеседнику на экране. Это позволяет вести диалог между глухим и слышащим человеком без посредников.

Пока технология работает только с ASL и английским языком. Пользователи, которые общаются на русском жестовом языке или других национальных жестовых языках, не смогут использовать её напрямую. Google заявляет о планах расширить поддержку, но конкретные сроки не называет.

Как включить перевод жестового языка на Pixel 11

Чтобы воспользоваться функцией, нужно открыть Gboard или Live Transcribe на Pixel 11. В Gboard следует выбрать режим перевода жестового языка и направить камеру на себя. Система начнёт распознавать жесты и выводить английский текст в поле ввода. В Live Transcribe текст отображается крупно на экране, что удобно для диалога лицом к лицу.

Функция может быть доступна не во всех регионах. Google обычно разворачивает новые возможности постепенно, поэтому на части устройств обновление может прийти позже. Если режим не отображается, стоит проверить наличие последней версии приложений и системного обновления.

Подробнее о том, как Google DeepMind встроила перевод жестового языка в Gboard и Live Transcribe, читайте в разборе SL2T на Pixel 11.

Точность и ограничения: что нужно знать

В тестах FLEURS-ASL модель показывает точность 70–74 балла. Это рабочий результат, но не идеальный. Система ошибается на редких знаках, числах и сложных грамматических конструкциях. Быстрая пальцевая речь, когда буквы показываются одна за другой, тоже вызывает трудности. Для пользователя это означает, что текст может содержать неточности, особенно в начале использования.

Есть и технические ограничения. Модель не поддерживает жесты длиннее 60 секунд. Региональные варианты ASL распознаются хуже, потому что обучающие данные не покрывают все диалекты равномерно. Иногда система галлюцинирует, то есть выдаёт текст, не соответствующий показанному жесту. Это стоит учитывать при важных разговорах.

Почему возникают ошибки?

Жестовые языки разнообразны. Внутри ASL существуют региональные варианты, возрастные особенности и индивидуальные стили. Один и тот же смысл можно показать разными способами. Обучающая выборка, даже в 100 000 часов, не может покрыть все вариации. Пальцевая речь особенно сложна: буквы сменяются быстро, и границы между ними размыты.

Числа и грамматические конструкции требуют точного распознавания мелких движений. Ошибка в одной точке может изменить смысл. Поэтому модель пока лучше работает с медленной и чёткой жестовой речью. При быстрой беседе точность падает.

Как технология создавалась совместно с сообществом глухих

Google DeepMind вела разработку SL2T совместно с сообществом глухих. Это не формальное консультирование: представители сообщества участвовали на всех этапах, от сбора данных до тестирования. Такой подход помог учесть культурные и лингвистические особенности ASL, которые неочевидны для слышащих разработчиков.

Жестовый язык - это не просто набор движений. В нём есть своя грамматика, идиомы и культурный контекст. Без участия носителей модель могла бы распознавать жесты формально, но упускать смысл. Совместная разработка снижает этот риск и повышает доверие к технологии со стороны тех, для кого она создана.

Похожий подход к распознаванию речи реализован в открытой нейросети Whisper от OpenAI, которая обучалась на 680 000 часах аудиоданных и распознаёт речь с точностью, близкой к человеческой.

Влияние на общение глухих и слышащих

SL2T снижает барьер между жестовым и звуковым языками. Глухой человек может показать жест на камеру смартфона, и собеседник увидит текст на экране. Это работает в магазинах, на работе, в образовании, в государственных учреждениях. Раньше для такого диалога требовался переводчик или письменные заметки. Теперь достаточно смартфона.

Технология полезна и для слышащих, которые не знают жестового языка. Они могут читать текст, который генерирует система, и отвечать голосом или письменно. Это шаг к равенству в цифровой среде: глухие пользователи получают тот же уровень доступа к коммуникации, что и слышащие.

Примеры использования в реальной жизни

В видеозвонках глухой пользователь может показывать жесты, а собеседник видит текст в реальном времени. В классе студент может использовать SL2T для конспектирования лекций. На приёме у врача пациент показывает жесты, и врач читает текст на экране. В кафе можно заказать еду, показав жест, и официант увидит текст.

Эти сценарии не требуют от второй стороны специальных навыков. Достаточно смотреть на экран. Это принципиально меняет доступность общения: переводчику не обязательно присутствовать лично, а письменные заметки больше не нужны.

Голосовые технологии развиваются в том же направлении. Например, GigaChat Audio от Сбера уже распознаёт эмоции по голосу и запоминает ключевые факты из диалогов, что улучшает клиентский сервис и автоматизацию совещаний.

Будущее технологии: планы Google

Google планирует расширять поддержку языков и устройств. Следующий логичный шаг - добавление других жестовых языков: британского, французского, русского. Каждый из них имеет собственную грамматику и требует отдельной настройки модели. Обучение на 50 языках уже создало базу, но тонкая настройка под конкретный язык займёт время.

Технология может быть интегрирована в другие сервисы Google: видеовстречи, переводчик, умные очки. Если SL2T появится в Google Meet, глухие участники смогут показывать жесты, а остальные - видеть текст. Это расширит сценарии удалённой работы и образования. Пока это планы, но направление задано.

Распознавание речи тоже продолжает развиваться. OpenAI недавно представила GPT Transcribe, которая обрабатывает аудио в 34 раза быстрее реального времени с точностью 3,31% по метрике AA-WER.

Заключение: шаг к более инклюзивному общению

SL2T - первая модель, которая переводит жестовый язык в текст в реальном времени прямо на смартфоне. Она доступна на Pixel 11 в Gboard и Live Transcribe, поддерживает ASL-английский и работает локально без передачи видео. Точность 70–74 балла оставляет место для ошибок, особенно на редких знаках и быстрой пальцевой речи.

Технология создавалась совместно с сообществом глухих, что повышает её соответствие реальным потребностям. Влияние на общение глухих и слышащих уже заметно: диалог без переводчика становится возможным в повседневных ситуациях. Google планирует расширять поддержку языков и устройств, и это может сделать перевод жестового языка таким же привычным, как распознавание речи.

Следите за развитием технологии в ленте новостей об искусственном интеллекте. Есть вопрос или заметили неточность? Напишите нам - мы открыты к диалогу.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции