Google научила Pixel переводить жестовый язык в текст — сначала американский
Google DeepMind представила SL2T — модель перевода жестового языка в текст. На Pixel 11 она уже работает в клавиатуре Gboard и приложении Live Transcribe: пользователь может показать фразу в камеру вместо набора текста. Первый запуск ограничен переводом американского жестового языка на английский.
Это не функция «распознавания жестов» в привычном смысле. Жестовые языки имеют собственную грамматику и используют одновременно движения рук, корпуса и мимику. Поэтому, объясняет DeepMind, системе нужно не сопоставить отдельный жест с английским словом, а перевести полноценную визуальную фразу.
Телефон вместо клавиатуры
В Gboard модель позволяет жестами составить поисковый запрос, сообщение или текст документа. В Live Transcribe человек может ответить собеседнику жестами, не переключаясь на печать. Для глухих и слабослышащих пользователей это важнее очередного голосового помощника: знакомый способ общения появляется там, где раньше интерфейс требовал набора текста.
Пока говорить о всеобщем переводчике рано. Поддерживается только ASL, а английский — язык вывода. Google обещает расширять набор языков и устройств, но не называет сроки. Такие ограничения особенно существенны: американский жестовый язык не универсален и не является «английским руками».
Что камера отдаёт модели
SL2T обучали более чем на 100 000 часах материала из более чем 50 жестовых языков. На телефоне MediaPipe сначала выделяет координаты ключевых точек тела; в облако уходит эта геометрическая последовательность, а исходное видео, по версии Google, можно сразу удалить. Затем SL2T переводит движение непосредственно в текст, без промежуточного словаря отдельных жестов.
Компания также описывает ошибки: модель может путаться в редких жестах, быстром дактиле и некоторых конструкциях без контекста. Это важное напоминание для переписки, поиска и бытовых диалогов: технология уже может снять часть барьера, но не заменяет переводчика в ситуации, где цена ошибки высока.
Для рынка это редкий пример, когда новая мультимодальная модель сразу становится частью базового интерфейса телефона, а не остаётся демонстрацией. Проверять её стоит не по эффектным роликам, а по тому, насколько быстро Google добавит другие языки и сможет ли пользователь доверять переводу в реальных разговорах.












