Google DeepMind выпустила SL2T, модель перевода жестового языка в текст

ИИ для устных языков за последние десятилетия шагнул далеко вперёд, автоматический перевод, диктовка, голосовые интерфейсы. Но эта революция обошла стороной жестовые языки: в мире их свыше 200, и ими пользуются примерно 70 миллионов глухих и слабослышащих людей. Прогресс в этой области шёл медленно по двум причинам. Во-первых, перевод устной речи, это последовательное отображение звука в текст одного и того же языка, а жестовые языки, самостоятельные языки со своей грамматикой и лексикой, поэтому здесь нужен полноценный машинный перевод, а не пословная замена знаков. Во-вторых, модель должна «видеть» и понимать физическое движение: смысл в жестовых языках передают одновременные движения рук, торса, головы и лица, и отслеживать это с высокой частотой кадров, тяжёлая задача компьютерного зрения. Поэтому ранние попытки вроде «жестовых перчаток» были обречены: жестовый язык, не «английский на пальцах».
Google DeepMind вместе с командой Android представили SL2T (sign-language-to-text), мультиязычную модель перевода жестового языка в текст. Она впервые выходит за пределы лаборатории и работает в потребительских продуктах: с неё запущена функция жестового ввода в Gboard и Live Transcribe на Pixel 11, для начала, с переводом американского жестового языка (ASL) на английский. Как и слышащие пользователи используют диктовку вместо набора текста, глухие пользователи теперь могут показывать жесты телефону вместо печати: искать в интернете, писать сообщения и документы, обращаться к Gemini с запросами и задачами. В Live Transcribe можно отвечать жестами прямо в разговоре, не переключаясь на печать. По словам тестировщиков Google, жестикулировать на ASL оказалось быстрее, естественнее и приятнее, чем печатать по-английски.
Модель обучена более чем на 100 000 часах данных по более чем 50 жестовым языкам, примерно четверть этого объёма, данные на ASL. Совместное обучение на разных языках, диалектах и уровнях владения языком, по данным Google, позволяет модели усваивать общие языковые закономерности и превосходить в экспериментах компании модели, обученные только на одном языке. Для защиты приватности SL2T не работает с самим видео: модель MediaPipe Holistic прямо на устройстве отслеживает координаты ключевых точек тела жестикулирующего человека, и на сервер для перевода уходят только эти геометрические координаты, исходное видео удаляется сразу же. SL2T переводит последовательность координат напрямую в текст, минуя промежуточную разметку «глоссами», которую использовали прежние модели: глоссы, по утверждению Google, не передают такие важные для жестовых языков элементы, как немануальные маркеры (мимика, положение тела) и пространственные конструкции.
По заявлению Google, SL2T, самая производительная на сегодня модель перевода жестового языка по ключевым бенчмаркам, включая FLEURS-ASL (sd-test), где модель показывает 70 баллов по метрике BLEURT в режиме zero-shot, значительно выше любого ранее опубликованного результата (конкретные цифры прежних моделей источник не приводит). Помимо самого бенчмарка, команда отдельно занималась практическими вещами: снижением задержки при потоковой обработке, предотвращением «галлюцинаций» модели на видео без жестов, честной работой для 10% жестикулирующих левшей и качеством распознавания жестикуляции одной рукой, актуально, когда вторая рука занята удержанием телефона.
Проект делался с участием глухого сообщества на всех этапах: идею предложил Сэм Сепа (Sam Sepah), глухой сотрудник Google, дальше шли сбор данных с глухими партнёрами, пользовательские исследования и оценка воздействия технологии силами глухих экспертов. Для ответственного внедрения Google создала консультативный совет AI Sign Language Advisory Committee (AISLAC), объединивший глухие организации и профильных экспертов со всего мира, и вместе с ним подготовила совместный отчёт о влиянии выпуска SL2T 1.0, с честным описанием возможностей и текущих ограничений модели; такой формат компания обещает повторять и для будущих релизов. Пока функция доступна только на Pixel 11, только для перевода ASL на английский и бесплатно; расширение на другие устройства и жестовые языки Google анонсирует без конкретных сроков.
Ключевые факты
- SL2T, мультиязычная модель перевода жестового языка в текст, впервые выведенная Google DeepMind и Android из лаборатории в потребительские продукты
- Функция уже работает в Gboard и Live Transcribe на Pixel 11: перевод американского жестового языка (ASL) на английский, бесплатно
- Модель обучена на более чем 100 000 часах данных по более чем 50 жестовым языкам (около четверти, данные на ASL) и показывает 70 баллов BLEURT на бенчмарке FLEURS-ASL (sd-test), заявленно выше любого прежнего результата
- Приватность обеспечена тем, что на сервер передаются только координаты ключевых точек тела с устройства (модель MediaPipe Holistic), а не само видео, которое удаляется сразу после обработки
- Проект развивался при участии глухого сообщества: идея принадлежит глухому сотруднику Google Сэму Сепе, создан консультативный совет AISLAC, опубликован совместный отчёт о влиянии технологии
Почему это важно
ИИ для устной речи развивался десятилетиями, но свыше 200 жестовых языков и примерно 70 миллионов глухих и слабослышащих людей, которые ими пользуются, эта революция обошла стороной. SL2T, первый случай, когда модель перевода жестового языка выходит из лаборатории в массовый потребительский продукт, а не остаётся исследовательским прототипом. Задача сложнее, чем перевод устной речи: жестовые языки, самостоятельные языки со своей грамматикой, и модели приходится одновременно решать задачу компьютерного зрения (отслеживание движений рук, тела, лица) и задачу полноценного машинного перевода.
Кому это важно
В первую очередь, глухим и слабослышащим пользователям ASL, которые получили инструмент диктовки жестами вместо печати текста; сейчас это доступно только владельцам Pixel 11. Также это важно для более широкого глухого сообщества по всему миру: Google обещает расширять число поддерживаемых жестовых языков и устройств, хотя сроков не называет. Наблюдать за проектом стоит и разработчикам в области доступности, Google описывает архитектурные решения (перевод с координат вместо глоссов, обучение сразу на 50+ языках) как основу для будущих релизов.
Как это применить
Функция уже доступна бесплатно на Pixel 11 в Gboard и Live Transcribe: можно показывать жесты вместо набора текста, искать в интернете, писать сообщения и документы, обращаться к Gemini с запросами, а в Live Transcribe, отвечать жестами прямо в разговоре. Пока поддерживается только перевод ASL на английский; Google говорит, что скоро появятся другие устройства и языки, но без конкретных дат.
Можно ли доверять
Источник, официальный блог Google DeepMind, и цифры (объём обучающих данных, состав команды, оценка на FLEURS-ASL) исходят от самой компании. Ключевое заявление о превосходстве («значительно выше любого ранее опубликованного результата») не подкреплено конкретными цифрами конкурирующих моделей, сравнить масштаб разрыва самостоятельно нельзя. При этом у проекта заметная методологическая опора на глухое сообщество: идея от глухого сотрудника Google, консультативный совет AISLAC с глухими организациями, совместный публичный отчёт о возможностях и ограничениях модели.
Риски и подводные камни
Реально работает пока только перевод ASL на английский на одном устройстве (Pixel 11); остальные 50+ жестовых языков, на которых обучена модель, пользователям пока не доступны, и сроков расширения источник не называет. Заявление о лучшем в отрасли результате на бенчмарке, самооценка Google без сопоставимых цифр конкурентов, поэтому масштаб превосходства проверить со стороны нельзя. Приватность обеспечена архитектурно (на сервер уходят только координаты точек тела, а не видео), но система всё равно требует постоянного доступа к камере устройства для отслеживания жестов.