Суть
Подразделение Google DeepMind представило SL2T (sign-language-to-text) — многоязычную модель машинного перевода, способную преобразовывать язык жестов в текстовый формат в реальном времени. Технология уже интегрирована в клавиатуру Gboard и приложение Live Transcribe на смартфонах Pixel 11, позволяя пользователям использовать жесты вместо традиционного набора текста. На старте поддерживается перевод с американского жестового языка (ASL) на английский.
Контекст
В то время как технологии распознавания устной речи за последние десятилетия совершили огромный скачок, более 200 жестовых языков, которыми пользуются около 70 миллионов человек по всему миру, оставались вне фокуса ИИ-индустрии.
A person signs with one hand while holding a smartphone, demonstrating the Gboard sign-to-text dictation feature.
Исторически прогресс в этой области тормозился из-за фундаментальных заблуждений и технических сложностей. Жестовые языки — это не визуальная калька разговорной речи, а полноценные независимые языки со своей грамматикой и лексикой. Кроме того, передача смысла в них происходит через одновременное движение рук, тела, головы и мимики лица, что требует сложных систем компьютерного зрения с высокой частотой кадров.
Детали и техническая реализация
Модель SL2T обучалась на массиве данных объемом более 100 000 часов, охватывающем свыше 50 жестовых языков (около четверти датасета составил ASL). Совместное обучение на разных языках и диалектах позволило модели выявить общие базовые структуры, что значительно повысило точность перевода по сравнению с одноязычными системами.
Ключевой особенностью архитектуры является подход к обработке данных и приватности. SL2T не анализирует сырой видеопоток. Вместо этого локальная модель на устройстве (MediaPipe Holistic) отслеживает геометрические координаты ключевых точек на теле пользователя. На сервер для перевода отправляются только эти обезличенные координаты, а само видео немедленно удаляется.
Кроме того, разработчики отказались от использования промежуточных аннотаций (так называемых «глоссов»), которые применялись в ранних исследованиях. Модель переводит последовательность координат напрямую в текст. Это позволяет учитывать нелинейные аспекты языка, такие как пространственные конструкции и неручные маркеры (мимику).
Анализ
Прямой перевод от координат к тексту решает сразу несколько проблем. Во-первых, он снимает искусственные ограничения словарного запаса, присущие системам на базе глоссов. Во-вторых, использование метаданных вместо видео снижает вычислительную нагрузку при передаче данных и полностью снимает вопросы приватности, что критически важно для массового внедрения технологии в потребительские устройства.
На академическом бенчмарке FLEURS-ASL модель достигла показателя в 70 баллов BLEURT (zero-shot), что является рекордным результатом для подобных систем. Разработчики также уделили внимание практическим аспектам: снижению задержки при потоковой передаче, предотвращению галлюцинаций при отсутствии жестов, а также адаптации для левшей (которые составляют около 10% пользователей) и распознаванию жестов одной рукой.
Перспектива
Интеграция SL2T в мобильные операционные системы — это лишь первый шаг к созданию универсальной доступности цифровой среды. В будущем DeepMind планирует расширить поддержку других жестовых языков, портировать функцию на большее количество устройств и начать работу над обратным процессом — генерацией языка жестов из текста с использованием передовых возможностей больших языковых моделей (LLM).