DeepMind представила модель SL2T для прямого перевода языка жестов в текст
Новая нейросеть позволяет глухим и слабослышащим людям использовать язык жестов для ввода текста на смартфонах, начиная с Pixel 11. Модель обучена на 50 языках и работает без передачи видео на сервер.

Суть
Подразделение Google DeepMind представило SL2T (sign-language-to-text) — многоязычную модель машинного перевода, способную преобразовывать язык жестов в текстовый формат в реальном времени. Технология уже интегрирована в клавиатуру Gboard и приложение Live Transcribe на смартфонах Pixel 11, позволяя пользователям использовать жесты вместо традиционного набора текста. На старте поддерживается перевод с американского жестового языка (ASL) на английский.
Контекст
В то время как технологии распознавания устной речи за последние десятилетия совершили огромный скачок, более 200 жестовых языков, которыми пользуются около 70 миллионов человек по всему миру, оставались вне фокуса ИИ-индустрии.

A person signs with one hand while holding a smartphone, demonstrating the Gboard sign-to-text dictation feature.
Исторически прогресс в этой области тормозился из-за фундаментальных заблуждений и технических сложностей. Жестовые языки — это не визуальная калька разговорной речи, а полноценные независимые языки со своей грамматикой и лексикой. Кроме того, передача смысла в них происходит через одновременное движение рук, тела, головы и мимики лица, что требует сложных систем компьютерного зрения с высокой частотой кадров.
Детали и техническая реализация
Модель SL2T обучалась на массиве данных объемом более 100 000 часов, охватывающем свыше 50 жестовых языков (около четверти датасета составил ASL). Совместное обучение на разных языках и диалектах позволило модели выявить общие базовые структуры, что значительно повысило точность перевода по сравнению с одноязычными системами.
Ключевой особенностью архитектуры является подход к обработке данных и приватности. SL2T не анализирует сырой видеопоток. Вместо этого локальная модель на устройстве (MediaPipe Holistic) отслеживает геометрические координаты ключевых точек на теле пользователя. На сервер для перевода отправляются только эти обезличенные координаты, а само видео немедленно удаляется.
Кроме того, разработчики отказались от использования промежуточных аннотаций (так называемых «глоссов»), которые применялись в ранних исследованиях. Модель переводит последовательность координат напрямую в текст. Это позволяет учитывать нелинейные аспекты языка, такие как пространственные конструкции и неручные маркеры (мимику).

Изображение из источника
Анализ
Прямой перевод от координат к тексту решает сразу несколько проблем. Во-первых, он снимает искусственные ограничения словарного запаса, присущие системам на базе глоссов. Во-вторых, использование метаданных вместо видео снижает вычислительную нагрузку при передаче данных и полностью снимает вопросы приватности, что критически важно для массового внедрения технологии в потребительские устройства.
На академическом бенчмарке FLEURS-ASL модель достигла показателя в 70 баллов BLEURT (zero-shot), что является рекордным результатом для подобных систем. Разработчики также уделили внимание практическим аспектам: снижению задержки при потоковой передаче, предотвращению галлюцинаций при отсутствии жестов, а также адаптации для левшей (которые составляют около 10% пользователей) и распознаванию жестов одной рукой.
Перспектива
Интеграция SL2T в мобильные операционные системы — это лишь первый шаг к созданию универсальной доступности цифровой среды. В будущем DeepMind планирует расширить поддержку других жестовых языков, портировать функцию на большее количество устройств и начать работу над обратным процессом — генерацией языка жестов из текста с использованием передовых возможностей больших языковых моделей (LLM).
TL;DR
Главное
DeepMind выпустила модель SL2T, которая переводит язык жестов в текст напрямую из координат движений тела, обеспечивая высокую точность и приватность.
Ключевые факты
- /Обучена на 100 000 часах данных для 50+ жестовых языков.
- /Использует координаты точек тела (MediaPipe Holistic), а не видеопоток.
- /Отказ от промежуточных аннотаций (глоссов) улучшил понимание пространственной грамматики.
- /Доступна в Gboard и Live Transcribe на Pixel 11.
Инсайт
Обучение модели сразу на множестве жестовых языков позволило ей выявить общие базовые структуры, благодаря чему она работает точнее, чем модели, обученные только на одном языке.



