Запуск Gemini 3.8 Live с функцией Live Avatar: визуальное воплощение разговорного ИИ

DeepMind представила технологию Live Avatar, которая добавляет динамический визуальный образ к голосовому ИИ, обеспечивая мультимодальное взаимодействие в реальном времени.

Обновлено:
2 мин чтения
0 просмотров
Запуск Gemini 3.8 Live с функцией Live Avatar: визуальное воплощение разговорного ИИ

Компания DeepMind представила обновление для своей языковой модели — Gemini 3.8 Live с функцией Live Avatar. Это решение объединяет возможности ведения диалога в реальном времени с потоковым видео с низкой задержкой. В результате искусственный интеллект получает визуальное воплощение, способное слушать, видеть и отвечать пользователю от лица динамичного персонажа.

Развитие больших языковых моделей (LLM) закономерно движется в сторону мультимодальности. На прошлой неделе состоялся релиз голосовой версии Gemini 3.8 Live, а теперь разработчики добавили к ней визуальный слой. Естественное человеческое общение опирается не только на текст и звук, но и на мимику, жесты и зрительный контакт. Интеграция этих элементов в корпоративные системы — следующий логичный шаг в эволюции пользовательских интерфейсов.

an image with the phrase "Gemini 3.8 Live with Live Avatar"

an image with the phrase "Gemini 3.8 Live with Live Avatar"

Техническая реализация Live Avatar включает в себя несколько важных достижений. Во-первых, система обеспечивает точную синхронизацию движения губ (lip-sync) и естественную смену выражений лица. Во-вторых, модель поддерживает 97 языков, причем переключение между ними может происходить прямо посреди разговора без потери качества видеоряда.

Особого внимания заслуживает функция асинхронного вызова инструментов (asynchronous tool calling). Аватар может выполнять сложные фоновые задачи, например, искать информацию в базе данных или оформлять бронирование, не прерывая при этом живой диалог с пользователем. Для корпоративных клиентов предусмотрена возможность создания собственных аватаров на основе качественного референсного изображения с сохранением фирменного стиля.

Изображение из источника

Изображение из источника

Появление таких технологий открывает новые возможности для бизнеса, особенно в сфере обслуживания клиентов и интерактивного обучения. Доступность функции в рамках пакета Gemini Enterprise указывает на то, что целевой аудиторией продукта являются крупные компании, нуждающиеся в масштабируемых решениях для автоматизации коммуникаций. Внедрение невидимых водяных знаков SynthID в аудио и видео гарантирует прозрачность использования ИИ-контента.

В перспективе мы можем увидеть массовый переход от текстовых чат-ботов к полноценным цифровым консультантам. Успех этой технологии будет зависеть от того, насколько естественно алгоритмы смогут справляться с задержками при обработке сложных запросов и насколько пользователи будут готовы к взаимодействию с фотореалистичными, но искусственными собеседниками. Пока рано судить о полномасштабном влиянии, но направление развития индустрии обозначено предельно четко.

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

TL;DR

Главное

Интеграция генерации видео в реальном времени с языковой моделью позволяет создавать интерактивных цифровых агентов, способных вести естественный диалог.

Ключевые факты

  • /Поддержка 97 языков с точной синхронизацией движения губ в реальном времени.
  • /Асинхронное выполнение фоновых задач без прерывания речевого потока.
  • /Встроенная защита сгенерированного контента с помощью водяных знаков SynthID.
  • /Доступность корпоративным клиентам через платформу Gemini Enterprise.

Инсайт

Ключевая инновация кроется не в анимации лица, а в способности системы параллельно обрабатывать визуальные данные, вести диалог и обращаться к внешним API, сохраняя иллюзию непрерывного человеческого общения.

Источник:Deepmind

Читайте также

Гайды по теме