Voice AI
Определение
Голосовой AI — технологии распознавания речи (Speech-to-Text), синтеза речи (Text-to-Speech) и голосовых ассистентов.
Простое объяснение
Это AI, который умеет слушать и говорить: понимает твои слова и отвечает голосом, как живой собеседник.
Подробнее
Компоненты Voice AI:
- ASR — распознавание речи (Whisper)
- TTS — синтез голоса (ElevenLabs)
- Voice cloning — клонирование голоса
- Voice assistants — Siri, Alexa, Google Assistant
Применение: колл-центры, озвучка, доступность.
Связанные термины
Whisper
Whisper — открытая модель распознавания речи от OpenAI, способная транскрибировать и переводить аудио на 99 языках.
Replicate
Replicate — платформа для запуска open-source AI-моделей через API без необходимости управления инфраструктурой.
GPU
Graphics Processing Unit — специализированный процессор, изначально созданный для графики, но оказавшийся идеальным для обучения нейросетей благодаря способности выполнять тысячи параллельных вычислений.
Stable Diffusion
Stable Diffusion — открытая модель генерации изображений по текстовому описанию, ставшая основой экосистемы AI-инструментов для творчества.
