Google представила Gemini 3.5 Transcribe: новый этап в распознавании речи
Google выпустила продвинутую модель распознавания речи, которая умеет фильтровать слова-паразиты, определять спикеров и напрямую взаимодействовать с другими нейросетями.
Google выпустила продвинутую модель распознавания речи, которая умеет фильтровать слова-паразиты, определять спикеров и напрямую взаимодействовать с другими нейросетями.
3 мин

Компания Google представила Gemini 3.5 Transcribe — новую модель преобразования речи в текст, созданную для интеллектуальных голосовых взаимодействий. В отличие от традиционных систем, которые просто фиксируют звуки, новинка способна очищать речь от слов-паразитов, форматировать текст на лету и напрямую передавать команды другим нейросетям.
Исторически системы распознавания речи (speech-to-text) сталкивались с фундаментальной проблемой: люди редко говорят идеально. Фоновый шум, запинки, самоисправления и слова-паразиты приводили к тому, что сырая транскрипция требовала значительной ручной редактуры. Предыдущее поколение моделей Google, такое как Chirp 3, хорошо справлялось с базовыми задачами, но индустрии требовался инструмент, понимающий контекст и намерения пользователя.

Text "Gemini 3.5 Transcribe" next to the Gemini spark, all on a blue background
Модель Gemini 3.5 Transcribe доступна разработчикам через два интерфейса прикладного программирования (API):
Технические показатели модели демонстрируют существенный прогресс. По данным Artificial Analysis, средняя доля ошибок в словах (Word Error Rate, WER) составляет 4.0% для потокового режима и 2.6% для обработки готовых файлов. На многоязычном бенчмарке FLEURS модель показывает WER на уровне 5.50% и 5.04% соответственно. Время до получения финального текста сократилось на 70% по сравнению с Chirp 3.
Среди ключевых возможностей выделяются:

Изображение из источника
Главное нововведение Gemini 3.5 Transcribe заключается в интеграции функции вызова внешних инструментов прямо из голосового потока. Это меняет парадигму: голос перестает быть просто способом ввода текста и становится полноценным интерфейсом управления. Пользователь может попросить систему сгенерировать изображение или проанализировать файл, и транскрибатор сам передаст нужные параметры соответствующей большой языковой модели (LLM).
Интеграция модели в повседневные продукты Google, такие как клавиатура Gboard (функция Rambler), приложение Gemini для macOS и браузер Chrome, показывает стремление компании сделать голосовое взаимодействие основным способом общения с искусственным интеллектом.
В ближайшем будущем мы увидим рост числа автономных голосовых агентов, способных вести естественный диалог без заметных задержек. По мере того как разработчики начнут внедрять Gemini 3.5 Transcribe через платформы вроде LiveKit или LangChain, граница между текстовыми промптами и обычным разговором с компьютером окончательно сотрется. Это откроет путь к созданию по-настоящему невидимых интерфейсов, где для решения сложных задач потребуется лишь произнести команду вслух.
Распознавание речи переходит от простой фиксации слов к смысловой обработке: новая модель Google не только транскрибирует, но и редактирует текст на лету, а также запускает внешние функции.
Главная ценность модели не в точности распознавания, а в том, что голос становится полноценным интерфейсом для управления другими нейросетями без промежуточного текстового этапа.