Компания DeepMind выпустила новую версию своей модели для генерации музыки — Lyria 3.5. Инструмент уже доступен пользователям в рамках сервиса Google Flow Music. Главный акцент в этом релизе сделан не на радикальном изменении архитектуры, а на качестве звучания и предоставлении пользователям большего контроля над творческим процессом.
Генерация аудио с помощью искусственного интеллекта долгое время сталкивалась с двумя серьезными проблемами. Во-первых, это «пластмассовый» звук и неестественные переходы в мелодиях. Во-вторых, отсутствие предсказуемости: пользователь писал текстовый запрос (prompt) и получал случайный результат, который было почти невозможно точечно отредактировать. Развитие линейки Lyria показывает, как индустрия постепенно решает эти задачи.
В версии 3.5 разработчики заявляют о значительном улучшении музыкальности. Нейросеть теперь способна создавать более богатые и сложные мелодические структуры, которые звучат естественно. Это означает, что переходы между куплетами и припевами или смена ритма должны стать более плавными и логичными с точки зрения музыкальной теории.
Отдельное внимание уделено текстам и вокалу. Модель стала лучше понимать структуру песни и точнее следовать исходному запросу при генерации слов. Само звучание голоса получило больше эмоциональных оттенков и нюансов. Разработчики также поработали над произношением, что критически важно для восприятия песни слушателем.
Однако самым важным нововведением для тех, кто пытается использовать ИИ в реальной работе, стало расширение творческого контроля. Теперь пользователи могут управлять темпом композиции и ее продолжительностью. Ранее отсутствие таких базовых настроек делало генеративные модели скорее игрушкой, чем рабочим инструментом.
Появление функций точного контроля в Lyria 3.5 — это сигнал о том, что аудиомодели переходят на новый этап развития. Индустрия постепенно отходит от концепции «нажми кнопку и получи готовую песню», двигаясь в сторону создания гибких помощников для музыкантов и продюсеров. Возможность задать точный темп открывает двери для использования сгенерированных фрагментов в профессиональных цифровых звуковых рабочих станциях (DAW).
Пока рано судить, насколько бесшовной окажется интеграция таких инструментов в традиционный музыкальный продакшн. Время покажет, смогут ли алгоритмы полностью избавиться от артефактов генерации, которые все еще слышны тренированному уху. Тем не менее, шаг за шагом генеративный ИИ становится все более понятным и управляемым инструментом в руках создателей контента.