Multimodal AI
Определение
Мультимодальный AI — системы, способные обрабатывать и генерировать данные разных типов: текст, изображения, аудио, видео — одновременно.
Простое объяснение
Это AI, который понимает всё сразу: и текст, и картинки, и звук — как человек, который может читать, смотреть и слушать одновременно.
Подробнее
Примеры мультимодальных моделей:
- GPT-4o — текст, изображения, аудио
- Gemini — нативно мультимодальный
- Claude 3 — текст + изображения
- CLIP — связь текста и изображений
Тренд: переход от single-modal к универсальным моделям.
Связанные термины
Outpainting
Outpainting — расширение границ изображения за пределы оригинала с генерацией нового контента, соответствующего стилю и содержанию.
Image-to-Image
Image-to-Image (img2img) — генерация нового изображения на основе входного с учётом текстового промпта и степени изменения.
Foundation Model
Фундаментальная модель — большая AI-модель, предобученная на огромных объёмах данных, которая может быть адаптирована для множества различных задач.
Prompt Engineering
Промпт-инжиниринг — искусство и наука составления эффективных запросов (промптов) к AI-моделям для получения качественных результатов.
