Выпуск EmbeddingGemma 2: мультимодальная модель для локального поиска от Google DeepMind
Google DeepMind представила EmbeddingGemma 2 — открытую мультимодальную модель на 740 млн параметров для создания векторных представлений и работы непосредственно на устройствах.

Суть
Исследователи из Google DeepMind представили EmbeddingGemma 2. Это открытая модель для создания эмбеддингов (векторных представлений), которая объединяет текст, код, изображения, видео и аудио в едином пространстве. Главная особенность релиза заключается в оптимизации модели для работы непосредственно на устройствах пользователей, что позволяет создавать приложения с высоким уровнем конфиденциальности данных.
Контекст
В прошлом году была представлена первая версия EmbeddingGemma, предназначенная для работы с текстом. По данным компании, разработчики скачали ее более 20 миллионов раз для создания инструментов локального поиска и систем RAG (генерации с дополненной выборкой). Новая версия расширяет эти возможности, добавляя полноценную поддержку различных типов медиа и кода.

EmbeddingGemma 2
Детали
EmbeddingGemma 2 построена на архитектуре Gemma 4 и распространяется по коммерчески разрешительной лицензии Apache 2.0. Общий размер модели составляет 740 миллионов параметров. Архитектура является модульной: базовая текстовая часть требует 270 млн параметров, визуальный энкодер добавляет 170 млн, а аудио — 300 млн.
Ключевые технические характеристики:
- Эффективность хранения: Благодаря технологии Matryoshka Representation Learning (MRL), разработчики могут динамически сокращать размерность выходных векторов с 768 до 512, 256 или 128. Это обеспечивает до 6 раз экономии места в локальных векторных базах данных.
- Работа на устройстве: При использовании квантования на смартфоне Google Pixel 11 Pro модель потребляет около 191 МБ оперативной памяти для текстовых весов и около 567 МБ для полной мультимодальной версии.
- Контекстное окно: Увеличено в 4 раза по сравнению с первой версией — до 8 тысяч токенов. Это позволяет обрабатывать до 5.5 минут аудио, 29 изображений или 58 кадров видео напрямую на локальном оборудовании.
- Качество оценки: В тесте MTEB Code результат улучшился на 9.92 балла (с 68.76 до 78.68). Модель занимает лидирующие позиции среди мультимодальных энкодеров размером менее 1 млрд параметров в бенчмарках MTEB Code и MAEB (Massive Audio Embedding Benchmark).

Изображение из источника
Анализ
Развитие компактных моделей демонстрирует смещение фокуса индустрии в сторону локальных вычислений (edge computing). Возможность обрабатывать мультимодальные данные — например, искать видеоролик по голосовой заметке или анализировать часы аудиозаписей по текстовому запросу — без отправки данных на сервер критически важна для приложений, где приоритетом является приватность.
Модульная архитектура позволяет разработчикам гибко управлять ресурсами. Если приложению нужен только семантический поиск по тексту, нет необходимости загружать в память визуальные и звуковые модули.
Перспектива
Интеграция EmbeddingGemma 2 с широким спектром инструментов, включая Hugging Face, LiteRT, MediaPipe, WebGPU и llama.cpp, упрощает внедрение модели в мобильные и веб-приложения. В связке с генеративными моделями, такими как Gemma 4 (с которой новая модель делит текстовый токенизатор и аудиоэнкодер), разработчики смогут строить полноценные локальные конвейеры для обработки сложных данных с меньшим общим потреблением памяти. Это открывает путь к созданию автономных систем классификации, маршрутизации и поиска, работающих полностью в офлайн-режиме.
TL;DR
Главное
Google DeepMind выпустила компактную мультимодальную модель для создания векторных представлений, позволяющую организовать семантический поиск по тексту, аудио и видео локально на устройствах.
Ключевые факты
- /Модель содержит 740 млн параметров, из которых 270 млн отвечают за текст, 170 млн за зрение и 300 млн за аудио.
- /Контекстное окно составляет 8 тысяч токенов, вмещая до 5.5 минут аудио или 29 изображений.
- /При квантовании на Google Pixel 11 Pro полная версия требует около 567 МБ оперативной памяти.
- /Технология MRL позволяет сокращать размерность векторов, экономя до 6 раз больше места в базах данных.
Инсайт
Разделение модели на независимые модули для разных типов данных позволяет разработчикам собирать систему как конструктор, радикально снижая требования к памяти для узкоспециализированных задач.








