Архитектура без энкодеров: Google выпустила мультимодальную модель Gemma 4 12B для локальной работы
Google DeepMind представила Gemma 4 12B — открытую ИИ-модель, которая обрабатывает текст, изображения и звук напрямую, без промежуточных энкодеров, и требует всего 16 ГБ памяти.

Google DeepMind анонсировала выпуск Gemma 4 12B. Это мультимодальная модель среднего размера, спроектированная специально для локальной работы на потребительских устройствах. Главная инженерная особенность новинки — полный отказ от традиционных энкодеров для обработки звука и изображений, что существенно снижает потребление памяти и ускоряет работу.
Контекст: проблема «посредников»
До сих пор разработчикам приходилось искать компромисс между компактными моделями для граничных вычислений (edge computing) и тяжелыми решениями на базе смеси экспертов (MoE), требующими серверного оборудования.
Традиционные мультимодальные модели исторически полагаются на отдельные модули — энкодеры. Их задача состоит в том, чтобы перевести пиксели изображений или звуковые волны в векторные представления, понятные языковой модели. Наличие этих дополнительных нейросетей-посредников неизбежно увеличивает задержку при генерации ответа и требует резервирования дополнительного объема видеопамяти.

Gus Martins
Детали архитектуры Gemma 4 12B
Инженеры Google решили проблему радикально, интегрировав обработку аудио и видео напрямую в основу больших языковых моделей (LLM):
- Зрение: Визуальный энкодер заменен на легковесный модуль эмбеддингов. Он состоит всего из одного матричного умножения, позиционного кодирования и нормализации. Вся тяжелая работа по визуальному анализу переложена на саму языковую модель.









