Hcompany представила NeoMME: эффективный мультимодальный и мультиязычный энкодер
Компания Hcompany выпустила семейство компактных моделей NeoMME (260M и 800M параметров) для мультимодального извлечения признаков и поиска визуальных документов.
Компания Hcompany выпустила семейство компактных моделей NeoMME (260M и 800M параметров) для мультимодального извлечения признаков и поиска визуальных документов.
2 мин

Компания Hcompany анонсировала выпуск нового семейства моделей под названием NeoMME. Это мультимодальные (multimodal-native) и мультиязычные базовые энкодеры, разработанные для эффективного дообучения и логического вывода (inference).
В основе линейки лежат две основные модели размером 260 миллионов и 800 миллионов параметров. Несмотря на относительно компактный размер, они предназначены для решения сложных задач, связанных с обработкой как текстовой, так и визуальной информации.
Архитектура NeoMME представляет собой единую башню (single-tower). Такой подход позволяет модели обрабатывать различные типы данных в рамках одной нейронной сети, что снижает вычислительные затраты и упрощает процесс интеграции по сравнению с системами, использующими отдельные модули для текста и изображений.
На платформе Hugging Face уже доступна коллекция из 12 элементов, связанных с NeoMME. Среди них выделяются базовые модели для извлечения признаков (Feature Extraction) и специализированные версии Retriever для поиска визуальных документов (Visual Document Retrieval).
Модели Retriever, в частности, демонстрируют высокую эффективность в задачах поиска по изображениям и документам. Также представлены версии для оценки семантического сходства предложений (Sentence Similarity), включая варианты с плотными (dense) и поздними (late) взаимодействиями.
Для демонстрации возможностей новых энкодеров Hcompany запустила демо-приложение NeoMME-Retriever. Оно позволяет пользователям на практике оценить работу системы поиска визуальных документов и генерации с дополненной выборкой (RAG) на базе этих моделей.
Технические детали и результаты тестирования подробно описаны в научной статье «NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference», опубликованной несколько дней назад.
Появление моделей класса NeoMME подчеркивает текущий тренд в индустрии искусственного интеллекта на создание компактных, но высокоэффективных решений. В отличие от гигантских языковых моделей, требующих колоссальных вычислительных мощностей, энкодеры с сотнями миллионов параметров могут быть развернуты на менее дорогостоящем оборудовании, сохраняя при этом способность решать сложные мультимодальные задачи.
Время покажет, насколько широкое применение найдут эти модели в реальных бизнес-сценариях, однако их открытая публикация на Hugging Face уже предоставляет исследователям и разработчикам новый мощный инструмент для экспериментов и создания собственных приложений.
Hcompany выпустила семейство компактных мультимодальных энкодеров NeoMME, оптимизированных для эффективного поиска и извлечения признаков.
Компактные модели до 1 миллиарда параметров продолжают доказывать свою состоятельность в сложных мультимодальных задачах, предлагая альтернативу тяжеловесным решениям.