Компания Liquid AI выпустила новую визуально-языковую модель LFM2.5-VL-3B, доступную на платформе Hugging Face. Эта модель с 3 миллиардами параметров предназначена для обработки изображений и текста, но ее главная особенность — глубокая оптимизация для работы на конечных устройствах (edge devices). Благодаря поддержке технологии WebGPU, модель можно запускать локально прямо в браузере, без необходимости отправлять данные на облачные серверы.
Долгое время развитие искусственного интеллекта шло по пути увеличения вычислительных мощностей в облаке. Большие языковые модели (LLM) требовали кластеров из сотен видеокарт для своей работы. Однако параллельно формировался другой тренд — периферийные вычисления (edge computing). Разработчики и пользователи все чаще задумываются о приватности данных, стоимости API и возможности работы без подключения к сети. Liquid AI изначально строила свою стратегию вокруг создания компактных и эффективных архитектур, и новый релиз является логичным продолжением этого подхода.
Модель LFM2.5-VL-3B относится к классу Image-Text-to-Text. Это означает, что она способна «видеть» изображение и отвечать на вопросы по нему, генерируя текстовые описания. При размере в 3 миллиарда параметров она достаточно компактна, чтобы поместиться в оперативную память современного ноутбука или даже мощного смартфона. В связке с моделью упоминается использование технологий вроде SigLIP от Google (эффективный кодировщик изображений), что обеспечивает высокое качество распознавания визуальных признаков при минимальных затратах ресурсов.
Ключевым технологическим прорывом здесь является интеграция с WebGPU. Это современный стандарт, позволяющий веб-приложениям напрямую использовать ресурсы видеокарты пользователя. Запуск LFM2.5-VL-3B в браузере означает, что любой разработчик может создать сайт с продвинутым компьютерным зрением, не оплачивая дорогостоящий хостинг с GPU. Для пользователя это гарантирует абсолютную приватность: загруженные фотографии анализируются локально и никуда не передаются.
Подобные релизы указывают на постепенную демократизацию мультимодального ИИ. Мы переходим от эпохи, когда компьютерное зрение было доступно только через платные API крупных корпораций, к этапу, когда базовые визуальные модели становятся стандартной функцией браузера. В ближайшем будущем мы, вероятно, увидим всплеск веб-приложений, которые используют локальный ИИ для сортировки личных фотографий, помощи слабовидящим людям или модерации контента на стороне клиента. Время покажет, насколько разработчики готовы массово внедрять WebGPU, но инфраструктура для этого уже готова.