Выход семейства моделей Holo4: специализированные визуальные модели для управления компьютером
Компания H представила коллекцию визуально-языковых моделей Holo4, созданных для автоматизации задач на ПК и мобильных устройствах, а также вызова инструментов и работы с кодом.

Компания H опубликовала на платформе Hugging Face новую коллекцию моделей Holo4. Это семейство передовых визуально-языковых моделей (VLM), специально обученных для взаимодействия с компьютерными и мобильными интерфейсами, вызова инструментов и написания кода. Данный релиз отмечает важный шаг в разработке искусственного интеллекта: переход от пассивных текстовых систем к активным цифровым агентам.
Долгое время большие языковые модели (LLM) оставались запертыми в рамках чат-интерфейсов. Чтобы ИИ мог выполнять реальные задачи пользователя — например, забронировать билет, найти нужный файл в системе или перенести данные из таблицы в CRM, — ему необходимо «видеть» экран и понимать логику графического интерфейса. Создание универсальных агентов (generalist computer-use agents) требует моделей, способных одновременно обрабатывать визуальную информацию и генерировать точные команды для управления операционной системой.
Обычные визуальные модели хорошо справляются с описанием фотографий, но часто теряются, когда нужно определить точные координаты кнопки на экране или понять иерархию меню. Семейство Holo4 создано именно для решения этой проблемы.
В представленную коллекцию вошли несколько моделей различных размеров и архитектур. Среди них базовая модель Holo4-27B с 27 миллиардами параметров, а также более крупные версии Holo4-35B-A3B (35 миллиардов) и Holotron4-30B-A3B (33 миллиарда). Все они работают по принципу «изображение и текст в текст» (Image-Text-to-Text). На вход модель получает скриншот интерфейса и текстовую инструкцию пользователя, а на выходе выдает последовательность необходимых действий или программный код.
Особое внимание стоит уделить публикации набора данных с траекториями (trajectories). В контексте обучения агентов траектория — это запись последовательных шагов (кликов, скроллов, ввода текста), которые приводят к выполнению задачи. Наличие качественных траекторий критически важно для обучения моделей планированию многошаговых действий.
Выпуск специализированных моделей такого размера в экосистеме Hugging Face существенно снижает порог входа для разработчиков автономных агентов. Модели в диапазоне от 27 до 35 миллиардов параметров предлагают хороший баланс между вычислительной сложностью и способностью к сложному логическому выводу. Разработчикам больше не нужно полагаться исключительно на закрытые программные интерфейсы (API) крупных корпораций для создания систем, способных работать с графическими оболочками.
Публикация коллекции Holo4 также показывает, что фокус индустрии смещается с простого распознавания изображений на пространственное понимание интерфейсов и взаимодействие с ними в реальном времени.
Пока рано судить, насколько надежно модели Holo4 справятся с нестандартными интерфейсами, неожиданными всплывающими окнами или динамическим контентом в реальных условиях. Обучение ИИ работе с интерфейсами все еще сопряжено с высоким процентом ошибок, так как малейшая неточность в координатах клика может прервать весь процесс.
Однако появление таких специализированных коллекций указывает на то, что в ближайшие годы мы увидим значительный прогресс в автоматизации рутинных цифровых задач. Время покажет, станет ли архитектура Holo4 отраслевым стандартом, но направление развития индустрии в сторону автономных компьютерных агентов задано предельно четко.
TL;DR
Главное
Компания H выпустила специализированные визуально-языковые модели Holo4, предназначенные для создания агентов, способных самостоятельно управлять компьютером и мобильными устройствами.
Ключевые факты
- /В линейку входят модели размером от 27 до 35 миллиардов параметров.
- /Модели работают по принципу Image-Text-to-Text для анализа скриншотов и выдачи команд.
- /Опубликован набор данных с траекториями действий для обучения агентов.
Инсайт
Публикация обучающих траекторий (trajectories) вместе с весами моделей важнее самих моделей, так как именно данные о пошаговом взаимодействии с интерфейсом являются главным дефицитом при создании ИИ-агентов.



