Microsoft представила Echoverse: синтетические миры для обучения ИИ-агентов
Исследователи создали платформу глубоких симулированных сред для тренировки агентов, управляющих компьютером. Подход почти удваивает эффективность компактных моделей.
Исследователи создали платформу глубоких симулированных сред для тренировки агентов, управляющих компьютером. Подход почти удваивает эффективность компактных моделей.
5 мин

Исследовательское подразделение Microsoft представило Echoverse — платформу для обучения ИИ-агентов работе с компьютерными интерфейсами. Вместо того чтобы пытаться тренировать модели на реальных сайтах или статических скриншотах, ученые создали глубокие синтетические среды. Обучение в таких симуляциях позволило модели с 9 миллиардами параметров увеличить свою результативность с 36.5% до 67.1%, вплотную приблизившись к показателям более крупных систем.
Обучение автономных агентов, способных работать с почтой, базами данных или системами поддержки клиентов, сталкивается с серьезной преградой. Реальные приложения постоянно меняются: обновляется дизайн, сдвигаются даты, а системы защиты блокируют автоматизированный трафик.

Circular diagram of the learning loop. A model runs a task in a world and every rollout is graded against database ground truth. Two arrows branch from the graded run: surviving failures flow to model training data, while defects flow to repairs of the environment, its tasks, and its verifier, so model and world improve on the same run.
Более того, действия в реальных системах имеют последствия. Если агент в процессе обучения нажмет не ту кнопку, он может отправить реальное письмо или удалить важные данные. Использование скриншотов решает проблему безопасности, но лишает модель понимания причинно-следственных связей. Агенту нужно видеть, как его действия меняют внутреннее состояние системы.
Команда Microsoft разработала двенадцать тренировочных миров: десять предметных сред, имитирующих реальные рабочие инструменты, и две среды для отработки конкретных навыков (например, работы со сложными календарями и фильтрами).
Ключевая особенность Echoverse — это «глубина» симуляции. Среда включает в себя не только пользовательский интерфейс (frontend), но и полноценную базу данных (backend). Когда агент совершает действие, система проверяет не изменение пикселей на экране, а фактическое изменение данных в базе.
Процесс обучения построен на совместной эволюции. Модель, сама среда и система проверки результатов развиваются одновременно. Когда агент сталкивается со сложной задачей и ошибается, эти ошибки становятся данными для дальнейшего обучения, а выявленные недостатки в симуляции оперативно исправляются.

Two-phase pipeline diagram. Phase 1 expands seed scenarios into an app and repairs its database, backend, and frontend until it passes machine-checkable claims. Phase 2 regrounds tasks on live data and iterates a loop of analyzer and fixer agents, then re-scores against database ground truth until the pass rate plateaus. A dashed arrow shows many task-loop fixes landing back in the world.
Эксперимент Microsoft доказал важный принцип: качество среды важнее её масштаба. Обучение на поверхностных копиях сайтов не просто бесполезно — оно ухудшает навыки агента. Системе необходимо понимать логику разрешений, сохранение состояния между экранами и зависимости в многошаговых рабочих процессах.
Внедрение обучения с подкреплением (reinforcement learning) внутри таких сред позволяет агентам выйти за рамки простого копирования человеческих действий. Получая точную обратную связь от базы данных, модель учится достигать цели за меньшее количество шагов и находит более оптимальные пути решения задач.
Microsoft открывает исходный код четырех из созданных миров, включая данные и системы оценки. Это важный шаг для всего исследовательского сообщества. Создание надежных ИИ-помощников для закрытых корпоративных систем невозможно без качественных полигонов для их тренировки. В будущем мы, вероятно, увидим появление целой индустрии, специализирующейся на создании сложных цифровых двойников корпоративного программного обеспечения специально для обучения искусственного интеллекта.
Для создания эффективных ИИ-агентов требуются глубокие синтетические симуляции рабочих программ, где действия модели оцениваются по изменениям в базе данных, а не по картинке на экране.
Главным ограничением в развитии компьютерных агентов является не архитектура самих моделей, а отсутствие сред, способных адекватно реагировать на их действия и сохранять логику работы реальных приложений.