Orchard: Открытая инфраструктура для создания ИИ-агентов от исследователей Microsoft

Microsoft Research представила Orchard — открытый фреймворк, который позволяет исследователям обучать и тестировать ИИ-агентов в реалистичных средах, достигая высокой эффективности на небольших моделях.

Обновлено:
3 мин чтения
1 просмотров
Orchard: Открытая инфраструктура для создания ИИ-агентов от исследователей Microsoft

Искусственный интеллект стремительно переходит от статических ответов на вопросы к автономным агентам, способным планировать, рассуждать и действовать в сложных многошаговых средах. Однако исследовательское сообщество столкнулось с серьезным препятствием. Создание передовых агентных систем часто требует проприетарной инфраструктуры, включая специализированные изолированные среды (sandboxes) и закрытые конвейеры обучения.

Чтобы решить эту проблему, исследователи представили Orchard — открытый фреймворк для масштабируемого моделирования агентов. В его основе лежит Orchard Env — легковесный сервис на базе Kubernetes, предоставляющий изолированные компоненты для запуска и создания агентов. В отличие от многих существующих решений, эта среда поддерживает различные типы задач без необходимости модификации кода.

Diagram of the Orchard ecosystem showing three benchmark areas (Orchard‑SWE, Orchard‑GUI, Orchard‑Claw) with performance metrics, a modular training pipeline (data curation, curriculum design, SFT, RL, evaluation), and the core Orchard Env service enabling sandboxed execution, file I/O, networking, and APIs. The system supports heterogeneous environments (code, web, desktop, mobile, productivity tools) through a unified interface, emphasizing reusability across domains and efficiency features such as low latency, Kubernetes scaling, and reduced cost.

Diagram of the Orchard ecosystem showing three benchmark areas (Orchard‑SWE, Orchard‑GUI, Orchard‑Claw) with performance metrics, a modular training pipeline (data curation, curriculum design, SFT, RL, evaluation), and the core Orchard Env service enabling sandboxed execution, file I/O, networking, and APIs. The system supports heterogeneous environments (code, web, desktop, mobile, productivity tools) through a unified interface, emphasizing reusability across domains and efficiency features such as low latency, Kubernetes scaling, and reduced cost.

Главная идея Orchard заключается в том, что среда выполнения должна быть отдельным, переиспользуемым сервисом, а не инфраструктурой, встроенной в конкретный фреймворк обучения. Это позволяет командам внедрять новые бенчмарки или алгоритмы без переписывания базовой архитектуры с нуля. Более того, Orchard решает проблему несоответствия сред обучения и развертывания: агенты могут обучаться непосредственно внутри сложных оболочек (harnesses), таких как Codex или OpenClaw, в которых они будут работать в реальности.

Для демонстрации возможностей фреймворка были выпущены три специализированных решения. Orchard-SWE предназначен для задач программной инженерии. Используя модель с примерно 3 миллиардами активных параметров и методы обучения с подкреплением, система достигает результата 69.7% на бенчмарке SWE-bench Verified, а при использовании модели оценки (value model) для ранжирования ответов — 73%. Это приближает ее к показателям передовых систем, которые в десять раз больше.

On the left: Orchard-SWE (30B-A3B) reaches 67.5% on SWE-bench Verified, matching frontier systems 10—30x larger. 

On the right: Orchard-GUI (4B) achieves 68.4% average success across WebVoyager, Online-Mind2web, and DeepShop, making it the strongest open-source GUI agent while staying on par with proprietary systems from OpenAI and Google.

On the left: Orchard-SWE (30B-A3B) reaches 67.5% on SWE-bench Verified, matching frontier systems 10—30x larger. On the right: Orchard-GUI (4B) achieves 68.4% average success across WebVoyager, Online-Mind2web, and DeepShop, making it the strongest open-source GUI agent while staying on par with proprietary systems from OpenAI and Google.

Два других решения — Orchard-GUI для навигации в браузере и Orchard-Claw для задач персонального ассистента — также показывают впечатляющие результаты. Orchard-GUI, используя модель машинного зрения на 4 миллиарда параметров, достигает в среднем 68.4% успешности на веб-бенчмарках, конкурируя с проприетарными системами. Orchard-Claw успешно справляется с рутинными задачами продуктивности, демонстрируя значительный рост надежности благодаря обучению в реальных рабочих оболочках.

Появление Orchard означает важный сдвиг в индустрии. Оно доказывает, что при наличии правильной среды обучения и качественного конвейера данных, относительно небольшие модели с открытыми весами могут эффективно решать сложные реальные задачи. Это демократизирует исследования в области ИИ-агентов, давая широкому сообществу инструменты, которые ранее были доступны только крупным технологическим корпорациям.

Three Orchard framework components with benchmark results: Orchard-SWE (107K trajectories, 67.5% SWE-Bench), Orchard-GUI (74.1 WebVoyager, 67.0 Online-Mind2Web, 64.0 DeepShop), and Orchard-Claw (31.7 pass, 59.6 pass@3, +19.9 over base model).

Three Orchard framework components with benchmark results: Orchard-SWE (107K trajectories, 67.5% SWE-Bench), Orchard-GUI (74.1 WebVoyager, 67.0 Online-Mind2Web, 64.0 DeepShop), and Orchard-Claw (31.7 pass, 59.6 pass@3, +19.9 over base model).

On Second Thought with Sinead Bovell

On Second Thought with Sinead Bovell

Portrait of Wenlin Yao

Portrait of Wenlin Yao

TL;DR

Главное

Orchard предоставляет открытую инфраструктуру для обучения ИИ-агентов, позволяя небольшим моделям достигать результатов на уровне крупных проприетарных систем.

Ключевые факты

  • /Orchard Env базируется на Kubernetes и позволяет переиспользовать среды для разных задач.
  • /Агенты обучаются непосредственно в рабочих оболочках (Codex, OpenClaw), что повышает их надежность.
  • /Модель Orchard-SWE (3 млрд параметров) достигает 73% на бенчмарке SWE-bench Verified.
  • /Orchard-GUI (4 млрд параметров) показывает 68.4% успешности в веб-навигации.

Инсайт

Главным фактором успеха агента часто является не размер базовой модели, а возможность обучаться в той же программной оболочке, в которой он будет развернут в реальности.

Источник:Microsoft

Читайте также