Orchard: Открытая инфраструктура для создания ИИ-агентов от исследователей Microsoft
Microsoft Research представила Orchard — открытый фреймворк, который позволяет исследователям обучать и тестировать ИИ-агентов в реалистичных средах, достигая высокой эффективности на небольших моделях.

Искусственный интеллект стремительно переходит от статических ответов на вопросы к автономным агентам, способным планировать, рассуждать и действовать в сложных многошаговых средах. Однако исследовательское сообщество столкнулось с серьезным препятствием. Создание передовых агентных систем часто требует проприетарной инфраструктуры, включая специализированные изолированные среды (sandboxes) и закрытые конвейеры обучения.
Чтобы решить эту проблему, исследователи представили Orchard — открытый фреймворк для масштабируемого моделирования агентов. В его основе лежит Orchard Env — легковесный сервис на базе Kubernetes, предоставляющий изолированные компоненты для запуска и создания агентов. В отличие от многих существующих решений, эта среда поддерживает различные типы задач без необходимости модификации кода.

Diagram of the Orchard ecosystem showing three benchmark areas (Orchard‑SWE, Orchard‑GUI, Orchard‑Claw) with performance metrics, a modular training pipeline (data curation, curriculum design, SFT, RL, evaluation), and the core Orchard Env service enabling sandboxed execution, file I/O, networking, and APIs. The system supports heterogeneous environments (code, web, desktop, mobile, productivity tools) through a unified interface, emphasizing reusability across domains and efficiency features such as low latency, Kubernetes scaling, and reduced cost.
Главная идея Orchard заключается в том, что среда выполнения должна быть отдельным, переиспользуемым сервисом, а не инфраструктурой, встроенной в конкретный фреймворк обучения. Это позволяет командам внедрять новые бенчмарки или алгоритмы без переписывания базовой архитектуры с нуля. Более того, Orchard решает проблему несоответствия сред обучения и развертывания: агенты могут обучаться непосредственно внутри сложных оболочек (harnesses), таких как Codex или OpenClaw, в которых они будут работать в реальности.
Для демонстрации возможностей фреймворка были выпущены три специализированных решения. Orchard-SWE предназначен для задач программной инженерии. Используя модель с примерно 3 миллиардами активных параметров и методы обучения с подкреплением, система достигает результата 69.7% на бенчмарке SWE-bench Verified, а при использовании модели оценки (value model) для ранжирования ответов — 73%. Это приближает ее к показателям передовых систем, которые в десять раз больше.

On the left: Orchard-SWE (30B-A3B) reaches 67.5% on SWE-bench Verified, matching frontier systems 10—30x larger. On the right: Orchard-GUI (4B) achieves 68.4% average success across WebVoyager, Online-Mind2web, and DeepShop, making it the strongest open-source GUI agent while staying on par with proprietary systems from OpenAI and Google.
Два других решения — Orchard-GUI для навигации в браузере и Orchard-Claw для задач персонального ассистента — также показывают впечатляющие результаты. Orchard-GUI, используя модель машинного зрения на 4 миллиарда параметров, достигает в среднем 68.4% успешности на веб-бенчмарках, конкурируя с проприетарными системами. Orchard-Claw успешно справляется с рутинными задачами продуктивности, демонстрируя значительный рост надежности благодаря обучению в реальных рабочих оболочках.
Появление Orchard означает важный сдвиг в индустрии. Оно доказывает, что при наличии правильной среды обучения и качественного конвейера данных, относительно небольшие модели с открытыми весами могут эффективно решать сложные реальные задачи. Это демократизирует исследования в области ИИ-агентов, давая широкому сообществу инструменты, которые ранее были доступны только крупным технологическим корпорациям.
TL;DR
Главное
Orchard предоставляет открытую инфраструктуру для обучения ИИ-агентов, позволяя небольшим моделям достигать результатов на уровне крупных проприетарных систем.
Ключевые факты
- /Orchard Env базируется на Kubernetes и позволяет переиспользовать среды для разных задач.
- /Агенты обучаются непосредственно в рабочих оболочках (Codex, OpenClaw), что повышает их надежность.
- /Модель Orchard-SWE (3 млрд параметров) достигает 73% на бенчмарке SWE-bench Verified.
- /Orchard-GUI (4 млрд параметров) показывает 68.4% успешности в веб-навигации.
Инсайт
Главным фактором успеха агента часто является не размер базовой модели, а возможность обучаться в той же программной оболочке, в которой он будет развернут в реальности.






