Искусственный интеллект стремительно переходит от статических ответов на вопросы к автономным агентам, способным планировать, рассуждать и действовать в сложных многошаговых средах. Однако исследовательское сообщество столкнулось с серьезным препятствием. Создание передовых агентных систем часто требует проприетарной инфраструктуры, включая специализированные изолированные среды (sandboxes) и закрытые конвейеры обучения.
Чтобы решить эту проблему, исследователи представили Orchard — открытый фреймворк для масштабируемого моделирования агентов. В его основе лежит Orchard Env — легковесный сервис на базе Kubernetes, предоставляющий изолированные компоненты для запуска и создания агентов. В отличие от многих существующих решений, эта среда поддерживает различные типы задач без необходимости модификации кода.
Diagram of the Orchard ecosystem showing three benchmark areas (Orchard‑SWE, Orchard‑GUI, Orchard‑Claw) with performance metrics, a modular training pipeline (data curation, curriculum design, SFT, RL, evaluation), and the core Orchard Env service enabling sandboxed execution, file I/O, networking, and APIs. The system supports heterogeneous environments (code, web, desktop, mobile, productivity tools) through a unified interface, emphasizing reusability across domains and efficiency features such as low latency, Kubernetes scaling, and reduced cost.
Главная идея Orchard заключается в том, что среда выполнения должна быть отдельным, переиспользуемым сервисом, а не инфраструктурой, встроенной в конкретный фреймворк обучения. Это позволяет командам внедрять новые бенчмарки или алгоритмы без переписывания базовой архитектуры с нуля. Более того, Orchard решает проблему несоответствия сред обучения и развертывания: агенты могут обучаться непосредственно внутри сложных оболочек (harnesses), таких как Codex или OpenClaw, в которых они будут работать в реальности.
Для демонстрации возможностей фреймворка были выпущены три специализированных решения. Orchard-SWE предназначен для задач программной инженерии. Используя модель с примерно 3 миллиардами активных параметров и методы обучения с подкреплением, система достигает результата 69.7% на бенчмарке SWE-bench Verified, а при использовании модели оценки (value model) для ранжирования ответов — 73%. Это приближает ее к показателям передовых систем, которые в десять раз больше.
On the left: Orchard-SWE (30B-A3B) reaches 67.5% on SWE-bench Verified, matching frontier systems 10—30x larger.
On the right: Orchard-GUI (4B) achieves 68.4% average success across WebVoyager, Online-Mind2web, and DeepShop, making it the strongest open-source GUI agent while staying on par with proprietary systems from OpenAI and Google.
Два других решения — Orchard-GUI для навигации в браузере и Orchard-Claw для задач персонального ассистента — также показывают впечатляющие результаты. Orchard-GUI, используя модель машинного зрения на 4 миллиарда параметров, достигает в среднем 68.4% успешности на веб-бенчмарках, конкурируя с проприетарными системами. Orchard-Claw успешно справляется с рутинными задачами продуктивности, демонстрируя значительный рост надежности благодаря обучению в реальных рабочих оболочках.
Появление Orchard означает важный сдвиг в индустрии. Оно доказывает, что при наличии правильной среды обучения и качественного конвейера данных, относительно небольшие модели с открытыми весами могут эффективно решать сложные реальные задачи. Это демократизирует исследования в области ИИ-агентов, давая широкому сообществу инструменты, которые ранее были доступны только крупным технологическим корпорациям.