Microsoft представила Agent Lightning: легковесный фреймворк для обучения ИИ-агентов
Исследователи из Microsoft Research Asia выпустили Agent Lightning v1.0 — систему из 3500 строк кода, позволяющую обучать агентов с помощью обучения с подкреплением без переписывания их архитектуры.

Суть
Исследователи из Microsoft Research Asia представили Agent Lightning v1.0 — новую парадигму и легковесный фреймворк для обучения ИИ-агентов с помощью обучения с подкреплением (RL). Главное нововведение заключается в том, что система позволяет использовать ту же самую программную обвязку (harness), которая применяется при развертывании агента, напрямую в процессе обучения. Это избавляет разработчиков от необходимости заново реализовывать логику агента внутри обучающего фреймворка.
Контекст

Figure 1: Side-by-side comparison of two training loops. In Agentic RL, the environment exchanges actions and observations with a tokenizer, which passes action and observation tokens to the policy model. In Harnessed Agentic RL, an agent harness handling context and orchestration sits between the environment and an OpenAI-like API, which exchanges input and output tokens with the policy model.
Современные ИИ-агенты эволюционировали от одиночных моделей до сложных систем, включающих инструменты и среды выполнения. Их возможности во многом зависят от внешней обвязки, координирующей работу. Обучение с подкреплением помогает улучшать такие системы методом проб и ошибок. Однако традиционные системы (например, verl, AReaL и slime) предполагают, что обучающий фреймворк полностью управляет циклом взаимодействия со средой. Из-за этого разработчикам приходилось переписывать код агентов для обучения, что дорого и приводит к тому, что обучаемый агент отличается от того, который в итоге будет развернут.
Детали
Agent Lightning v1.0 решает эту проблему, помещая прокси-сервер большой языковой модели (LLM proxy) между агентом и моделью. Агент продолжает работать как обычно, а фреймворк наблюдает и записывает его вызовы.
Ключевые характеристики системы:
- Компактность: весь фреймворк состоит примерно из 3500 строк кода и включает три основных компонента: API-шлюз, контроллер развертывания и настроенный тренер.
- Встроенная поддержка Kubernetes: агенты запускаются как стандартные задачи Kubernetes на собственных кластерах или локальной инфраструктуре, что исключает зависимость от платных коммерческих песочниц (таких как Modal Sandbox или E2B).
- Эффективность данных: в тесте с кодовым агентом пайплайн позволил повысить показатель Pass@1 модели Qwen3.5-9B на SWE-bench Verified с 41.8% до 56.4% (прирост на 14.6 процентных пункта) с использованием около 6000 обучающих примеров.
- Collocated Async RL: новый подход, при котором сбор данных (rollout) и обновление модели делят одни и те же графические процессоры (GPU). В экспериментах это дало примерно двукратное ускорение по сравнению с синхронным RL при меньшем количестве используемых GPU.

Figure 2: System architecture diagram. On the left, agents with harnesses — mini-SWE-agent, OpenHands, and OpenClaw — run on a Kubernetes cluster. They connect to three components: an API Gateway containing a Rollout API and an LLM API Proxy, a Rollout Controller containing a local reconciler and a Kubernetes reconciler, and a Customized Trainer containing a sample adapter and monitoring. These connect in turn to an inference engine and a training engine holding the model.
Анализ
Переход к парадигме Harnessed Agentic RL означает, что среда и цикл взаимодействия теперь управляются самой обвязкой агента, а не обучающей системой. Это создает новые технические вызовы, такие как правильная ретокенизация, расчет преимуществ на уровне сессий (rollouts) и нормализация потерь. Решение этих проблем внутри компактной кодовой базы делает процесс обучения более стабильным. Использование стандартных инструментов вроде Kubernetes снижает вычислительные затраты и барьер входа для масштабирования.
Перспектива
Упрощение интеграции существующих агентов с системами обучения с подкреплением может ускорить развитие автономных систем. Отсутствие необходимости переписывать код для обучения и независимость от проприетарных сервисов делают разработку более воспроизводимой и доступной для исследователей.
TL;DR
Главное
Agent Lightning v1.0 позволяет обучать ИИ-агентов с помощью обучения с подкреплением, используя их оригинальный код, что упрощает процесс и снижает затраты на инфраструктуру.
Ключевые факты
- /Фреймворк состоит всего из 3500 строк кода.
- /Модель Qwen3.5-9B улучшила результат на SWE-bench Verified с 41.8% до 56.4% (на 14.6 процентных пункта).
- /Для достижения этого результата потребовалось около 6000 обучающих примеров.
- /Подход Collocated Async RL обеспечил примерно двукратное ускорение по сравнению с синхронным RL.
Инсайт
Перенос управления циклом взаимодействия от обучающего фреймворка к самому агенту решает проблему расхождения между поведением модели во время тренировки и в реальных условиях развертывания.








