微软亚洲研究院开源 Agent Lightning v1.0:仅 3,500 行代码的真实 Harness 智能体强化学习训练框架

📌 One-Sentence Summary
微软亚洲研究院开源了 Agent Lightning v1.0,这是一个轻量级框架,支持在真实的智能体运行环境(Harness)中进行强化学习训练,无需重写代码。
📝 Summary
微软亚洲研究院发布了 Agent Lightning v1.0,这是一款开源框架,旨在直接在 AI 智能体的生产环境运行框架中利用强化学习(RL)进行训练。与需要在训练循环中重新实现智能体逻辑的传统 Agentic RL 系统不同,Agent Lightning 引入了「Harnessed Agentic RL」范式,让现有的智能体框架与环境交互,同时训练系统通过代理(Proxy)观察大语言模型(LLM)的调用。该框架极其轻量,仅由约 3,500 行代码组成,并原生支持 Kubernetes 执行,从而在不依赖商业沙盒的情况下实现可扩展的 Rollout。实验表明,仅使用 6,000 个训练样本,该框架就将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 分数从 41.8% 提升至 56.4%,展示了其高数据效率以及在编码智能体方面的实用价值。
💡 Main Points
Harnessed Agentic RL 范式
核心创新在于允许实际部署的运行框架(如 OpenHands、Claude Code)直接参与 RL 训练。系统不再为训练器重写智能体,而是使用 LLM 代理拦截并记录模型调用,确保训练后的智能体与部署时的智能体保持一致。
轻量级模块化架构
整个控制平面仅由约 3,500 行代码实现,包括 API Gateway、Rollout Controller 和 Customized Trainer。这种设计优先考虑了简洁性、易于修改以及与 verl 等现有框架的集成。
原生 Kubernetes 支持以实现可扩展性
智能体作为标准的 Kubernetes Job 运行,而不依赖付费的商业沙盒服务(如 Modal 或 E2B)。这显著降低了大规模运行的成本,并允许用户利用自管理的集群或本地基础设施进行大规模 Rollout。
高数据效率与性能提升
在涉及编码智能体的案例研究中,该框架仅使用约 6,000 个训练样本,就将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升了 14.6 个百分点(从 41.8% 提升至 56.4%),证明了其在有限数据下的有效性。
💬 Key Quotes
Agent Lightning v1.0:一个仅 3,500 行的轻量级 Agentic RL 框架,用于在真实运行环境中训练智能体
已部署的智能体运行框架直接参与强化学习,无需在训练框架内部重写智能体
将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 分数从 41.8% 提升至 56.4%,绝对提升幅度达 14.6 个百分点
智能体作为标准的 Kubernetes Job 运行……不依赖付费的商业沙盒服务
📊 Article Meta
AI Screening: 88
Source: AIHOT — 精选
Author: noreply@aihot.news (Microsoft Research 博客)
Category: 人工智能
Language: 英文
Read Time: 12 min
Word Count: 2988
Tags:
AI 与智能应用 , AI Agent , 强化学习 , 开源项目 , 模型训练与推理
刚好最近在找这方面的资料,太及时了。
刚好最近在找这方面的资料,太及时了。
刚好最近在找这方面的资料,太及时了。