Agent Lightning:轻量级强化学习智能体训练框架

邱宇AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-10-08747 阅读💛 81 收藏
Agent Lightning:轻量级强化学习智能体训练框架

📌 One-Sentence Summary

微软亚洲研究院发布 Agent Lightning v1.0,这是一款轻量级的智能体强化学习框架,通过 LLM 代理直接训练现实世界的智能体执行环境,以极简代码实现显著的编码性能提升,并原生支持 Kubernetes。

📝 Summary

Agent Lightning v1.0 引入了「Harnessed Agentic RL」(受控智能体强化学习)范式,允许将强化学习直接应用于现有的智能体框架(如 OpenHands 或 mini-SWE-agent),而无需重新实现。通过在智能体和模型之间部署 LLM 代理,该系统能够从标准的 API 调用中捕获训练数据。该框架旨在保持简洁(约 3,500 行代码),支持原生 Kubernetes 执行以避免昂贵的商业沙箱服务,并采用「Collocated Async RL」(共置异步强化学习)来优化 GPU 利用率。实验表明,仅使用约 6,000 个样本,该框架就将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 指标提升了 14.6 个百分点,展示了其在 AI 智能体开发中的高数据效率和实际可扩展性。

💡 Main Points

Harnessed Agentic RL 消除了为训练而重新实现智能体的需求

传统的强化学习需要在训练框架内部重建智能体循环,导致训练与部署之间的差异。Agent Lightning 利用 LLM 代理拦截 API 调用,使实际的生产环境执行框架能够直接参与强化学习过程。

具有原生 Kubernetes 支持的轻量级架构降低了基础设施成本

整个控制平面由约 3,500 行代码实现。它将智能体作为标准的 Kubernetes 作业运行,而不依赖 Modal 或 E2B 等昂贵的商业沙箱服务,使得大规模滚动更新更加易于获取和复现。

Collocated Async RL 通过动态调度优化 GPU 利用率

通过在滚动更新(Rollout)和训练阶段共享 GPU,并在更新期间暂停新请求,该系统实现了比同步强化学习快约 2 倍的加速,同时使用的资源少于完全异步方法。

在编码智能体基准测试中展示了高数据效率

仅使用约 6,000 个训练样本,该框架将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升至 56.4%,验证了基于滚动更新的优势计算和损失归一化的有效性。

💬 Key Quotes

Harnessed Agentic RL:微软亚洲研究院引入了一种训练范式,其中部署时使用的同一智能体执行框架直接参与强化学习,从而消除了需要在训练框架内重新实现智能体的需求。

Agent Lightning v1.0 提供了完整的智能体强化学习控制平面,代码量约为 3,500 行。

原生 Kubernetes 支持:智能体可作为标准 Kubernetes 作业在自管理集群、云 Kubernetes 或本地基础设施上运行,无需依赖付费的商业沙箱服务。

端到端编码智能体流水线将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升至 56.4%,获得了 14.6 个百分点的提升,这仅使用了基于开源数据集的约 6,000 个训练样本。

📊 Article Meta

AI Screening: 88

Source: Microsoft Research Blog

Author: Brenda Potts

Category: 人工智能

Language: 英文

Read Time: 6 min

Word Count: 1463

Tags:

AI 与智能应用 , AI Agent , 强化学习 , 开源项目 , 系统设计

#AI 与智能应用# AI Agent# 强化学习# 开源项目# 系统设计

文章评论(5)

青柠微凉1 小时前

实话,说的不明不白

回复
暮临风2 小时前

写得挺用心的,支持一下。

回复
墨沐雨1 小时前

实测过类似工具,作者说的基本属实。

回复
雪影3 小时前

支持作者,持续关注中。

回复
龙文博1 小时前

讲解得很细致,新手也能看懂。

回复