微软亚洲研究院开源 Agent Lightning v1.0:仅 3,500 行代码的真实 Harness 智能体强化学习训练框架

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-10-08762 阅读💛 83 收藏
微软亚洲研究院开源 Agent Lightning v1.0:仅 3,500 行代码的真实 Harness 智能体强化学习训练框架

📌 One-Sentence Summary

微软亚洲研究院开源了 Agent Lightning v1.0,这是一个轻量级框架,支持在真实的智能体运行环境(Harness)中进行强化学习训练,无需重写代码。

📝 Summary

微软亚洲研究院发布了 Agent Lightning v1.0,这是一款开源框架,旨在直接在 AI 智能体的生产环境运行框架中利用强化学习(RL)进行训练。与需要在训练循环中重新实现智能体逻辑的传统 Agentic RL 系统不同,Agent Lightning 引入了「Harnessed Agentic RL」范式,让现有的智能体框架与环境交互,同时训练系统通过代理(Proxy)观察大语言模型(LLM)的调用。该框架极其轻量,仅由约 3,500 行代码组成,并原生支持 Kubernetes 执行,从而在不依赖商业沙盒的情况下实现可扩展的 Rollout。实验表明,仅使用 6,000 个训练样本,该框架就将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 分数从 41.8% 提升至 56.4%,展示了其高数据效率以及在编码智能体方面的实用价值。

💡 Main Points

Harnessed Agentic RL 范式

核心创新在于允许实际部署的运行框架(如 OpenHands、Claude Code)直接参与 RL 训练。系统不再为训练器重写智能体,而是使用 LLM 代理拦截并记录模型调用,确保训练后的智能体与部署时的智能体保持一致。

轻量级模块化架构

整个控制平面仅由约 3,500 行代码实现,包括 API Gateway、Rollout Controller 和 Customized Trainer。这种设计优先考虑了简洁性、易于修改以及与 verl 等现有框架的集成。

原生 Kubernetes 支持以实现可扩展性

智能体作为标准的 Kubernetes Job 运行,而不依赖付费的商业沙盒服务(如 Modal 或 E2B)。这显著降低了大规模运行的成本,并允许用户利用自管理的集群或本地基础设施进行大规模 Rollout。

高数据效率与性能提升

在涉及编码智能体的案例研究中,该框架仅使用约 6,000 个训练样本,就将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升了 14.6 个百分点(从 41.8% 提升至 56.4%),证明了其在有限数据下的有效性。

💬 Key Quotes

Agent Lightning v1.0:一个仅 3,500 行的轻量级 Agentic RL 框架,用于在真实运行环境中训练智能体

已部署的智能体运行框架直接参与强化学习,无需在训练框架内部重写智能体

将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 分数从 41.8% 提升至 56.4%,绝对提升幅度达 14.6 个百分点

智能体作为标准的 Kubernetes Job 运行……不依赖付费的商业沙盒服务

📊 Article Meta

AI Screening: 88

Source: AIHOT — 精选

Author: noreply@aihot.news (Microsoft Research 博客)

Category: 人工智能

Language: 英文

Read Time: 12 min

Word Count: 2988

Tags:

AI 与智能应用 , AI Agent , 强化学习 , 开源项目 , 模型训练与推理

#AI 与智能应用# AI Agent# 强化学习# 开源项目# 模型训练与推理

文章评论(3)

林观澜1 小时前

刚好最近在找这方面的资料,太及时了。

回复
空向阳1 小时前

刚好最近在找这方面的资料,太及时了。

回复
空向阳3 小时前

刚好最近在找这方面的资料,太及时了。

回复