GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent

空逐月行业资讯📡 量子位2026-09-211144 阅读💛 214 收藏

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent

在物理世界真正干活的具身智能体

允中 发自 凹非寺

量子位 | 公众号QbitAI

Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。

随着GPT-6 Astra开始接受真实机器人操作测试,这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。

同时,也让一个曾经遥远的问题变得越来越具体:

通用大模型,能否成为机器人的“大脑”,让机器人真正完成现实世界中的复杂任务?

但机器人面对的不是可以随时回滚的代码,在物理世界里,环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。

物理世界中的智能体,不只是“想明白”,还必须“看得见、做得到、反应快”,并且“记得住”。

今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。

RPent面向真实物理世界,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。

RPent由大规模具身强化学习框架RLinf的核心团队打造,延续了该团队在具身智能基础设施领域的技术积累。

开源代码链接:https://github.com/RLinf/RPent

RPent真机效果展示:从“会动”到“会做事”

在这一视频中,RPent展示了多个有趣的开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物,找到藏在碗下的勺子。

值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。

1、例如,当任务变化为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结VLA只会沿用训练时学到的动作,将它错误地放入金属篮中;

而在RPent中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。任务变了,机器人也能随之改变行动。

2、另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子。

抓起瓶子后,它会先进行小幅试抬,确认夹持稳定;

当原有运动路径不可行时,再调整腕部姿态继续执行。

接着,面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。

这里展示的已经不再是一条预先写死的动作序列,而是一个完整的“观察-判断-执行-纠错”闭环。

3、最后两个任务则进一步展示了RPent对已有能力的复用。

机器人可以将原本用于“拿起并放置容器”的技能重新组合,用于倾倒钢珠;又把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳

探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时,RPent可以启用Flash Mode,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体执行的延时。

这一整套Demo想展示的,并不是“机器人又学会了几个动作”,而是一个更重要的问题:当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?

RPent所探索的,正是这样的具身智能体形态。

机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功沉淀为下一次可以复用的经验,这正是具身智能体的雏形。

RPent核心设计思路

当前具身智能的发展,正在逐渐呈现两种不同的技术路线。

一条是纯VLA端到端。

用一个视觉-语言-动作模型直接吃下观测、吐出动作,精细操作做得很好,但一旦任务变长、语言变花、场景被扰动就迅速退化。

另一条是纯大模型Agent(如CAP-X这类工作)。

随着GPT-6这一代通用模型对具身任务的覆盖率快速提升,大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。

两条路线之间并非简单的替代关系,而是对应了不同层次的能力:

RPent并不是在两种路线之间进行折中,更不是让某一个模型变得无所不能,包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情:

  • 通用大模型负责理解任务、制定计划;
  • VLA、WAM等专家模型负责高精度动作执行;
  • 记忆系统沉淀经验,推动智能体持续优化;
  • 框架负责连接模型、工具与真实环境,形成闭环。

由此,它们形成“观察-规划-执行-反馈-再规划”的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。

背后算法,源于团队于7月份提出的Harness VLA工作(链接:https://arxiv.org/abs/2607.08448)

01开放的模块化架构,让模型、工具和硬件各司其职

RPent采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。

在用户层,可以通过交互式命令行或Web Dashboard下达任务,并查看视觉输入、推理过程和动作轨迹。

智能层中的规划器结合基础模型、Memory与工具库拆解任务,动作原语则把VLA、WAM和程序化技能封装成可调用工具。

在环境层和接口层,机器人控制、模型服务和仿真环境可以独立部署,通过轻量级通信连接。

上层任务逻辑不必绑定某一种机器人或仿真器,新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备。

用户层(User Layer):智能体交互入口

用户层提供类似Claude Code/Codex的交互式CLI,以及可选Web Dashboard。

用户可以下达任务指令,并实时查看智能体推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测及实时交互。

智能层(Intelligence Layer):任务规划与能力调度中心

智能层由Agentic PlannerAction Primitive组成。

Agentic Planner结合基础模型、Memory和Tool Library,实现任务理解、规划与工具调用,并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。

Action Primitive将VLA、WAM等学习型操作模型,以及Code as Policy等程序化技能统一封装为标准工具,使大模型负责复杂任务理解与规划,专家模型负责高精度动作执行,从而兼顾泛化能力与操作精度。

接口层(Interface Layer):统一连接模型与机器人

接口层将智能体决策转换为机器人可执行指令,为不同设备提供统一调用接口,包括动作执行、状态读取、环境渲染和设备复位等能力。

无论是真实机器人还是仿真平台,上层Agent、提示词和工具均无需针对设备重新开发,实现跨机器人、跨环境迁移。

环境层(Environment Layer):连接真实与仿真世界

环境层负责任务执行,目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境,以及Franka、双臂Franka、YAM等真实设备。

新增机器人只需作为独立模块接入robots/ 目录,即可被框架自动识别和调用。

此外,智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启,为持续研发和长期运行提供工程保障。

通过模块化架构与统一接口设计,RPent不绑定单一模型或机器人,而是构建了一个开放、可扩展的具身智能基础设施,让不同模型、技能与硬件能够灵活组合、高效协同。

同时,每一次任务执行产生的反馈都可以沉淀到记忆系统,为后续任务提供经验支持,使智能体在真实环境中持续学习与优化,将智能体的能力从“一次性部署”推向了“持续演进”。

02统一接口设计,让智能体以标准方式连接物理世界

在数字世界中,Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现,让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。

但进入物理世界之后,问题变得复杂得多。

机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务,不同机器人也可能使用完全不同的控制方式。

如果每接入一种设备,都需要重新开发一套Agent,那么智能体很难真正规模化扩展。

因此,RPent将“工具-机器人-环境”进一步抽象,通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来,实现智能体、工具和硬件之间的统一协作。

RPent用三层接口把智能决策与设备执行分开:

  • MCP统一描述可调用能力。无论底层是VLA、程序化技能还是其他工具,规划器都通过统一定义进行选择和调用。
  • RPC连接工具、模型服务与机器人环境,使真实设备、仿真平台、本地进程和远程服务可以独立部署。
  • MHS面向更广泛的物理设备提供统一读写与控制抽象,使智能体未来能够从机器人扩展到实验仪器、家庭设备和工业系统。

(在开头的真机视频中展示的Franka和YAM的操控,都来自于统一接口。)

通过MCP、RPC与MHS的分层设计,RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系,让智能体能够像调用数字工具一样调用物理能力,从“操作数字资源”进一步走向“操作真实世界”。

03 Memory机制驱动,让一次成功沉淀为长期能力

能完成一次任务,并不意味着真正拥有了这项能力。

在物理世界中,试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景,一次错误操作甚至可能造成设备损坏。

如果每次执行结束后经验随即消失,智能体就只能反复从零开始。

RPent的Memory系统希望改变的正是这一点:让一次探索产生的经验,成为未来任务执行的基础。

RPent将经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度;相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。

记忆机制中包含Recipe,也就是可迁移的任务方案,而不是某一次执行中的固定坐标。

例如,系统可以记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用VLA完成抓取,并检查抓取结果”的操作过程。

当物体位置改变时,智能体重新观察环境,再复用相同逻辑,而不是直接沿用原来的坐标。

探索模式允许更新记忆;评测模式只读使用已经冻结的经验,使演进过程更加可控。

在LIBERO-Pro Goal实验中,引入记忆机制后,RPent在任务扰动环境下表现出明显提升:在位置交换任务中,成功率从31.0%提升至87.0%

此外,RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体,使单个智能体获得的能力能够成为整个系统持续进化的基础。

通过Memory系统,RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。

智能体的能力不再完全依赖模型预训练,而是在真实世界交互中不断增长。

04开启Flash Mode,让智能体跟上物理世界节奏

将大模型引入机器人控制回路,为智能体带来了更强的理解和规划能力,但也带来了新的挑战。

大模型推理速度通常远慢于机器人动作执行速度。在物理环境中,等待模型生成下一步决策可能成为整个系统的主要延迟来源。

因此,RPent并不是单纯追求更快的大模型,而是通过架构优化减少不必要的调用,让智能体运行节奏更加贴近真实世界。

在实际应用中,大量机器人任务具有较强重复性:任务目标和执行逻辑基本稳定,变化的主要是物理位置、姿态和环境状态。对于这类任务,如果每次都从头进行完整规划,无疑会产生大量重复推理。

RPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题,其核心技术载体是任务卡(Task Card)。

在探索阶段,RPent允许规划器调用大模型、VLA和程序化技能,尝试不同动作组合,并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件,不保存只能在一次场景中使用的固定坐标。

进入Flash Mode后,系统优先按照Task Card执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划器处理。这样既保留了大模型应对变化的能力,也避免在稳定流程中反复进行高成本推理。

在LIBERO Object的200次评测中,开启Flash Mode将平均执行时间从283.6秒降低至40.9秒,在成功率仅下降3.5个百分点的情况下,实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义:把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。

RPent将已经验证的任务逻辑沉淀下来,在环境发生变化时仅做必要调整,让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么,更能将已有经验转化为更高效的行动。

05 Leaderboard:展示模型与系统协同后的能力

社区当下对于Agentic Planner存在相同的问题:到底进展到哪一步了?

为了回答这个问题,RPent推出了Leaderboard板块(),采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。

△性能Leaderboard:目前展示了LIBERO-Pro、LIBERO、RoboCasa365 Target50与RoboTwin
△延时Leaderboard:目前展示了LIBERO-Pro、RoboCasa365与RoboTwin

GPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上,RPent/GPT-6 Astra达到92.63%,相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点;相比π_RLinf的50.0%高出42.63个百分点。此外,开启了Flash Mode的RPent明显降低了延时。

在RoboCasa365 Target50的厨房长程任务中,RPent/GPT-6 Astra达到59.20%,位列图中第一,高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后,能够有效转化为物理任务能力。

其余榜单也显示了RPent对不同模型与执行配置的兼容性:RPent/Opus-4.7在LIBERO达到96.0%;RPent/GPT-5.5在RoboTwin达到62.4%,均处于图中领先位置。

结果更值得关注的不是某一个模型单独完成了全部控制,而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。

为物理世界中持续进化的智能体,构筑开放的基础设施

从Codex、Claude Code到RPent,AI正在从“在数字世界完成任务”,走向“在物理世界完成任务”。

当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态

机器人需要看见环境、理解任务、调用不同能力、完成精细动作,还需要根据真实反馈不断调整策略,并把已经验证过的经验保留下来。

所以,围绕这一完整过程来组织智能体系统的RPent,并非只是一个开源的“让大模型控制机器人”的框架,而是一套能够连接模型、工具、机器人与环境,并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。

从一次任务,到一类任务;从一次执行,到持续进化。

RPent所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。

开源地址:https://github.com/RLinf/RPent

*本文系量子位获授权刊载,观点仅为原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。

文章评论(0

暂无评论,快来抢沙发~