教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

林知秋行业资讯📡 量子位2026-09-241098 阅读💛 267 收藏
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

专治人机动作对不齐

允中 发自 凹非寺

量子位 | 公众号 QbitAI

教机器人干活的“人类示范”,竟然不是人做的?

看这组对照视频:一边是人手操作,一边是机械手操作。乍一看,像是人先做了一遍,机器人再照着学。但顺序恰好反了——机械手那段才是真实记录,人手那段则是AI根据它生成出来的。

△Psi-W0将人手示范转化为机械手可执行的操作轨迹

为了让机器人学人,为什么反而要从机器人的动作开始?这看起来有点绕,却指向了一个很实际的问题:人类每天都在干活,这些经验,到底怎样才能交给机器人?

就在上周,Figure发布Helix 2.5,使用人类行为数据集Index进行预训练,在完成三类家务任务的适配后,将机器人带进30个未采集过数据的家庭进行测试。

这项研究关心的,正是从人类经验中学到的能力,能否帮助机器人应对新的环境。

灵初智能这次进一步追问:人类数据进了模型,不等于人的操作经验就能被机器人直接使用。这中间,还缺什么?

在十万小时级数据积累的基础上,灵初智能的模型Psi-R2.5继续改进数据质量与人机数据对齐方法,并进一步推进具体任务适配。它关注的不只是让机器人看过更多操作,还包括怎样把这些操作变成有效的训练材料,以及面对新任务时,怎样更容易地教会它。

而开头那个看似绕远的办法,恰恰是为了少绕一些弯路。

教机器人学人,这次先倒着来

人和机器人,都能拿起一瓶可乐。但两段“拿可乐”的视频放在一起,就能教机器人照着做吗?

这里面仍然存在一些“老生常谈”的问题:人手和机械手不仅长得不一样,关节结构、接触物体时的摩擦条件也不同。再加上人手姿态估计的误差,一个人可以顺利完成的动作,转换成机器人的关节运动后,未必还能成功。

所以,给机器人看懂“这是在拿可乐”,和提供一份“可以这样拿起可乐”的动作数据,是两回事。

灵初把人和机器人执行类似任务、主要在任务含义上对应的数据,称为“弱配对数据”。它更希望获得的,是另一种对应关系:除了人和机器人本体不同,两边的场景基本一致,动作时序逐帧对应,而且机器人一侧的动作能够在真机上直接回放成功,这就是“强配对数据”。

△弱Pair与强Pair的对比

强配对数据强调对齐,不只是要求人和机器人“都做了同一件事”,而是“人的这段操作,对应着机器人这段可执行的动作”。

但这样的数据,很难直接采集。

让人和机器人各做一遍,很难保证场景和动作时序逐帧对应。直接照搬人的轨迹也未必成功,因为两者的关节结构、摩擦条件并不一样。

今年4月,灵初已经尝试让Psi-R2与世界模型Psi-W0配合,通过轨迹推演和强化学习,将人类操作转换成可执行的机器人数据。问题是,这套流程涉及多个模型协同和策略优化,生产数据的过程比较重。

灵初巧妙地换了一个方向:为什么一定要从人类操作出发,再费力生成一段能够成功的机器人动作?

反过来,真实机器人操作的图像和动作,本来就是可用的。以它们为起点,生成匹配的人类数据,不就可以获得一份新的对照样本?

按照这条思路,灵初逆向使用Psi-W0,从真实机器人数据出发,生成对应的人手操作数据,再将这些高质量配对数据用于训练端到端转换器。这个转换器的输入是人类操作数据,输出则是匹配的机器人图像和动作

△高质量机器手-人手配对视频

△只需用手机在日常场景中录制一段人手操作视频,即可通过模型转换为对应的机器人数据。

这里需要区分一下,转换器不是负责决定机器人下一步做什么的策略模型,而是一个带动作输出的视频编辑模型。它要做的,也不只是把画面中的人手换成机械手,而是同时得到机器人可以使用的动作数据

那怎么判断转换有没有用?

灵初设置了两种验证方式:一种是直接在机器人上回放转换后的轨迹,看能否完成相同任务;另一种是把转换后的数据用于后训练,再看训练出的模型能否完成相关任务。

判断标准不再只是“生成的视频像不像”,而是数据能不能支持实际操作。据灵初介绍,转换后的数据已在上述两类测试中得到验证。不过,部分特别复杂的任务仍未直接完成,数据转换并不等于所有任务都已经解决。

沿着这条思路,Psi-R2.5也重新梳理了数据本身的质量。灵初减少同一任务的重复堆积,增加任务多样性,并通过自动标注管线,把任务拆解到更细的原子动作,再进行标注和审核。

毕竟,数据的价值,不能只按小时算,还得看覆盖了多少种任务、机器人能用上多少。

△Psi-R2.5多任务评测效果

视频,也能当机器人的prompt

如果一段人类操作,已经能转换成机器人更容易使用的参考,那么它或许也可以有另一种用途:不只是进入训练集,也可以成为当前任务的提示。

这也意味着不必把所有要求都写成一大段指令,而是给机器人一个例子——“照着这个来”。

这是灵初在Psi-R2.5中进一步探索的上下文学习,也就是In-Context Learning,简称ICL。在其展示的任务中,机器人不需要更新模型参数,而是根据当前上下文提供的线索,推断该做什么、该如何做

△Psi-R2.5 In-Context Learning展示

这里有一个关键变化:新示范不一定要再走一遍训练流程,才能影响机器人的行为。它也可以作为当前任务的参考,交给已经训练好的模型使用。

难点仍然在于,示范来自人,执行者却是机器人。灵初的思路,是利用前面的强配对数据模型,将人类示范转换成对应的机器人数据,再更好地作为提示输入模型。

同一种数据转换能力,由此有了两个用途:一是准备训练材料,二是帮助机器人理解眼前的示范

这也与Psi-R2.5的双层架构相衔接。它的上层模型负责拆解长程任务,把一段较长的指令分成子任务;下层模型则结合子任务和当前观测,输出具体操作轨迹。一个负责拆清楚要做什么,一个负责落实到动作。

换个任务,不一定要重新训练模型,也可以用一段示范告诉机器人该怎么做。

当然,这里的不用重新训练,不等于模型此前没有训练过,也不等于随手拍一段视频,就能让机器人完成任何工作。目前灵初展示的是特定任务中的ICL能力,更多实现细节尚待公布。

但它提供了一个值得继续观察的方向:人的示范,不一定只能是离线训练时使用的材料,也可能成为实际使用机器人时的一种交互方式。

99%成功率,不止靠预训练

预训练已经用了十万小时级的数据,为什么到了客户现场,机器人还得接着练?

在灵初看来,真实部署面对的物品种类、规格和作业节拍,往往带有很强的定制化要求。短期内,不能指望基础模型完全不做适配,就直接进入所有客户现场;后训练仍然是必要的一环。

那训练基础模型的意义是什么?

灵初在最新的Tech blog中明确指出,预训练并不是让后训练立刻消失。从部署角度来看,现阶段训练基础模型的意义应该是让后训练需要的数据更少,从而降低适配与部署的成本

手机盒装配,就是一个具体例子。这个任务涉及多个步骤,对操作精细度也有较高要求。据灵初介绍,通过结合人工参与与强化学习的后训练框架,经过几轮迭代,任务成功率达到约99%,耗时1-2个工作日

预训练积累的本事,在这里派上了用场:机器人不用从零学起,只需补充少量任务数据,再通过人工参与和强化学习,把容易出错的地方练好。

到了客户现场,训练也没有结束。机器人在哪里失败,相关数据就被收集回来,用于下一轮改进。团队表示,这套方案已经用于实际客户现场,处理作业中遇到的复杂情况。

这与前面的示范引导并不矛盾。示范提供一种表达新任务的方式,后训练则继续处理具体操作中的难点。两者不是要求机器人每次都从零开始,而是在已有能力上,减少适应新需求的额外投入。

Psi-R2.5正把预训练积累的能力用到具体工作中。用好人类经验,让客户少花时间、少花成本就能把机器人用起来,是灵初持续改进基础模型的目标。

Tech blog:https://cypypccpy.github.io/tech-blog.github.io/

*本文系量子位获授权刊载,观点仅为原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。
具身智能 数据 灵初智能 视频
思邈
  • Jev vs Decitron:同为决策AI,为什么不是一回事?2026-09-23
  • 刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降2026-09-23
  • GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent2026-09-21
  • OpenAI刚曝光循环架构,这家公司更早将其用于世界模型2026-09-10

相关阅读

文章评论(10

晨沐雨4 小时前

路过

回复
雪知秋5 小时前

很有价值的分享,感谢整理。

回复
林观澜5 小时前

看完了,收获满满,期待更多更新。

回复
三分糖去冰2 小时前

点赞,必须点赞

回复
空向阳4 小时前

这篇文章分析得很透彻,收藏了!

回复
空向阳4 小时前

作者写得真不错,学到了不少。

回复
逐光而行3 小时前

看完了,收获满满,期待更多更新。

回复
三分糖去冰2 小时前

讲解得很细致,新手也能看懂。

回复
星寻梦2 小时前

作者写得真不错,学到了不少。

回复
空向阳1 小时前

刚好最近在找这方面的资料,太及时了。

回复