机器人学停滞 70 年:Skild AI 的 Deepak Pathak 谈通用大脑与数据飞轮

📌 One-Sentence Summary
CMU 教授、Skild AI 联合创始人 Deepak Pathak 指出,机器人学之所以停滞 70 年,是因为它一直被当作硬件问题而非通用大脑问题;要像语言模型一样实现规模化,就必须沿可扩展性、多样性、与机器人的贴近度三条轴评估每种数据源,并把部署数据回流成数据飞轮,而这只有「任意机器人、任意任务、单一大脑」的全机体智能才能实现。
📝 Summary
Deepak Pathak 开场便给当前的机器人热潮泼了冷水:上世纪五六十年代的演示影像,包括 MIT Copy Demo 和 1957 年的主从式遥操作展示,与今天的视频几乎无法区分,因为机器人学始终被当作硬件问题来攻关,缺的从来是通用大脑——这正是莫拉维克悖论的体现。语言模型的配方无法直接照搬,因为机器人领域没有互联网级数据:遥操作约一分钟才能采集一条样本,就算雇下全部美国人口,也要花一个多世纪才能达到 GPT-3 的训练规模。他随后回顾了自己职业生涯里的四种数据来源——好奇心驱动的自主探索、遥操作、仿真和人类视频——并沿可扩展性、多样性、与机器人的贴近度三条轴逐一权衡,指出它们短板互不重叠、彼此互补,由此得出 Skild 的配方:在可扩展、多样、低质量的数据上预训练,在高质量的遥操作数据上后训练,再把部署数据回流成数据飞轮,而这只有「任意机器人、任意任务、单一大脑」的全机体智能才能实现。他还借此重估任务难度——叠衣服因误差容忍度高而其实容易,夹爪插 AirPods 才是真难,爬楼梯比后空翻更难,因为它需要视觉与对未观测世界的理解——并用约 4000 美元、仅靠一个相机的煎蛋工作站(不到 10 小时数据端到端训练而成)、无建图无规划的爬楼梯、已在 Nvidia 休斯敦工厂上线的 GPU 组装、门前配送,以及断腿后毫秒级在线适应的机器人,论证了通用性让安全成为副产品。
💡 Main Points
机器人学已经「即将实现」了 70 年
上世纪 60 年代的 MIT Copy Demo、1957 年的主从式遥操作展示、深度学习出现前会和人玩桌上足球的人形机器人,看上去都与今天的演示无异,因为这个领域始终从硬件入手攻关,而真正缺的是通用大脑。
机器人领域没有互联网级数据
GPT-3 训练用了超过 30 万亿 token 才开始奏效,而遥操作约一分钟才能采到一条样本;就算雇下全部美国人口,也要一个多世纪才能达到同等规模,纯人工采集既慢又贵。
用可扩展性、多样性、贴近度三条轴评估数据源
自主探索数据、遥操作、仿真和人类视频各自在不同轴线上失分,且短板互不重叠,因此可行配方是:在可扩展、多样、低质量的数据上预训练,再在稀缺而高质量的遥操作数据上后训练。
全机体智能是部署数据飞轮的前提
硬件永远不会收敛到单一机型,只有让任意机器人、任意任务共用一个大脑,部署数据才能回流进预训练;通用性还让安全成为副产品——机器人断腿后能在毫秒级在线适应并重新行动。
爬楼梯比后空翻更难
后空翻只需要了解机器人自身完全可观测的身体,这正是计算机擅长的;而爬上陌生的楼梯需要视觉与实时理解——莫拉维克悖论由此解释了为什么观赏性动作被过度展示。
💬 Key Quotes
但我想强调的是:机器人学在过去 70 年里一直处于「即将实现」的状态。
你可以算一笔账:就算雇下全部美国人口,也要花一个多世纪才能达到 GPT-3 的规模——而今天已经没人用 GPT-3 了。
人们常拿灵巧手当机器人学尚未实现的借口,但事实并非如此——缺的从来是背后的智能。
如果人形机器人爬不了楼梯,那还要腿干什么?腿存在的唯一理由就是这个。
设想是:全世界任何机器人在任何地方采取任何行动,都会让幕后的大脑变得更强,因为它是一个全机体大脑。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: AI Engineer
Author: AI Engineer
Category: 人工智能
Language: 英文
Read Time: 19 min
Word Count: 4551
Tags:
AI 与智能应用 , 具身智能 , 人形机器人 , 视频 , 机器人学
Play Full Video
暂无评论,快来抢沙发~