“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”

林知秋行业资讯📡 量子位2026-09-261034 阅读💛 173 收藏
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”

文婷 发自 凹非寺

量子位 | 公众号 QbitAI

足球界的AlphaGo来了!

在“虚拟世界杯”自我对弈140年后,终于带着球技出山。

视频中的人形机器人“Messinator”穿着阿根廷队服,丝滑地带球过人,一脚射门:

这一成果来自美国具身智能独角兽Skild AI。

有网友看完忍不住感叹:

最妙的是奖励函数只给了进球,盘带、护球、倒地爬起来全是自己“悟”出来的。
AlphaGo那套self-play方法论又在物理世界又走通了一次;
虚拟世界杯踢140年,值了!

那么这个Messinator究竟是一个怎样的机器人?

造出它的Skild AI又是什么来头?

看下去就知道了。

“梅西终结者”,在虚拟世界杯苦练140年

Messinator这个名字拆开看很有意思。

它的前半截是梅西(Messi),后半截来自经典科幻电影《终结者》里的机器Terminator,把这俩合在一起就是“梅西终结者”。(big胆hhh)

它真正大脑是Skild AI此前推出的旗舰机器人基础模型S1。

而S1最核心的能力,就是让机器人像大模型一样“上下文学习”。

我们只需给它看一段任务示范视频,它就能把视频当作“提示词”,逐步理解咱们想完成什么任务,并把视频里的意图和动作转换成适合自己身体的执行方式。

最爽的是,它碰到新任务不用回炉重造,直接就能上手。

不过,会看视频还只是第一步。

Skild AI认为,像S1这样的基础模型主要从人类数据中学习,能力上限难免受人类经验限制。

如果想继续变强,就得让机器人自己创造经验,并尝试着自己去发现人类没教过的动作。

于是,Skild AI又在S1基础上加入了强化学习和self-play,也就是自我对弈。

它的整个训练设置并不复杂,团队把机器人放进了NVIDIA Isaac Sim搭建的虚拟足球场,并只给它设定了一个最终目标:进球,拿到高分。

然后,在整个训练过程中,没有人为盘带单独设置奖励,也没有人为护球、抢断、射门和倒地起身逐一打分。

机器人面对的对手,只是自己此前保存下来的模型版本。

通过新旧版本反复比赛,赢下来的新策略,又会成为下一轮训练中更难对付的对手。

于是,每一次进步,都会为机器人自动制造出下一道难题。

Skild AI技术博客显示,机器人刚进入虚拟球场的前几个月连走路都不利索;

但等它“长到大学生的年纪”,便自行学会了摔倒后重新站起来。

而随着对手不断变强,机器人盘带绕过防守、用身体护球、主动抢断等更复杂的行为也开始陆续出现。

全程没有工程师规定它必须这样做;

它保留下这些动作只有一个初心:它们能帮自己赢球。

这正是self-play最迷人的地方。

当年,AlphaGo正是通过与自己对弈,逐渐发现了一些连顶尖棋手都没预料到的下法,并于2016年4:1一举击败韩国传奇棋手李世石九段,正式拉开了AI变革的序幕。

现在,Messinator也通过自我对弈、在虚拟世界踢了140年世界杯,将足球策略迁移到了真实人形机器人上。

最终,Messinator不仅能走到球前完成射门,还学会了带球、护球、抢断,并在真人对抗中调整自己的位置和动作。

Skild AI通过这场硬核的演示,充分证明了机器人不一定都要由人类亲手教会新动作;

它也可以自己练、自己输、自己总结,再自己变强。

而这,恰好就是Skild AI过去几年一直在押注的方向。

一颗大脑,控制所有机器人

2025年7月,Skild AI正式推出了一套能够跨硬件运行的机器人基础模型——Skild Brain。

它的核心主张是:

Any robot, any task, one brain.

目标是打破“一种身体配一套大脑”的行业桎梏,让不同形态的机器人执行不同任务时都可以使用同一颗大脑。

随后没过两个月,Skild又进一步公开了一组omni-bodied训练成果。

团队在仿真世界中生成了约10万种身体结构各异的机器人,让同一个模型累计训练约1000个仿真年。

到了测试阶段,模型还得直接接管训练时从未见过的机器人。

哪怕机器人突然断腿、关节锁死、轮子卡住,或者背上额外负重,模型也不会立刻“趴窝”,而是会根据身体状态在线调整重心和运动方式。

部分情况下,它甚至只需几秒钟的时间就能重新找回平衡,并摸索出新的移动方法。

这套omni-bodied训练体现了Skild最核心的思路:

机器人见过的身体越多,就越难靠死记硬背过关。
为了能同时控制10万种不同的身体,模型只能尝试理解平衡、关节、重心和动力之间更通用的物理规律,而不是背下一款机器人的固定步态。

如今的Messinator,正是延续了这条技术路线,并进一步叠加了self-play。

其中,Skild Brain负责赋予它控制身体、保持平衡和应对碰撞的基本功;

self-play则负责让它思考“下一步该怎么做,才会更好?”。

而从10万种机器人身体,到140年的虚拟世界杯,Skild这条看似疯狂的技术路线并非横空出世。

把这些想法从论文一路推向真实机器人的,是两位在机器人学习领域深耕多年的卡内基梅隆大学教授。

两位CMU教授,联手造机器人大脑

Skild AI成立于2023年,脱胎于卡内基梅隆大学(CMU)机器人研究体系。

团队成员既包括来自卡内基梅隆大学、斯坦福大学、加州大学伯克利分校等高校的研究人才,也包括曾任职于Meta、Tesla、NVIDIA、Google、Amazon和Everyday Robotics等机构的研究员及工程师。

而联合创始人兼CEO Deepak Pathak的经历,几乎串起了Skild AI的整条技术路线。

他本科毕业于印度理工学院坎普尔校区计算机专业,后赴加州大学伯克利分校攻读计算机博士,师从计算机视觉领域知名学者Alyosha Efros和Trevor Darrell。

博士毕业后,他曾在Meta(前Facebook)AI Research从事研究工作,也曾在伯克利与机器人学习专家Pieter Abbeel合作,担任访问博士后。

此后,他进入卡内基梅隆大学,成为机器人研究所和机器学习系教授。

Deepak Pathak最具代表性的研究之一是“好奇心驱动的探索”。

这项研究等基本思路是,与其让机器只能依赖人类设计的外部奖励,不如赋予它一种内在动力,让它对陌生和难以预测的现象产生“好奇”,并主动探索环境,并在探索中学会新的能力。

Deepak这套研究思路后来又延伸到自监督机器人学习、视觉模仿学习、Sim2Real和自适应控制等方向。

在创办Skild AI之前,Pathak还曾联合创立人脸识别公司VisageMap(该公司后来被FaceFirst收购)。

Skild AI的另一位联合创始人兼总裁Abhinav Gupta,博士毕业于马里兰大学计算机系,现任卡内基梅隆大学机器人研究所教授;

他曾参与建立Facebook AI Research匹兹堡实验室,并担任研究管理和领导职务。

并长期专注于研究大规模视觉学习、自监督学习、终身学习、机器人操作和物理常识,是早期“让机器人通过自主交互收集训练数据”路线的重要研究者。

曾获得斯隆研究奖、PAMI青年研究员奖、IAPR J.K. Aggarwal Prize等奖项。

Anyway,家人们,你们说要是哪天“Messinator”真进化到能踢世界杯,像当年AlphaGo对战柯洁那样,跟梅西来一场世纪人机对决,咱们能受的了吗?

参考链接:
[1]

[2]

[3]

[4]

[5]

[6]

[7]

[8]

[9]

版权所有,未经授权不得以任何形式转载及使用,违者必究。
机器人
林, 方舟
  • OpenAI闯大祸!GPT竟黑进医保系统,黄仁勋:管不住就关掉2026-09-25
  • 给机器人当老师,还能赚外快?“中国版Index”觅蜂派来了2026-09-25
  • 实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招2026-09-16
  • 探索RSI,生数新世界模型让机器人开始自我进化2026-09-14

相关阅读

文章评论(12)

墨沐雨1 天前

讲解得很细致,新手也能看懂。

回复
拾贝者1 天前

点赞,必须点赞

回复
黄小刚1 天前

实测过类似工具,作者说的基本属实。

回复
星寻梦1 天前

刚好最近在找这方面的资料,太及时了。

回复
南山客23 小时前

实测过类似工具,作者说的基本属实。

回复
雪知秋23 小时前

楼主辛苦了,内容很有参考价值。

回复
雪知秋22 小时前

很有价值的分享,感谢整理。

回复
墨沐雨23 小时前

写得挺用心的,支持一下。

回复
星寻梦22 小时前

内容翔实,正好需要,先收藏再看。

回复
陈皮话梅糖21 小时前

作者写得真不错,学到了不少。

回复
龙文博21 小时前

点赞,必须点赞

回复
杨丽华21 小时前

点赞,必须点赞

回复