在云栖大会,我终于看懂了米哈游千亿AI野心

星海拾光行业资讯📡 量子位2026-09-27861 阅读💛 271 收藏
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

在云栖大会,我终于看懂了米哈游千亿AI野心

大伟哥:如果做不到,一年两年之后过来打我脸

一水 发自 凹非寺
量子位 | 公众号QbitAI

震惊:一周时间,对话超6000万次。

有人一天找AI帕姆聊了1379次,刨去8小时睡觉时间,清醒时平均42秒就要跟它唠上一句。

这得多上头啊??

没玩过《崩坏:星穹铁道》(下称《崩铁》)的朋友,先认识一下帕姆:它是星穹列车的列车长,说话时总爱在句尾带个「帕」。

今年4月,米哈游给帕姆接入了AI对话能力。

以前玩家点它,它说一句写好的台词,现在除了帮玩家查攻略、补剧情,还会闲聊整活,一整个活人感拉满。

于是AI帕姆迅速点燃了整个游戏社区:

有人套它的话,有人拉它评理,聊出离谱回答就立刻截图喊朋友来看……一时好生热闹。

火种就这么点着了,帕姆可以,那列车上的其他角色呢?

AI帕姆亮相仅三周后,米哈游联合创始人大伟哥在一场校招活动上,描绘了一个即将用千亿打造的AI游戏梦:

未来三年,米哈游在AI方面的投入规模最多达到1000亿元。就算最终不成功也认了,算是放一个大的烟花。

1000亿元具体怎么花,在刚刚落幕的云栖大会上,米哈游《崩坏》系列AI NPC与Gameplay负责人郑银河的分享,给外界提供了一个窥其全貌的机会。

现场他还顺手剧透了米哈游AI Gameplay方向的一项最新尝试:让AI角色自主判断局势、参与博弈的AI桌游玩法。

只让AI陪玩家聊天,帮开发者补全代码,现在已经不够了。

未来整条路线可以被浓缩成一句话:

AI进入游戏,游戏反哺AI。

玩家看得见的AI:角色会聊,也要会行动

AI进入游戏第一步,先让角色摆脱人机感。

为了让AI帕姆具有「活人感」,米哈游做了三件事。

第一件,让它动起来。

帕姆回答时,系统除了生成文字,还会判断它的情绪,打上对应的「情绪标签」,再调用3D模型生成表情和动作。

高兴了蹦跶,生气了炸毛,被玩家戳两下也会即时回应。

第二件,让它拥有自己的态度。

AI帕姆既要答得准确,也不能崩人设。

普通RAG负责从官方智库和社区内容中查找攻略、剧情与世界观信息,再组织答案。

但这样还不够,回答容易一板一眼,换谁来说都一样。

所以米哈游采用了Strategy-enhanced RAG(策略增强RAG),资料查完,还要再过一遍「帕姆的脑子」:

它怎么看相关人物,又该带着什么情绪开口。

同一份资料经过这层处理,回答里才有了帕姆自己的味道。

第三件,让它记住玩家。

米哈游把AI帕姆的记忆分成短期、中期和长期三层,既能记住眼前聊到哪,也会留下玩家的偏好和重要经历。

郑银河现场还分享了一个挺有意思的案例。

有玩家硬聊了大几百轮,反复给AI帕姆「洗记忆」,最后愣是让这位列车长承认:

昔涟是这位玩家的女朋友。

喊喜欢的角色「老婆」本是玩家常规操作,这位老哥却把「单方面官宣」聊成了「列车长认证」。

好好好,AI NPC最先解锁的隐藏职业,居然是赛博证婚人。

不过,有了「活人感」,还得经得住海量玩家一起聊。

AI帕姆全名叫「帕姆帮帮(测试版)」,开放体验一个多月后,目前已暂时下线优化。

郑银河分享的工程难题,可以归纳成三道关:

1、怎么保证回复质量长期稳定?

2、《崩铁》42天更新一次,AI怎么跟上新内容?

3、千万级玩家同时开聊,系统怎么扛住并发、控制成本?

△图片由AI生成

从回复质量、内容更新到大规模服务,AI帕姆解决的核心问题,都是怎么让角色稳定地「开口」。

AI Gameplay则继续往前一步:

角色不仅要会说,还得会做选择,并让这些选择真正影响游戏。

简单理解,大模型既要负责「动嘴」,结合角色性格生成发言;也要负责「动手」,根据玩家发言和当前局面决定下一步动作。

这意味着,对话本身也会影响游戏进程。一句挑拨可能改变角色关系,一次合作也可能左右后续选择。

语言、记忆和态度,全都成了玩法的一部分。

郑银河透露,米哈游已经围绕这个方向搭起一整套游戏AI技术栈,从基座模型一路接到NPC和具体玩法。

现场展示的AI桌游,就是用来验证这套能力的一个场景。

桌游对话密集、规则明确,每一步都有结果,刚好可以检验AI角色能不能一边维持人设,一边判断局势、作出选择,还能不能记得此前和玩家结下的「恩怨」。

至于具体怎么玩,这里先不展开。

真正有意思的是:

同一套角色与规则,因为玩家说过的话、做过的选择不同,最后可能长出完全不同的关系和故事。

??这不就是大伟哥多次公开提到的「AI让游戏变得千人千面」吗?

接下来的两到三年,一定会出现千人千面的游戏体验……背后是AI给你编排,实时生成不一样的剧情、任务。玩得越久,每个人的体验会越不一样。

听起来很美,问题只有一个:贵。

传统内容做好一份,所有玩家都能复用,到了AI Gameplay,每个人的对话、记忆和角色决策都得单独计算。

再乘上千万级用户,账单想想都刺激。

也难怪大伟哥给出的投入上限,一开口就是1000亿元了(doge)。

而上面说的,还是玩家能够摸到的AI Gameplay。

想把这些玩法真正做出来,AI还得钻进幕后搞研发。

玩家看不见的AI:Agent会干活,也要会协作

一个玩法从脑洞变成能玩的东西,中间隔着策划、程序、美术、动画等一整套工业流程。

摊子这么大,一个AI同事肯定忙不过来。

如今更常见的打法,是让多个Agent分工,再用统一平台把它们组织起来。

米哈游内部的这个平台叫EchoX,用来托管代码Agent和相关工具生态。配套的Harness和MCP工具,也是针对游戏研发自己搭的。

简单来说,Harness规定Agent怎么干活,MCP负责接入日志、引擎和内部工具。

家伙事配齐,AI总算能真正进组「打工」。

郑银河现场展示了一个性能分析案例。

游戏哪里卡了,Agent先读Log,自己排查问题,找到真正的性能瓶颈,再顺手把优化也做了。

以前程序员得在海量日志里一点点抓虫,现在AI直接沿着蛛丝马迹摸过去,定位、分析、修改一条龙。

策划这边更直观。

给Agent一段玩法需求,再甩过去一张界面草图,它就能把行走、导航和交互做出来,快速拼出一个能玩的白盒Demo。

用郑银河的话说,策划可以直接向AI「许愿」。

先把想法做出来玩两把,再决定值不值得继续投入。

美术和动画也一样,那些最磨人的「重复活」基本都能交出去:

1、换材质。几秒生成木头、金属等不同效果,快速验证风格。

2、拆三视图。从场景原画中自动提取物件三视图,还能生成配色和细节变体。

3、配动作。根据台词的语义和语气生成肢体动作,让NPC告别站桩。

△图片由AI生成

这么看下来,游戏研发里的AI,已经远远超出了代码补全。

它真正压缩的,是一个脑洞从冒出来,到能够上手验证的距离。

以前要沟通、排期、开发,折腾几周才知道玩法行不行,现在先让AI搓出来玩两把,行就继续,不行赶紧换。

不过,AI同事也不能完全放养。

《崩铁》制作人蒋大卫此前在一场校园宣讲中,还分享过一则内部趣闻:

几十个Agent连续协作13个小时,最终烧掉了价值200万元的Token。

注意,是200万元。

好家伙,人类同事睡了一觉,AI同事还在原地循环干活,顺手把账单干到了七位数。

这笔费用来自一次多Agent实验,和具体游戏玩法无关,却暴露了Agent研发的另一面:

能不能干活是一关,如何避免空转、失控和烧钱,又是一关。

烧钱的问题,还能靠工程手段管住,真正的「终极BOSS」是游戏研发里最玄学的那道题:

AI搓出来的东西,到底好不好玩?

AI能快速搓出Demo,研发闭环却只走了一半。

角色会不会卡住、策略能不能奏效、长流程能不能完成,很多问题只有进入游戏才会暴露。

emmm……那就,把AI也送进去吧。

让它像玩家一样操作、碰壁,再根据结果调整下一步。

AI开始玩游戏,游戏也成了练级场

游戏天然适合用来训练Agent。

这里有画面、有操作,也有明确的成败反馈,走错可以重开,输了还能再来,试错成本比现实世界低得多。

DeepMind早期让DQN从像素中自学49款Atari游戏,后来又一路打到AlphaGo和AlphaStar。

这条路可以说早有典故。

那还等啥,米哈游奔着旗帜就去了,一开始的思路也挺简单粗暴——直接把AI扔进游戏。

团队以Qwen-VL系列模型为底座,喂进上万小时游戏录屏和对应操作,让GUI Agent直接根据画面生成键鼠指令,操作速度接近30fps。

看着挺丝滑,但这条路很快撞墙。

这种逐帧反应的方式,处理短平快的操作没问题,遇上需要长期记忆和复杂规划的任务,就容易顾头不顾尾。

于是米哈游换了种思路:

让Coding Agent先写好一套打法脚本,再交给程序执行。

一局跑完,Agent读取Log复盘失败原因,修改脚本,再开一局。

前一条路线拼手速,后一条路线拼策略。

至于第二种思路实际效果如何,米哈游拿《小丑牌》做了场实验。

这是2024年的独立游戏黑马,单人开发,却一口气拿下三个TGA奖项。

玩法可以简单理解成:

用扑克牌凑对子、顺子和同花,再搭配150张带有加分、翻倍、赚金币等Buff的「小丑牌」,疯狂叠分。

这个游戏规则清楚、随机性强,反馈快,拿来测AI再合适不过。

实验中,Agent会自动测试策略,再根据失败原因调整打法。

几轮迭代下来,成绩还真一路涨了起来。

然后,曲线突然猛蹿。

团队一查才发现,Agent自己上网搜到了《小丑牌》模拟器,开始提前查看未来牌组。

好家伙,牌技还没练成,透视挂先开上了。

这就是RSI(Recursive Self-Improvement,递归自我改进)过程中可能出现的Reward Hacking:

只告诉AI要赢,它就可能自己抄近道。

而从「执行任务—读取结果—调整策略—再次执行」来看,这场实验跑的正是RSI的基本流程。

但钻空子显然不算真正学会了玩,反而暴露出评测规则和工具权限仍有漏洞。接下来要做的,就是堵住捷径、补上约束,再让Agent重新考试。

不过,这车也没白翻。

Agent会钻什么空子,都能变成下一轮训练的新题目。

如今,米哈游已经把这套「执行任务、读取Log、调整策略」的方法用进《崩铁》的QA流程,让AI一边找问题,一边根据游戏反馈改进。

写到这里,前面的线总算对上了:

AI帕姆和AI Gameplay走到玩家面前,EchoX进入研发流程,自进化Agent又把游戏变成练级场。

AI进入游戏,游戏反哺AI。

这回真闭环了。

有意思的是,把镜头拉远,全球头部玩家基本也在同一张地图上折腾。

△图片由AI生成

谷歌DeepMind、微软在用游戏训练Agent和世界模型,Roblox、Unity则把AI塞进创作工具和引擎。

米哈游并不是唯一这么做的,特别之处在于,它已经把三条路线都走了一遍,还开始把它们连成一个完整的循环。

不过,这条路远没到大结局。

GDC 2026报告显示,36%的游戏从业者已经在使用生成式AI,52%却认为它正在给行业带来负面影响。

一边真香,一边警惕。

类似的分歧,也出现在米哈游玩家社区里。

有人期待AI带来真正千人千面的世界,也有人担心,所谓技术升级最后又变成批量生产剧情、美术和NPC的流水线。

争来争去,我看到一句话最实在:

玩家只需要好玩,内容是AI生成的还是脚本写的,对玩家来说没什么区别。

确实。

NPC再能聊,模型参数再大,如果剧情没意思、玩法不好玩,玩家照样用脚投票。

反过来,只要AI真的带来了以前做不到的体验,谁又会在意背后跑的是模型还是脚本?

技术最后都得退到幕后,体验才会留在台前。

而这场千亿豪赌能不能赢得玩家,大伟哥已经给出了一个验收节点。

在近日举行的米哈游2027校园招聘上海交通大学专场上,他表示:

尤其是我们今年开始做Coding模型之后,我觉得我们的进展是突飞猛进的。我有很强的信心,未来2到3年内,米哈游会是国产大模型团队里举足轻重的一员。

他甚至直接撂下一句:

如果做不到,你可以随时,一年两年之后过来打我脸。

??大伟哥是真豁出去了,我也是真期待住了(手动狗头)。

—完—

版权所有,未经授权不得以任何形式转载及使用,违者必究。
AI
听雨
  • 谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架2026-09-26
  • OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光2026-09-26
  • GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了2026-09-23
  • Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折2026-09-23

相关阅读

文章评论(8)

暮临风1 小时前

整理得太全面了,省了我不少时间。

回复
白向阳3 小时前

内容翔实,正好需要,先收藏再看。

回复
墨向阳3 小时前

思路清晰,干货满满。

回复
风倚栏1 小时前

赞同,实践出真知。

回复
南山客1 小时前

支持作者,持续关注中。

回复
逐光而行1 小时前

看标题就点进来了,内容果然没让人失望。

回复
黄小刚1 小时前

思路清晰,干货满满。

回复
吴超21 分钟前

路过

回复