陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

山止川行行业资讯📡 量子位2026-09-221272 阅读💛 19 收藏
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。

田晏林 发自 凹非寺

量子位 | 公众号 QbitAI

5天。

不用搭景,不用等演员,导演陆川和团队,直接用AI把一场发生在400年前的明代灾难现场,搓出来了!

宫廷、火药库,还有史料中烟云如黑灵芝的大爆炸。按照传统影视工业的做法,这样的场景复原往往需要数月时间和千万级投入。

但这次,他们只用了5天!

来,话不多说,先看短片。

「链接」

怎么样?够猛吧?

人物的脸、皮肤、神态已经相当逼真,几个明代人物也不再是过去那种一眼AI的塑料感。

再看爆炸。烟尘、碎片、火光一起往外冲,这种最容易穿帮的复杂场面,也都稳稳接住了。

要按传统影视工业的路子来,过去光是一场爆炸戏,就要耗费19天。

这次,陆川团队把史料里的文字一点点翻译成现代视觉概念,前后大约做了四轮提示词优化,再参考真实爆炸影像去校准。

最后,阿里视频生成模型对烟尘、碎片这些复杂画面的还原,准确度已经达到团队预期的95%以上。

现在的AI已经进化到不只是给导演吐几段素材而已了。

从史料搜集、画面制作到主题讨论,它开始进入完整创作链路;单在视频生成环节,阿里模型的贡献度就超过了一半。

9月22日,在云栖大会上,阿里云又来了一波大的,直接把模型家底都端了上来。

先看千问基座模型,架构、自我进化、全模态、参数规模,几乎每一层都在往前推:

Qwen3.8-Max开始自己训练自己,Qwen3.8-Flash提前放出下一代架构,Qwen3.8-Omni为大模型开辟全新的思考分区,Qwen4已经开练,Qwen4.5、Qwen5也在路上。

而且,参数规模更是直接瞄准5万亿~10万亿

另外,图像生成模型Qwen-Image-3.1、音乐生成模型Happy Shrimp 1.1、世界模型HappyOyster 2.0 Preview、语音模型家族Qwen-Audio-3.1、同声传译模型Qwen3.8-LiveTranslate也集体亮相。

下一代视频生成模型则预告将于11月发布。

单拎哪个模型出来,都能讲半天。但结合陆川的短片,放在一起看,味道就不一样了。

阿里这一轮全模态升级,已经不太像是在补单项能力。它更在意的,是这些模型能不能更快进入场景,变成真正的生产力。

阿里的全模态拼图,基本铺齐了

把这次云栖大会的模型更新全部摊开,一张相当完整的全模态地图已经摆在眼前。

文字和通用智能这边,有Qwen3.8,以及已经投入训练的Qwen4。

往外看,图像生成与编辑有Qwen-Image-3.1;视频生成有Wan、Happy Horse系列,以及计划11月发布的下一代视频模型;声音这边是Qwen-Audio-3.1,音乐则交给Happy Shrimp 1.1。

再往真实世界延伸,HappyOyster 2.0 Preview开始处理世界模型和交互环境;Qwen3.8-Omni-Flash把文字、图片、音频、视频放进统一理解框架;Qwen Intelligence继续把Agent能力推向手机终端。

这一串名字看下来,很容易有种新品发布会开到停不下来的感觉。

可把它们塞进一项具体任务里,关系就清楚多了。

拍一条广告,脚本、商品图、人物、口播、音乐,本来就混在一起;做一部电影也一样。

导演给模型的可能是一段文字、一张参考图、一首音乐,最后交付的是一套完整的视听内容。

现实任务天然就是混合模态的。

文字、图像、视频、声音、空间信息往往同时出现,模型最终要处理的,也很少是一种单独的信息。

现实任务不分模态,模型也很难再一项一项地做。

云栖大会现场,阿里巴巴ATH事业群副总裁、淘天集团首席科学家郑波提到:

文本、图像、视频、声音、空间的能力正在加速协同,AI也从生成一张图、一段视频、一首音乐,继续走向理解人的意图,创造完整沉浸式视听体验。

阿里方面判断:如果语言模型是机器的大脑,多模态模型正在成为机器感知世界、创造内容并与物理世界互动的中枢。

这时候再回头看阿里这一整套模型布局,关系就更清楚了。

Qwen负责语言、知识和推理;Image、Wan、Happy Horse、Audio、Happy Shrimp把能力往视觉、影像、声音和音乐延伸;HappyOyster再往三维空间和交互环境里走。

Omni继续处理不同模态之间的统一理解,Agent则把这些能力接进实际任务。

当这些能力开始被放进同一条任务链里,评价标准也跟着变了。

一张图生成得多漂亮,一段视频有多炸裂,依然重要。到了生产环境里,还会多出一长串更现实的考题。

能不能稳定交付,能不能连续工作,能不能理解同一个任务?

从Demo走进生产线,多模态开始接受真考验

这些问题,只有进了真实工作流才会彻底暴露出来。

第一层:内容生产

这是最成熟的一层,也是视频模型最先撞上的考题。

Wan3.0已经支持单次30秒生成,还能接受文档、表格、网页等结构化输入。

据阿里披露,它曾经在Artificial Analysis的文生视频和视频编辑两项榜单上位列第一。

但到了商业场景,榜单只能算入场券。

比如广告,一条片子里的商品外观、Logo、人物和口播只要有一个漂掉,前面生成得再炫也很难直接交付。

这套更苛刻的指标,同样落在了图像、语音、音乐等其他模态上。

「能不能稳定生产」,已经成为多模态进入生产环境后的核心考题。

不过,Wan3.0已经拿到正向反馈了。据使用者介绍,Wan3.0已接近真实广告拍摄水平。

第二层:进入专业创作

陆川的《历史·现场》就是一个很典型的样本。

5天重建一场400年前的历史现场很惊艳,但这次尝试更有意思的地方,其实是它把AI带到了创作者真正难啃的位置。

通用模型很容易生成大家熟悉的古装剧质感,真正的历史现场反而需要陌生感,需要更严谨的史料,也需要模型理解导演到底想表达什么。

对此,阿里巴巴视频生成模型技术负责人表示,未来将与更多导演、行业专家及历史学者合作,为模型引入更全面、更严谨的专业信息。

到了这里,模型面对的已经不只是画面质量,还要开始理解专业知识和创作意图。

音乐创作遇到的则是另一套难题。

9月22日下午,在2026云栖大会的视听分论坛上,太合音乐集团总裁余灏坦言,AI给音乐行业带来的焦虑并不新鲜。

电子合成器、MIDI(乐器数字接口)、DAW(数字音频工作站)都曾经引发过类似担忧,但最后都变成了新的生产工具。

而现在,AI又把音乐创作成本往下压了一大截,普通用户和专业艺人都开始把它当生产力工具。

但音乐一旦进入产业,问题马上变得比「能不能生成一首歌」复杂得多。

训练素材怎么获得,版权怎么算,AI翻唱该不该授权,收益怎么分,这些都绕不过去。

太合和阿里Happy Shrimp的合作,也开始往音乐人共创、产业生态、版权机制和AI音乐新消费场景延伸。

余灏特别提到,无授权AI翻唱的成本太低,大量版本泛滥,会直接侵蚀原版版权方和艺人的价值。

这时候,AI音乐已经从一个创作工具,进入到了产业规则这一层。

小旭音乐创始人卢小旭在论坛上的分享,更像是一张「多模态生产流程图」。

他的工作室做AI歌手,单靠一个模型根本跑不下来。

先做人设和视觉锚点,再用音乐模型做歌曲、人声和编曲,接着把音乐交给视频模型做MV和对口型视频,后面还要接大模型做评论抓取、分类和运营反馈。

整个流程本身,就是一个多模型协同工作流。

不过,这套生意还远没到闭眼复制的阶段。

卢小旭提到,他们平均4个项目才能跑出1个成功AI歌手账号。

但小团队的生产效率,在阿里多模态模型的加持下,已经被明显拉高。

据他透露,其团队6个人就能孵化十多个AI歌手IP,一些账号4个月涨粉20万,全网累计播放量突破2亿。

这几个案例放在一起看,会发现专业创作对模型提出的要求完全不同于普通生成。

电影要理解导演意图,音乐要处理版权和产业规则,AI歌手还得把音乐、视觉、人设、运营串成一整套工作流。

进入专业创作之后,多模态拼的已经不只是生成质量,还要能吃进专业知识,理解创作目标,并接进完整生产流程。

第三层:进入终端和物理世界

再往外走,多模态开始离开内容产业。

目前,千问端到端全双工实时语音交互大模型Qwen-Audio-3.1-Realtime,已经进入千问办公、Qoder(阿里智能体编程工作台)、千问AI眼镜、随身助理和桌面机器人等,能够边听、边想、边说。

Qwen Intelligence继续把Agent能力塞进手机,希望完成跨应用复杂任务。

HappyOyster 2.0 Preview则把战线拉到了物理世界。它要解决的是另一类问题:环境能不能长期保持一致,物体运动能不能符合物理规律,用户操作后能不能及时得到反馈。

这张多模态布局图已经越来越清楚:先给人生成内容,再帮人完成工作,接着让机器真正理解并作用于世界。

但问题在于,这么多单项能力越来越强,AI怎么才能在一件复杂任务里,一直记得自己到底在干什么?

多模态的下一关,是连续理解和完成任务

这个问题,在创作者那里已经出现了。

演员王珞丹在视听分论坛现场分享了她的AI创作体验。

图源王珞丹微博

今年年初,她开始认真学AIGC,自己下场做短片。最开始,她连人物三视图都要一点点学。

再往后,是排队、抽卡、反复试。

王珞丹曾经抽卡抽到凌晨4点,一度觉得很绝望,到了早上6点,终于抽到了想要的镜头。

但更麻烦的是表演。

她的脑子里明明有一个很具体的状态,模型却很难准确呈现。反而在给一个宽泛概念时,模型倒有可能突然给出惊喜。

这很能说明现在多模态创作的一个尴尬:

尽管单个镜头已经越来越强,但故事一长,人物的状态、情绪和气质很难一直保持。

但创作者需要的,恰恰就是AI能记住前面的内容,一直跟着同一个故事往下走。

放到更广泛的Agent任务里,则是记住上下文、环境变化,以及前面已经执行过什么。

问题到这里就很清楚了。图像、视频、语音、世界模型分别变强,只解决了单项能力。

但一项完整任务,往往同时包含视觉、声音、语言、空间、时间和动作,而且这些信息还会一路变化。

AI需要在这些信息之间保持同一个任务上下文。

每切一次模态,就像重新开始一次对话,这种方式很难撑起真正复杂的工作。

这也是多模态下一阶段最重要的一道题:各自很强之后,怎么开始一起工作?

多模态走到下一阶段,看的已经不只是能不能看、能不能听、能不能生成,更要看它能不能围绕同一个目标持续理解。

阿里把更远的方向指向了「原生全模态统一模型」。郑波给出了一个判断:

三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。

重点在「原生」。

今天,很多多模态系统,更像是一场接力。

图像模型做图,视频模型接着生成,音乐模型负责声音,Agent再去调不同工具。

能力都能用,但一次次交接,也意味着上下文可能丢失。

原生全模态想解决的,就是这种割裂。

不同模态从模型底层共享同一个任务、同一份上下文和同一套世界理解,图像、视频、声音、空间、动作都围绕同一个目标往前走。

据了解,阿里的下一代视频模型已经沿着这条路继续推进。新模型将在11月发布,方向之一就是从生成单个镜头走向理解完整叙事。

阿里往前探索了一步,郑波把这个方向称为「Agentic Video」

意思是,模型开始理解创作目标和创作意图,从一个想法、一段故事出发,自动拆剧情、做分镜、组织角色和场景,再完成生成。

这和今天的「抽卡式创作」已经是两种体验。

今天,创作者还得反复重讲人物、风格和情绪。但理想状态则是把故事和角色讲清楚一次,AI就能记住全片设定,一路跟下去。

王珞丹熬夜抽卡的经历,暴露的正是多模态创作最后一公里的问题。

但陆川的《历史·现场》,已经让另一种可能开始出现。AI可以真正进入专业创作链路,并承担相当一部分生产工作。

只是今天,这条链路还需要导演和团队在中间不断组织:查史料、定视觉、调提示词、校准画面,再把不同模型的能力接起来。

原生全模态想继续往前走一步,让AI不只接住一个镜头,而是接住一整件事。

这意味着,AI要从理解创作意图,到记住人物、场景和叙事,再到调用图像、视频、声音乃至空间能力持续完成任务。

这样再回头看阿里这一轮密集的多模态更新,真正值得关注的,也就不只是又多了几个模型。

一张更大的拼图已经铺开。

接下来要比的,是谁能把这些能力真正拧到一起,让AI从会生成,走向会把事情做完。

版权所有,未经授权不得以任何形式转载及使用,违者必究。
田, 晏林
  • 直播预告:未来两三年,哪些工业AI场景会率先爆发?2026-09-22
  • 具身智能技术路线尚未定型,基础设施却先收敛2026-09-18
  • 西门子不造机器人,为什么机器人进厂的故事里总有它?2026-09-16
  • 9月21日,深圳前海!聊聊工业AI与生态共创的下一步2026-09-15

文章评论(0

暂无评论,快来抢沙发~