科技

对话昆仑万维方汉:“世界模型元年”已至,游戏、影视将最先迎来变革

来源:丹巴新文网
对话昆仑万维方汉:“世界模型元年”已至,游戏、影视将最先迎来变革

出品|搜狐科技

作者|郑松毅

2026世界人工智能大会期间,昆仑万维举办的“世界模型与多模态范式跃迁”专场论坛,在上海顺利开展。昆仑万维董事长兼CEO方汉,在活动上高调宣布“世界模型元年”已经到来,指出AI技术路径正在从内容生成转向物理世界交互层面。

论坛现场,昆仑万维对核心模型进行了重大升级,发布了Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,这些模型覆盖了世界模型、AIGC创作等多个前沿领域。方汉预测,往后三五年世界模型将有潜力成为游戏行业的基石,其影响力还会渗透到影视等不同产业。

圆桌讨论环节,演员黄晓明表示,他对AI技术的进步速度感到惊讶,认为AI生成的人物微表情、毛孔等领域已经非常逼真,他对AI领域的前景表示出兴趣,并且有考虑进行相关投资。演员王珞丹则分享了她在创作时运用提示词,不断调整寻找最佳镜头的经历,她强调AI只是创作的辅助工具,人类独有的表达才是内容的核心,观众真正产生共鸣的,是故事本身,而非生成的方式。

专题论坛结束后,方汉围绕大众所关心的世界模型技术原理、文娱行业变革、AI行业竞争等方面,与搜狐科技等媒体进行了深入的对话。

以下是访谈内容的编辑整理:

媒体询问为何将2026定义为“世界模型元年”,以及今年行业的关键突破是什么。方汉回答,过去的两年里,AI行业主要聚焦于“生成”阶段,即文字、图片、视频、音乐的批量生产,但这些AI产品无法理解真实的物理规则。今年,他们验证了异构普通视频数据能够用于训练世界模型,这是一个关键的转折。

对于这个技术如何运作,以及取得了什么成果,方汉解释说,以前行业训练机器人和世界模型,只能依赖UMI动捕和真机采集,一套动捕设备价格十几万,单小时采集成本在500-2000元,想要训练出千万小时的数据集,投入至少需要几十亿,没有企业能够长期负担。而现在,普通人用手机摄像头拍摄的日常操作视频,可以作为异构数据,通过深度重建转化为高质量的训练素材,成本有望降到每小时10元。

方汉认为,只有当低成本、多样化的真实数据供给得到打通,世界模型才有可能大规模落地,这也是他们认定今年为元年的原因。

关于Matrix-Game 3.5和Mureka音乐模型的发布,解决了哪些行业痛点,方汉表示,Matrix-Game 3.5主要针对可交互的世界模型,首创了Patch级空间记忆,解决了画面跨帧不一致、相机抖动失真等问题。积累的视频数据既能用于游戏自动生成虚拟场景,也能为具身机器人提供环境推演的基础。Mureka v9.5则着重于“去AI味”,更自然地还原人声和情绪,降低了专业音乐制作的技术门槛。

至于世界模型的数据规模门槛有多高,以及行业何时能迎来技术上的大变革,方汉认为,具身世界模型的最终技术路线会收敛到端到端,而数据规模是决定模型能力的关键。行业普遍认为,模型的有效收敛需要千万小时甚至上亿小时的数据训练,才能实现通用化。

目前市场上各家训练数据的水平如何,突破千万小时门槛预计需要多长时间,方汉指出,目前普遍水平是十几万小时,今年头部企业有望突破百万小时,预计2027年底会有企业达到千万小时门槛,而达到亿小时规模需要3-5年。方汉强调,数据积累的竞争不仅是资金,更依赖于产业链。中国拥有全球最全的工业、家政等场景数据,未来全球很可能都会来华采购训练数据。

当前市场上很多企业集中在做垂直应用,这是否意味着模型研发不再是重心呢?方汉对此表示不认同,他认为垂直应用的能力很容易被大模型原生吸收,单纯做应用层的壁垒非常低,风险很大。

最后,针对创业者现在市场机会在哪里,方汉建议创业者带着钉子找锤子,而不是拿着锤子找钉子。创业者不必先有模型再强行套行业,反而可以先深耕垂直行业(比如短视频、工业机器人、家政等),了解真实的需求,针对性地开发轻量化模型。

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~