文 | 财经思享汇,作者 | 王南舒,编辑 | 管东生
2026世界机器人大会上,各类机器人依然是吸引观众的焦点:行走、搬运、抓取,各种动作在展台前反复演示。不过,在这些直观的展示背后,关于机器人下一阶段竞争的探讨,已经从“硬件”转向“软件”,从“身体”转到“大脑”。
大会期间,一场名为“世界模型到服务人类的现实距离”的圆桌会议特别引人注目。之江实验室主任、阿里云创始人王坚首先对世界模型本身发起了探讨:它和其他模型有何不同,有哪些值得关注的技术路径?紧接着,讨论转向了一个更为实际问题——世界模型若要服务人类,究竟需要哪些能力,距离实现这一目标还有多远?
这也就是当前机器人产业所面临的关键转折点。
近些年,机器人的运动能力取得了显著进步。奥比中光创始人、董事长黄源浩在会议中把这种变化概括得更为直观:机器人的移动能力已经非常出色,真正棘手的是“操作”环节。从A点移动到B点,与拧开一个瓶盖、处理复杂物体,根本不是一回事。在他看来,后者最终依赖于“手、眼、脑”的协同——手需要灵巧和触觉,眼负责感知,脑则依靠模型与数据的持续迭代。
当机器人从“会动”转变为“能干”,产业竞争也从单纯的本体能力,转向了对智能能力的争夺。世界模型正是在这样的背景下逐步进入人们的视野。
从“会做”到“理解为何这么做”
如今,机器人能够被训练完成越来越多的任务,但“技能的增多”并不必然代表“更智能”。
智澄AI创始人、CEO胡鲁辉在会议中把当前物理智能所面临的问题分成了几个层次:首先是泛化能力——环境或任务发生改变以后,机器人还能否完成同一件事;其次是对物理规律的理解;更进一步,则是机器人能否理解任务本身。在过去依靠规则、固定路径或者模仿学习的系统中,交互对象和任务边界相对固定。一旦环境稍有变动,甚至仅仅更换机器人本体,原先的能力就可能失效。
圆桌讨论中,无界动力创始人张玉峰也提到,VLA等以模仿学习为基础的范式,很大程度上依赖于足够的数据量和数据分布来形成类似“肌肉记忆”的能力,但对于物理世界底层逻辑的理解,以及由此产生的泛化,仍然面临巨大挑战。世界模型重新获得重视,一个重要原因就是行业希望突破这一局限。
胡鲁辉更加看重“理解”的力量。他认为,世界模型真正需要解决的“不仅限于泛化性”,还包括对物理世界本身的理解,“就如同人一样,人并不是因为会做些事情,而是以理解的方式去做事情”。这一判断也反映了智澄AI自身选择的发展方向。胡鲁辉将世界模型视为物理智能的核心技术之一,并把机器人看作人工智能进入物理世界的重要闭环场景。
(图:智澄AI展会现场)
如果说过去机器人企业争夺的是一台机器人能掌握多少动作,那么世界模型所看中的,则是另一种能力:机器人不仅要知道“怎么做”,还要知道自己的动作会怎样改变环境,并在此基础上决定下一步。这意味着,下一阶段的竞争可能并不仅仅是技能数量的增加。一个只能在训练环境中完成固定任务的机器人,即使掌握了更多动作,也不意味着它已经获得了通用能力。
不过,新的问题也紧随而来,如果机器人真的要理解物理世界,它依靠什么来学习?
黄源浩把目光投向了数据。
与大语言模型可以直接利用互联网积累的大量文本不同,具身智能所需的数据必须从真实的物理交互中产生。机器人拧一个瓶盖,需要记录的不仅是视频:手在三维空间中的位置、物体状态如何变化、接触时产生怎样的力,以及视觉和触觉能否在时间上准确对应,这些都会影响模型最终学到什么。
不同本体又让这个问题变得更加复杂。
黄源浩举例说明,不同机器人使用的相机视场角、帧率、触觉设备各不相同。如果A机器人采集的数据不能被B机器人使用,每家公司都必须围绕自己的设备重复采集和训练,数据规模扩大并不必然带来成本下降。因此,在他的判断中,










网友评论