科技

宇树机器人,缺个“好脑子”?

来源:丹巴新文网
宇树机器人,缺个“好脑子”?

8月19日,宇树科技胜利登陆A股科创板,成为“人形机器人第一股”。王兴兴,身兼董事长、总经理及技术官,所持市值高达千亿元,被冠以“90”后新首富的名号。上市首日,宇树科技股价下跌6.51%,报收790元;然而,次日该股却暴涨460%。

宇树科技从四足机器人技术起步,2023年推出了其首款人形机器人H1。到2025年,其人形机器人的出货量超过了5500台,全球位居首位。宇树科技表示,将使用筹集的基金投资于智能机器人模型的研发,以及智能机器人制造基地的建设等多个核心项目。

业内通常将宇树机器人称作“小脑强于大脑”。长期专注于运动和关节控制的小脑技术,使得宇树机器人在跑跳等动作上表现出色,但在大脑层面,即具身大模型和任务理解与世界理解的能力上,研发投入曾一度不足。去年9月,宇树推出了开源世界模型UnifoLM-WMA-0,意图为通用机器人学习提供统一的技术基础。该模型的核心,是理解机器人与环境之间物理交互规律的世界模型。8月20日,在2026世界机器人大会上,王兴兴提到,朝向具身智能的ChatGPT时刻,理想情况下需要2—3年时间,或者更长期的5—10年时间。

他表示,当前全世界范围内,制约机器人真正进入家庭的最大障碍是具身智能的泛化能力还不够强。他坦言,机器人在任务执行中的“最后一厘米”的偏差可能导致任务成功率急剧下降,“这对我们来说是非常严峻的问题。”

近些年,越来越多的具身智能制造企业意识到,如果机器人的大脑发展滞后,那么即使机械操作到了极致灵巧,也难以实现商业化。人们不禁要问,机器人所有人心目中的大脑,会是世界模型吗?

8月19日,宇树科技生产的两台机器人在2026世界机器人大会期间参与了格斗演示 图/视觉中国

路线的选择

当你拿着咖啡杯,问AI“如果我松开手,咖啡杯会发生什么”,一般的大语言模型会回答“它会掉在地上摔碎”,因为AI从训练数据中获取过这个答案。

而世界模型则会观察你松手时杯子距地面的高度,结合当地重力加速度,告诉你“杯子将在0.5秒后落地”,并根据杯子材质模拟碎裂的程度。它不需要预读这句话,它通过计算来得出结论。

这就是世界模型,一个主攻物理环境认知和预测的系统。图灵奖得主、前Meta首席AI科学家杨立昆(Yann LeCun)将世界模型描述为能预测行动后果的内部模拟器,是机器人认知世界的引擎。除此之外,世界模型还有许多纷繁复杂的定义,但共同点在于承认智能体需要通过学习环境的物理规则,比如杯子下落会摔碎,来构建虚拟场景,从而无需实际操作就能预判各种决策的可能后果。

美国斯坦福大学教授、World Labs创始人李飞飞专研空间智能,称世界模型为AI的下个前沿。“AI需要理解、生成、推理并与三维空间交互,而构建大型世界模型,正是实现空间智能的关键路径。”李飞飞的学生、复旦大学通用物理智能研究院院长苏昊则专注于物理智能,期望AI能在物理世界中有效完成任务,采取适当的行动。

快思慢想研究院院长田丰认为,物理智能、空间智能、世界模型,是同一件事的不同切面。他告诉《中国新闻周刊》,空间智能关注“能够记住房间的几何结构”,物理智能关注“能够完成抓、推、拧等动作”,而世界模型则是这两者背后的推理能力。

比定义更为复杂的,可能是世界模型的技术路线。尽管这个理念的诞生可以追溯到1943年,但数十年来,人们仍在为如何实现它而争论不休。

杨立昆赌注的是某种“隐空间”的学习模式,期望在一个抽象的空间里让AI去预测未来状态。Meta在2025年6月发布的视频模型V-JEPA 2就是这一路线的实例。在忽略了一些无关紧要的细节,比如杯子里的水有多热之后,该模型能够学会“杯子会摔碎”这一因果关系。但问题同样非常明显,“隐空间”难以观察,工程化和规模化面临挑战。

生成式大模型的出现后,生成式的世界模型也应运而生。像Sor

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~