汽车

汽车开始有了“大模型”:小鹏VLA 2.0真正想改变的,可能不只是自动驾驶

来源:丹巴新文网
汽车开始有了“大模型”:小鹏VLA 2.0真正想改变的,可能不只是自动驾驶

No.0364

Science Partner

Bring you to the side of

导 读

当AI大语言模型写错一句话,人可以要求其重新生成。

但若AI在控制高速行驶汽车时判断失误,后果则可能截然不同。

2026年夏天,人工智能正迈过这道分水岭。

7月27日,美国斯坦福大学以人为本人工智能研究院(HAI)发布一份关于“世界模型”的政策报告,提出AI正从以语言为核心的阶段转向“空间智能”:模型不仅生成文字、图像,还需构建对现实环境的动态表征,预判环境如何随行动演变。报告强调,世界模型或将成为具身AI训练的核心基础。

就在同日,小鹏VLA 2.0开始进入德国道路测试。德国专业媒体留意到,小鹏汽车与人形机器人已共享图灵芯片及部分AI基础架构。更早些时候,大众汽车与小鹏合作的首款车型实现量产,大众首次将小鹏的智能驾驶系统及图灵AI芯片应用于量产车。

将上述事件串联审视,VLA 2.0引人关注的,不止于“智能驾驶再度升级”。

它更指向一个值得每一个关注科学的伙伴重视的变革:过去数年,大模型主要攻克的是内容生成难题。而下一阶段,部分模型开始学习理解现实、预测下一秒,并直接付诸行动。

汽车,或许将成为这种人工智能最早大规模融入普通人生活的载体。

现在,跟随伙伴君一同探索!

今日主笔|旻宏

汽车开始配备“大模型”:小鹏VLA 2.0真正想要改变的,可能仅限于自动驾驶

01. 从预测“下一个词”,到预测“下一秒”

大语言模型处理的是一类相对常规的课题:依据上下文,推断最可能出现的后续内容。

随着具体智能特别是新能源汽车的普及,预测对象彻底转变。

车辆置身十字路口,面临的挑战已非预测下一个词,而是判断前车是否减速、自行车是否欲横穿、被大货车遮挡处是否可能出现行人,以及自身继续前行两三秒后整个交通场景将演变成怎样。

这种变化看似仅是模型架构的调整,实则暗藏深意:人类诸多行动,原本先于语言完成。

驾驶经验丰富的人遭遇前车急刹,不会先在脑中完整构思一句话“前方车辆正在急速减速,故须制动”,才开始踩刹车。现实世界要求的首要任务是即时感知、判断和行动。

更关键的是“预判未来”。

据Electrek消息,小鹏正在训练系统同步预测两件事:车辆应如何行动,以及未来时刻摄像头可能捕捉的景象。公司将世界模型与VLA视为同一问题的两面,一面学习如何行动,一面学习现实如何演变。

资深司机看到路边停着遮挡视线的大货车,往往条件反射式地减速,未必因为他确认发现了行人,而是经验告诉他:那里潜藏风险。

02. 汽车为何可能成为具身智能的首个“数据富矿”

AI所需的数据正在重塑。

大模型时代,互联网海量的文本、图像和视频可作为训练素材。Physical AI进入现实后,“浏览世界”已显不足。模型还需明确:人在特定场景中实施了什么动作?车辆打方向盘后环境如何变化?机器人抓取杯子,成功抑或失败?

斯坦福HAI于7月发布的“世界模型”报告特别指出,目前稀缺的一类资源是带有行动标注的真实交互数据,涵盖机器人运行轨迹与车队记录。这类数据不像网页文本那样容易获取,可能形成Physical AI竞争中新的资源壁垒。

这使得汽车占据了特殊地位,它本身就是一个高度量产化的机器人。 摄像头、车载计算平台、转向制动动力系统,分别对应“看”“想”“做”。尤为关键的是,海量汽车每日在复杂真实环境中行驶。

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~