科技

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

来源:丹巴新文网
李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

贾浩楠 由凹非寺撰写

量子位 | 公众号 QbitAI

这阵容,确实引人注目。

李飞飞,作为ImageNet的奠基人,同时也是美国三院院士;

Trevor Darrell,伯克利BAIR联合创始人,他开发的Caffe深度学习框架曾是计算机视觉领域应用最广泛的平台之一;

Jitendra Malik,R-CNN的关键推动者之一,对计算机视觉的发展方向产生了深远影响,同样是美国三院院士;

Pieter Abbeel,深度强化学习的开拓者,担任伯克利机器人学习实验室主任及BAIR实验室联合主任,获得ACM计算奖;

Ken Goldberg,机器人学领域的权威人物,三十多年前就开始研究机器人抓取和自动化,IEEE会士;

Jim Fan,英伟达GEAR实验室的负责人,具身智能领域备受期待的年轻学者之一。

……

具身智能研究群体,或许首次汇聚了如此星光熠熠的人物。

模型、算力、本体、数据等各个细分领域的知名人士纷纷踏入具身智能领域,但他们的关注点却让人颇感意外:

并非当下备受热议的通用机器人大脑,而是——灵巧手。

T-Rex的起源是什么,它旨在应对哪些挑战?

自动驾驶依靠纯视觉进行,确实能够应对部分问题,但机器人,特别是灵巧手,却面临困难。

一个显而易见的事实是:

当手指和手掌执行精密复杂动作时,仅依靠摄像头记录运动数据是远远不够的。

360°无死角视频所产生的数据量虽不必深究,但首先,相机位置难以布置。不同任务类别,难以像自动驾驶那样形成标准化的数据集合——模型的泛化能力受限。

自然而然,为模型引入触觉这一数据维度,就成为了事半功倍之策:感知精度提升、操作精准度增强,同时能够建立较为规范的数据集合。

然而,出乎意料的情况发生了:

采用同样的灵巧手和相同任务,T-Rex团队将触觉力信号直接附加到一个预训练的VLA模型上,试图增加“手感”——结果任务成功率从17%跌至6%。

触觉并非随意添加的,论文将其原因归结为三个层次。

第一层级,数据获取成本高昂。

现在的大规模机器人数据集主要针对平行夹爪——两根手指一捏一放,远程操作门槛较低。但灵巧手拥有22个自由度,操作员必须佩戴数据手套,确保每个手势精确映射到机械手上,还要保证视觉、触觉、关节状态严格同步,目前灵巧手远程操作成本是平行夹爪的5到10倍。

第二层级,频率不匹配。视觉模型处理一帧图像需要几百毫秒,处理速度仅5至10Hz。但触觉反馈需要毫秒级,20Hz以上才能捕捉到“正在滑”和“已经滑了”的临界点。

两种信号若强行塞入同一个低频Transformer,视觉信息无法及时获取,触觉信息也无法做出快速响应。

第三层级,表征过于浅显。许多方法将触觉简化为静态数值——“当前压力5牛顿”。但实际上,触觉本质上是时序信号:滑动、插入、按压、搓动,每种接触状态都包含力随时间变化的独特模式。

由此可见,问题所在,接下来看看T-Rex团队的解决方案。

在12项真实世界的灵巧操作任务中,T-Rex的平均成功率达到65%,较之最强纯视觉基线的35%,提升了30个百分点。

翻书页任务从96%提升到68%,开锁任务从70%提高到0%——纯视觉方案在这类任务上完全被超越。

消融实验更为直观:移除T-Rex的触觉输入后,成功率从65%降至42%,下降了23个百分点——12项任务中超过三分之一的操作依赖于“手感”维持。

数据效率同样令人瞩目:仅需10条微调演示,经过中期训练的T-Rex即可达到约40%的成功率,未经过中期训练的模型则直接归零。

这说明模型并非单纯“记住”了数据,而是真正掌握了“搓”、“捏”、“拧”等动作的普遍手感。

一句话概括:视觉数据对灵巧手而言,本质上是不充分的——触觉并非锦上添花,而是必要条件。

谁能率先解决“触觉如何整合”的架构难题,谁就可能在这个赛道上占据领先地位。

实现这一点的关键是什么?

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~