#每日学习打卡#大家早上好,今天我们来学习AGI的进展。
在大众看来,灵巧手赛道有两个趋势,一是 demo 越来越炫,而是销量越来越多。
今年春晚灵巧手盘核桃已经足够惊艳,不久前,Sharpa 又晒出灵巧手削苹果的视频,让人咋舌称赞。
此外灵巧手的出货量越来越猛,我们拿到一组研究机构 GGII 的数据,2026 年灵巧手的销量能达到 7 万只,是 2025 年的 3.6 倍。并且,在机器人已经来到万元级水准,很多灵巧手单只售价甚至高达十多万,几乎疯狂。在外行眼里,灵巧手已经无所不能了,关节越来越灵活,手指反应越来越快,也慢慢开始有了触觉和温度感知。
但这篇大佬云集的论文,给这一切泼了一盆冷水: 目前给灵巧手加触觉,机器人反而更笨了。
先来看一个行业大背景:具身智能的三条路,走到灵巧手都卡住了。
第一条路:纯视觉 VLA。 这是当下最热闹的路线,π0、GR00T N1、OpenVLA 都在做。它们靠摄像头理解世界,能做类似移动杯子这种粗粒度任务。 但摄像头有盲区,而且感知不到手指和物体之间的细节,就像视力 5.0 的人戴手套做针线活,看得见线头,感觉不到针有没有穿过去。
第二条路:人类视频迁移。 这是最近很火的方向,EgoScale 用了 2 万多小时人类第一人称视频做预训练,EgoEngine 尝试把人类视频转成机器人数据。看似互联网上人类操作视频取之不尽,这路子行得通,但落到灵巧手上就不灵了。 原因很简单,就像看世界杯梅西踢球,眼睛学会了,但上场就不行了。视觉数据提供了动作的 "外观",却给不了接触的 "手感"。
第三条路是遥操作数据驱动, 这条路线唯一的优点是数据质量最高,其他都是缺点,比如采集太贵,通道不够等等。 三条路走到灵巧手这里都卡住了,最核心的原因就是接触后的反馈闭环。
简单来说,怎么让灵巧手更好地加入触觉。
触觉,不是灵巧手领域的新话题。这个领域过去有很多探索,比如牛津大学机器人实验室做的 ETac,走的是表征学习路线,伯克利做的 ViTacFormer,就把触觉和视觉做交叉注意力融合,Tactile-VLA 则尝试把触觉直接塞进 VLA 框架。 结果不少实验室试了一圈,逐渐形成一个共识:
触觉可以 "硬塞进去",但塞进去之后,模型表现反而更差了。
我们一起学习的。2026.7.2dm
发布于 广东
