新智元
26-07-13 17:31 微博认证:新智元官方微博

机器人圈有个老大难问题,卡了所有人好几年:手部动捕。

不是捕不了,是一到真实场景就崩——你端碗、拧瓶盖、从口袋掏手机,手一被挡住,最先进的检测器直接报废,后面的姿态重建全盘歇菜。

全世界最聪明的一群人,在这个问题上加检测器、加时序模块、加运动先验、加测试时优化……补丁摞补丁,还是扛不住遮挡。

结果,我们把视频生成模型换了个打开方式,顺手把这事儿办了。

近日,大晓机器人联合南洋理工大学与上海交大发布ACE-ViDiHand——全球首个用视频生成模型做4D手部动捕的方法。

在ARCTIC、HOT3D、HOI4D三大基准上,ARCTIC和HOT3D全部九项指标第一,HOI4D九项中八项第一。

最炸裂的一个数字:手被东西挡得严严实实的场景下,ACE-ViDiHand的帧准确率0.997,此前最强的WiLoR只有0.919。

什么概念?同样跑1000帧视频,WiLoR丢了81帧,ACE-ViDiHand只丢3帧——几乎一只手都不落。

这意味着,大规模、高质量的人手视频自动标注,第一次真正成为可能。

论文标题《The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction》——带了个「Surprising」,应该是连作者自己都觉得效果好得离谱。该项目将于近期全面开源。

论文链接:
http://t.cn/AXKMZJiv

项目主页:
http://t.cn/AXKMZJJs