美团 LongCat 团队放出 LARY 基准测试
美团 LongCat 刚开源具身智能基准 LARYBench 。
这玩意儿号称是动作编码器的“ImageNet”。
抛开宣发,它的工程价值和量化结论非常硬核:
▪️ 解耦评测:摒弃了看下游任务成功率的黑盒测试。首创双轨制:Track 1 测高层动作语义泛化 (Top-1 Acc),Track 2 测底层机器人控制误差 (MSE)。
▪️ 打脸的结论:拿这套含 120 万+视频片段的数据集跑完发现,V-JEPA 2、DINOv3 这种通用视觉大模型,在没喂过任何动作监督数据的情况下,直接碾压了专门优化的具身潜动作模型。
做 VLA 模型的以去看下
🔗 GitHub:
http://t.cn/AXMYLjA7
🔗 Hugging Face: http://t.cn/AXMYLjAh
🔗 Paper: http://t.cn/AXMYLjAz
#EmbodiedAI #LARYBench #开发者工具
发布于 四川
