实验式Lab
26-06-01 15:07

英伟达发布 视觉 | 世界| 动作生成 三位一体的开源全能模型
英伟达发了专搞物理 AI 的 Cosmos 3. 宣称是全球首个完全开源的视觉理解, 世界模拟和动作生成全能模型

▪️ 尺寸分发: 没搞闭门造车, 直接开源了 32B 的 Super 和 8B 的 Nano 两个版本.
▪️ MoT 架构: 这个缝合挺暴力的... 就是那种, 用 Mixture-of-Transformers 架构把自回归的推理塔和扩散的生成塔硬绑在了一起. 让模型既能做重度逻辑推演, 又能搞物理世界的视频生成.
▪️ 懂物理的学霸: 霸榜了 Physics-IQ 和 RoboArena 等一堆物理属性的评测. 不仅能带音效做图生视频, 关键是能以亚秒级的速度精准预测物理环境的未来状态.

这玩意儿看着像个精美的视频生成工具, 本质上是为了给机器人当陪练, 彻底干掉自动驾驶和具身智能那高昂的真实数据采集成本

🔗 Blog:
http://t.cn/AXXApvWg

#NVIDIA #Cosmos3 #物理AI #具身智能 #大模型 #世界模型#

发布于 四川