这两年 AI 圈儿关于世界模型的定义众说纷纭,各说各话。
李飞飞最近亲自下场,写了一篇长文给出了世界模型的定义。
总结下核心观点:
1、语言模型仅仅掌握了文本的统计规律,而构建能够理解物理世界时空结构与运行法则的世界模型,才是人工智能通往空间智能的下一个前沿。
2、基于智能体与世界的交互循环,当前繁杂的世界模型技术,可按功能严格划分为三大类:输出视觉观察的渲染器,输出底层物理状态的模拟器,以及输出决策动作的规划器。
3、尽管追求视觉逼真度的渲染器,是目前商业化最为成熟的,但真正能反映真实世界几何结构与物理定律的模拟器,才是整个系统的核心。
4、只有掌握了底层的物理模拟能力,基础模型才能在为人类生成可靠视觉画面的同时,为机器人等实体智能体提供准确的行动依据。
5、整个领域的最终发展趋势,是彻底打破这三者的边界,打造一个集渲染、模拟与规划于一体的统一世界模型,从而赋予机器真正在物理世界中理解、想象和交互的能力。
#HOW I AI##科技先锋官##世界模型#
发布于 北京
