🤯🤯🤯【把大语言模型放在纽约市的大街上会发生什么?】
德国海德堡大学博士Raphael Schumann、与本组Wanrong Zhu、Weixi Feng、Tsu-Jui Fu的新研究,仅限于文本输入的LLM在真实世界环境中进行语言导航,居然比SOTA高出了25-30%。🚀🚀🚀
我们提出的VELMA,一种嵌入式的大型语言模型,可以理解并执行基于自然语言的导航指令,适应并进行空间和时间的推理,甚至是在像街景这样的真实环境中。它通过将观察到的视觉环境和行动轨迹口头化,并将这些信息作为下一步行动的上下文提示。
VELMA只需两个场景示例,就能成功地按照街景导航指令进行导航。经过少量的微调训练,VELMA在两个数据集中比之前的最好效果提高了25%-30%。
让大语言模型帮助视觉障碍患者实现自由逛街,提升生活质量并不是遥不可及的事情!
项目链接: http://t.cn/A60qIMAN
论文链接: http://t.cn/A60qIMAC
发布于 美国
