Griffin的全双工交互有哪些特点?
Tavus最新发布的Griffin全双工交互模型,以48%的真人误认率首次通过实时视频图灵测试,正把AI从“被动应答”推向“能看、能听、能插话”的类人实时对话新阶段。
一、Griffin想证明什么
证明AI能像真人一样“在场”:Griffin是Tavus推出的首个人机交互模型(HIM),采用端到端视频到视频全双工系统,在实时对话中同步生成人脸表情、肢体动作与语音,模拟真人面对面交流。
证明机器可被误认为真人:内部真人盲测中,54位受试者与它进行1分钟实时视频对话,48%的人事先不知情却误认为对面是真人,而前代同类系统通过率普遍低于3%。
证明全双工优于半双工:在NVIDIA全双工AI视频基准测试中综合得分3.83/5,排名第一,真人参考基线为3.92,此前公开最优基线仅2.80,直接拉近了AI与真实人类的差距。
二、全双工交互的核心特点
听看说并行:Griffin不是“你停我说”的轮替模式,而是边说话边监听、边观察用户表情、停顿和手势,真正实现人类对话中的同时感知与反馈。
自然打断与主动插话:它支持被用户随时打断,也能在对方讲述时主动发问、回应,不需要等对方说完。例如在对方讲述平淡约会时,它会同步发出笑声、点头并追问。
视觉驱动内容实时调整:它能“看着说”——中途若有人举起物品,它会无缝将场景写入正在进行的对话;还能边看对方手中的魔方边实时指导,甚至感知对方沉默思考并主动等待。
三、拟真程度与安全性边界
生成整帧而非仅人脸:Griffin输出完整的视频画面,不只是面部区域,进一步增强拟真感和沉浸感。
安全机制优先于公开发布:团队承认高度拟真视频存在欺骗滥用风险,在完善披露机制与安全防护前只提供研究预览版,限少量可信内测人员访问,不直接向全部客户开放。
潜在应用场景清晰:官方定位包括AI虚拟教师、模拟对话演练、远程虚拟客服、沉浸式虚拟人物实时视频交互,均依赖其全双工感知与表达能力。