2026年10月1日,Tavus推出人类交互模型 Griffin,该模型可处理视频和音频,并进行实时响应;该公司称,这是首个通过视频图灵测试的模型。对话时长为一分钟的一项测试显示,54名参与者中有26人(48%)认为 Griffin-Lite 是真人。
在 NVIDIA VideoFDB 对全双工视听交互进行的独立测试中,Griffin-Lite 在15个受评模型中排名第一。Tavus目前仅向有限范围开放 Griffin 的使用权限,以开发 AI 披露功能并评估该模型冒充他人能力带来的风险。
Tavus 推出 Griffin,将其定义为一类新型人类交互模型(Human Interaction Model,HIM)。该模型能够同时看、听、说,并响应对话对象的非语言线索。不同于先识别语音、生成回答、再将其语音化的级联系统,Griffin以固定的亚秒级间隔作出决策。
该模型作为一个全双工视频到视频系统运行。它能够对停顿、视线、面部表情和手势作出回应;可以同时听和说;能够在不丢失上下文的情况下打断或继续对话;并可根据停顿时长判断何时回应。
Griffin还能够识别物体及其周边环境,并将其纳入回答。Tavus表示,该模型会调整语音、面部表情和手势,以适应具体情境。
实时演示与性能
在演示中,Griffin一边追踪参与者的言语和动作,一边玩“Simon Says”游戏。它将展示在摄像头前的一只孔雀融入对话情节,借助手部动作协助解决魔方问题,并在持续记录时间的同时指导焊接操作。
该系统包含两个核心组件。持续对话建模(Continuous Conversational Modeling)分析音频和视频,以决定 Griffin 应何时以及如何回应;音视频生成(Audio-Visual Generation)则将这些信号转换为语音和视频。
Tavus称,Griffin-Lite使用320毫秒片段实时生成720p视频。在 H100 GPU 上,该模型的平均延迟为0.43秒;该公司称,这大约是受测次快方法速度的两倍。
Griffin-Lite在 NVIDIA VideoFDB 测试中领先
据Tavus称,在旨在衡量全双工视听交互的独立 NVIDIA VideoFDB 测试中,Griffin-Lite在15个受评模型中排名第一。
在生成赛道中,Griffin-Lite获得3.83分,而人类基准为3.92分。它在感知赛道中获得3.73分。
该模型在开始说话时机方面也取得最高对齐分数,生成赛道达到62.8%,感知赛道达到73.8%。
近半数参与者认为 Griffin 是真人
在一项涉及54名参与者的测试中,26人(48%)在进行一分钟视频通话后表示,其对话对象是真人。Tavus此前的系统——Phoenix-4.5与 Sparrow-2 和 Raven-1 的组合——录得2.4%的比例,41名参与者中仅1人认为其为真人。
Tavus称,超过半数 Griffin-Lite 测试参与者在对话过程中并未想到自己可能是在与 AI 交谈。通常怀疑对话对象为人工系统的参与者,都会在最初20秒内产生这一怀疑。
因冒充风险而限制访问
Griffin目前仅作为研究预览版向有限测试者群体开放。Tavus表示,由于该模型能够冒充他人,在公开发布前必须解决安全问题。
开发者指出:“使人类交互模型成为人类与机器之间自然通信强大接口的同样特性,也使其能够欺骗一个人类,让其相信它不是 AI。”
Tavus表示,正在开发 AI 披露功能和额外的风险评估程序。该公司计划在解决安全问题后,更广泛发布功能更强大的 Griffin 版本。
来源:HODL Press
