一句话结论:Tavus 推出的 Griffin 是首个能以假乱真进行实时视频对话的 AI 模型,基准测试中 48% 受试者分不清对面是 AI 还是真人,VideoFDB 得分 3.83 已逼近人类参考值 3.92,150,000 家企业和开发者正在使用 Tavus 技术生态。
Griffin 是什么:重新定义人机交互方式
美国 AI 公司 Tavus 宣布推出 Griffin,号称首个「人类交互模型」(Human Interaction Model)。与传统 AI 不同,Griffin 不是等用户输入文字或语音再响应,而是主动感知、持续反应——它能看见对话对象的表情、听懂语调、识别打断意图,并在说话的同时动态调整内容、语速和表达方式。
Tavus CEO Hassaan Raza 表示:「几十年来我们一直想象计算机成为伙伴而非工具,但 AI 再智能,我们仍然必须用文字、命令或语音来迁就机器。Griffin 改变了这层关系——让机器理解我们天然的沟通方式,主动来适应我们。」
Griffin 的技术架构建立在 Tavus 多年积累的三个子系统之上:Phoenix-4.5(实时渲染模型,负责生成自然的面部动作和倾听行为)、Raven-1(多模态感知模型,理解语调、表情和视觉语境)、Sparrow-2(对话动态模型,对应话轮转换、打断、犹豫等信号)。 Griffin 将三者整合为单一端到端模型,让感知、决策、语音和视频生成全链路连续运行。
核心技术:全双工视频到视频实时对话
Griffin 是全双工(full-duplex)视频到视频(video-to-video)模型。与传统的文本对话或单轮语音交互不同,Griffin 在听的同时也在说,在说的同时也在看——这意味着它能捕捉到对话者突然的表情变化并立即调整回应,就像真正的对话者会做的那样。
Griffin 的核心突破在于「连续性」:模型在接收对方输入的同时生成自己的输出,二者并行进行而非顺序排队。 Griffin 还能在说话中途被打断时立即切换到倾听模式,并准确捕捉对方「打算打断但最终没出声」这类微妙信号。
基准测试:3.83 分逼近人类水平
Griffin 在英伟达 VideoFDB 基准测试中,视频生成质量获得 3.83 分(满分 5 分),人类参考值为 3.92 分,排名第二的系统仅得 2.80 分—— Griffin 高出同类最优方案 37%。
在一项独立盲测研究中,48% 的受试者认为自己在与真人对话,而非 AI。
应用场景:AI 家教、面试练习、客服来了
Tavus 同时发布了基于 Griffin 的虚拟形象「Vanessa」演示,展示了几类典型应用:
- AI 家教:当学生还没意识到自己卡在哪里时,Vanessa 就已经注意到困惑的表情,主动换一种方式讲解。
- 面试练习:用户扮演候选人,Vanessa 扮演面试官,会根据用户的微表情动态调整问题的深浅和节奏。
- 客服演示:用户举起一个有问题的零件对着摄像头,Vanessa 立即识别零件类型并引导排障流程,用户无需知道零件的正式名称。
Griffin 目前以 Griffin-Lite 版本仅向部分受信任测试者开放研究预览。 Tavus 表示,将在广泛开放前额外部署信息披露和安全机制。
技术对比: Griffin vs 传统 AI 对话方案
| 指标 | Griffin | 传统语音助手 | 文本聊天机器人 |
|---|---|---|---|
| 交互模态 | 视频 + 语音 + 文本 | 语音 + 文本 | 纯文本 |
| 实时感知对方表情 | 支持 | 不支持 | 不支持 |
| 说话同时接收输入 | 全双工 | 半双工 | N/A |
| 主动识别打断意图 | 支持 | 极少支持 | 不支持 |
| VideoFDB 得分 | 3.83 / 5 | — | — |
| 盲测真人率 | 48% | 极低 | 0% |
安全与局限:首批测试为何只开放给受信任测试者
Griffin 极高的逼真度本身也是风险。当 AI 能以假乱真时,滥用风险随之上升——冒充真人进行社交工程攻击、虚假客服等场景令人担忧。Tavus 明确表示, Griffin-Lite 目前仅向「部分受信任测试者」开放,并正在开发额外的信息披露机制(例如在对话中嵌入可见水印)。
技术局限方面, Griffin 目前仍依赖高质量网络连接和计算资源,实时视频流的全链路延迟是关键挑战。此外, Griffin 在极端光照条件或多人场景下的表现尚未公开验证。
常见问题
Griffin 和现有的语音 AI(如 Siri、ChatGPT 语音模式)有什么本质区别?
最大区别在于「连续感知」和「全双工」能力。传统语音助手是「输入-响应」的半双工模式,用户说话时 AI 必须等待。 Griffin 在对方说话的同时生成自己的输出,并实时感知对方的表情和肢体语言,做出类似真人的动态调整。 Siri 和 ChatGPT 只能处理语音和文本,无法感知视觉信号。
Griffin 的技术底层是什么?
Griffin 以 Tavus 自研的 Phoenix-4.5(实时渲染)、Raven-1(多模态感知)和 Sparrow-2(对话动态)三个子系统为基础,三者整合为单一端到端全双工视频模型。 Tavus 团队学术引用超过 90,000 次,现有超过 150,000 名开发者和企业使用其技术生态。
普通用户什么时候能用上 Griffin?
目前 Griffin-Lite 仅向受信任测试者开放研究预览。 Tavus 表示在正式大规模开放前,将额外部署信息披露和安全护栏机制。预计全面开放的节奏将取决于安全机制的完善进度。
小结
Griffin 的意义不只是又一款「更好的语音助手」,而是开创了一个新的 AI 品类——人类交互模型。它将感知、理解和生成整合为连续的全双工流,模糊了 AI 与真人对话的边界。 48% 的盲测通过率和逼近人类水平的 VideoFDB 得分证明了技术成熟度,但高逼真度本身也带来了新的安全挑战。 150,000 家企业和开发者的生态基础意味着 Griffin 的影响不会止步于演示视频——它代表 AI 对话从「工具」向「伙伴」跃迁的起点。
相关阅读
- ElevenLabs 3亿美元收购背后:语音AI赛道为何吸金220亿美元
- OpenAI 给 ChatGPT 移动端加语音代理:4档用户全覆盖,跨设备办公
- 英伟达 Nemotron3 语音分割模型开源:1亿参数,DER 14.72% 登顶
延伸阅读
- 昆仑万维 Mureka V9.5 发布:人声良品率 61.0%、控制良品率 97.0%,中文国风编曲突破2 周前
- 千问办公 QwenWork 正式上线:一站式 AI Agent 平台深度绑定钉钉,标准版 78 元/月起2 周前
- MiniMax Design 上线:H3 多模态模型驱动创作画布,覆盖电商广告等 8 类商业视频2 周前
- Kimi Code 桌面客户端上线:macOS/Windows 同步开放,四种 Agent 工作模式一次给全2 周前
