Meta发布实时数字人模型,870毫秒延迟就能让虚拟形象开口说话

首页 / AI资讯 / 数字人

0:00
0:00
1x
定时

9月23日,Meta在其年度Connect大会上发布Muse Realtime Avatar,把个人智能体Muse的实时语音能力变成会说话、有表情与动作的虚拟形象。该模型由Meta超级智能实验室研发,扎克伯格在主题演讲中亲自介绍,首个使用场景是Muse应用内的实时对话。按官方数据,人说完话到虚拟形象开口回应之间的端到端延迟约为870毫秒,输出448乘768竖屏画面、每秒25帧。这个数字把实时数字人从演示带进了可以日常对话的区间。

870毫秒延迟,压缩靠的是蒸馏

延迟是实时数字人的第一道门槛。人机对话的节奏感对响应时间非常敏感,超过一秒的停顿会让人明显感到不自然。Meta的解法是模型蒸馏:教师模型每生成一个画面片段需要120次前向计算,采用40步扩散并叠加三路无分类器引导;学生模型则把整个过程压缩到2步,且不再需要引导。计算次数因此下降约60倍,而人类评估者给出的偏好结果显示两者几乎持平,学生模型拿到45%,教师模型55%。

蒸馏之外还有两个工程细节。模型是音频驱动的扩散变换器,按短片段生成视频,并且只把上一个片段的最新状态作为下一段的运动上下文向前传递,这样即使对话持续很久,每次计算的负担也保持恒定。另一个细节是自强迫训练,也就是让学生模型在自己生成的上下文上继续训练,用来抑制长对话中逐步累积、最终导致画面失真的误差。这两点合起来解决的是同一个问题:实时生成不能只快,还要能一直保持稳定。

规模化能力同样被写进了发布。官方称在亚秒延迟下,单张GB200的服务容量比两步BF16基线高8倍,可同时承载12路实时会话。对一项面向消费级应用的能力来说,单卡并发数直接决定单位服务成本,也决定它能否在免费或低价档位铺开。

语音与画面共用一条词元流

架构上最关键的设计是语音与视频共享同一条流。Muse Realtime Voice生成的语音词元同时编码说了什么与怎么说的,也就是内容与语气;音频解码器把这些词元变成声音,Muse Realtime Avatar则消费同一串词元来生成画面。由于两者读取的是同一份表示,语音、口型与表情天然保持同步,不需要额外的对齐模块去事后修补。

这种设计与常见的两段式管线形成对比。传统做法是先合成语音,再用语音驱动口型与表情,中间需要做时间对齐与音素映射,一旦语速变化或出现停顿就容易失配。共用词元流把对齐问题前置到了模型内部,代价是语音模型与虚拟人模型必须协同训练,不能各自独立迭代。

从产品角度看,这种耦合也意味着Muse的语音能力升级会直接带动虚拟人表现提升,两者共享同一条技术演进路径。对Meta来说,这是一种把语音、形象与智能体身份绑成整体的策略,用户在对话中感受到的不是三个独立模块,而是一个有面孔、有声音、有记忆的角色。

任意形象都能驱动,一致性怎么保证

在形象来源上,Muse Realtime Avatar接受用户选择的一张参考图。官方给出的效果描述包括:人像照片会做出细微表情,全身插画会一边说话一边摆手、改变姿势,动物或日常物件也能获得表情且不丢失自身特征。这个覆盖面比只支持真人头像的方案更宽,也意味着模型需要在不同形态之间保持一致的驱动逻辑。

一致性的要求体现在两个层面。第一是同一场景内的稳定,虚拟形象的外观与举止在连续几轮对话中不能发生变化,否则用户会感到角色在漂移。第二是跨场景的稳定,官方称形象与行为方式在不同场景之间保持一致。对于希望把虚拟形象用于长期内容运营的品牌或个人来说,跨场景一致性比单次演示的惊艳程度更重要,因为它决定了这个形象能否成为可积累的资产。

评测部分,Meta给出了与商业产品的对照。评估者使用同一个虚拟形象外观,分别在Runway Characters与HeyGen LiveAvatar的实时通话界面上进行两到三分钟对话,再比较体验。整体偏好上,Muse Realtime Avatar对Runway Characters为78%比22%,对HeyGen LiveAvatar为88%比12%;在表现力单项上为93%与92%,口型同步单项为78%与94%。需要说明的是,这组数据来自厂商自评,缺少独立第三方复现。

数字人赛道,实时交互成新分水岭

把这次发布放进数字人赛道的整体演进里,可以看到一条明确的分界。早期数字人解决的是生成问题,也就是如何用文字或语音产出一段看起来自然的播报视频,产出物是单向的成品;近一年重心转向交互,也就是让数字人具备倾听、理解与实时回应的能力。两者的技术栈差别很大,前者可以离线渲染追求画质,后者必须在延迟与质量之间找平衡。

这一转向已经在多个方向同时发生。有的平台开放实时数字人接口,让开发者把虚拟形象接入通话与客服场景;有的公司用照片级写实形象做虚拟演出,把重点放在可搬迁与可巡演;也有团队从神经信号入手,探索用脑活动直接驱动全身虚拟化身。路径各不相同,但都在回答同一个问题:当虚拟形象能够实时回应,它应该被用在什么地方。

对企业用户来说,判断这类能力是否可用,可以看三个指标。第一是延迟与稳定性,平均延迟之外还要看长对话中的抖动情况;第二是身份一致性,跨会话、跨场景是否保持同一形象与同一表达习惯;第三是合规与标识,生成内容是否有可追溯的水印与授权链路。Meta这次把重心放在延迟与形象覆盖面上,第三方评测与合规细节的公开程度仍然有限,这两块将是它从演示走向商用的关键考验。

素材来源:Meta官方博客、澎湃新闻、The Verge、Agentic Tribune 发布时间:2026-09-25