Meta公布拟真虚拟形象Hologram,秋季登陆智能眼镜与头显

首页 / AI资讯 / 数字人

0:00
0:00
1x
定时

9月28日,Meta宣布将于今年秋季起陆续为旗下雷朋Display智能眼镜与Quest头显上线Hologram全新虚拟形象功能。这项技术类似苹果Vision Pro的Persona,能够通过生成式AI打造与真人外观高度接近的虚拟形象。事实上,Meta早在七年前就展示过名为Codec Avatars的拟真虚拟形象项目,但直到今天,消费者能买到的Meta虚拟现实产品主要仍使用较为卡通化的自定义形象。按照目前的规划,后续Meta会逐步把用户形象从卡通化推向拟真写实化,而Hologram是这条路线第一次真正落到量产设备上。

从卡通形象到拟真写实,Meta走了七年

拟真虚拟形象的技术难点,在于要让一个由模型生成的数字面孔在长时间对话中保持可信。卡通形象的优势恰恰是它不需要可信:观众不会期待一个卡通头像有真实的眼神与肌肉运动,因此模型的偏差不会被察觉。一旦转向写实,人眼对异常的敏感度会急剧上升,嘴角的细微不同步、眼神的轻微呆滞都会被立刻识别为不对劲。这也是为什么拟真形象的研究持续多年却迟迟没有进入消费产品:技术可行与体验可接受之间存在很长一段距离。

推动这次落地的因素有两个。一是生成式扩散模型的成熟,让实时生成高质量人像视频成为可能;二是硬件形态的变化,智能眼镜与头显本身就在用户面部,天然适合承载以用户本人为原型的形象系统。从产品角度看,拟真形象解决的是一个具体问题:在视频通话中,用户未必希望对方看到自己当下的真实状态,比如刚起床、在旅途中或在杂乱的环境里。用一个由AI生成、外观接近自己的形象替代摄像头画面,既保留了面对面的社交感,又提供了对自身呈现方式的控制权。

只用音频驱动,Hologram怎么生成表情

据Meta介绍,雷朋Display版本的Hologram采用运行在Meta服务器上的实时生成式AI扩散模型,以眼镜麦克风采集的音频作为输入,实时生成2D视频流发送给通话另一端。这里最关键的设计是,面部表情主要根据用户说话时的声音变化生成,而不是直接使用摄像头捕捉真人画面。这意味着整个链路里没有视频采集环节,只有音频上行与生成视频下行。

以音频驱动表情的技术路线,好处是隐私负担更轻,也降低了对摄像头画质与光照条件的依赖。但它的局限同样明显:声音能传达的信息有限,真正的表情还依赖视觉线索,比如点头、皱眉、眼神转移。如果模型只能从声音推断表情,那么在用户沉默倾听时,生成的形象就容易显得呆板。要在长时间通话中保持自然,模型需要具备从语音韵律、停顿、语气里推断情绪状态的能力,同时还要在用户不说话时生成合理的倾听反应。这类细节决定了拟真形象是可用还是只能短暂尝鲜。

眼镜端2D与头显端3D的两套实现

Hologram在两个平台上的实现方式并不相同。雷朋Display眼镜端生成的是2D视频流,用于WhatsApp视频通话,对方看到的是一个平面的人像画面,这与传统视频通话的观感接近。Quest头显端则采用3D等身立体形式,当两名Quest用户通过WhatsApp进行视频通话时,双方会先在一个3D窗口中看到对方的Hologram,点击窗口旁边的按钮后,通话可以切换至全身模式,对方的虚拟形象会以接近真人的尺寸出现在用户面前。

两种形态对应不同的技术约束。2D视频流可以借助成熟的扩散模型生成,计算压力主要集中在服务端,终端只需解码播放;3D等身形象则需要额外处理空间位置、视角变化与身体动作,渲染与传输的开销都更高。这也解释了为什么眼镜端先以2D形式落地:在算力与功耗受限的可穿戴设备上,把生成放在云端、终端只负责显示,是当前更现实的选择。随着端侧推理能力提升,未来是否会把部分生成能力下沉到设备本地,将直接影响延迟与隐私表现。

拟真形象的授权与滥用风险

用户创建Hologram的过程需要提供相当多的生物特征数据。首次使用时,用户要打开手机上的Meta AI应用,按提示转动头部、微笑,随后系统会提出一些开放式问题,要求用户进行较长时间的回答。在回答过程中,系统采集用户的面部表情与说话状态用于训练和调整模型,同时记录用户的服装与背景。整个创建过程只需几分钟,完成服务器端处理后即可生成。这套流程收集的是人脸几何、表情习惯与声音特征的组合,属于敏感度最高的数据类别之一。

由此带来的问题是双重的。一方面是数据安全,一旦这些模型与素材泄露,被伪造的风险远高于普通照片;另一方面是身份冒用,当一个人的拟真形象可以被生成,如何确认通话另一端是本人而非合成结果,就成了新的信任问题。行业目前的应对方向是给生成内容加水印与来源标记,但这只能证明内容是AI生成的,无法证明说话者是否得到了授权。Meta表示目前版本仍有改进空间,人物尺寸可能与真人存在轻微差异,眼睛等细节在部分情况下会显得较为粗糙,用户向侧面倾斜过多时形象还会变形。这些技术瑕疵在短期内反而起到了一定的保护作用,但随着效果逼近真人,围绕形象授权与身份验证的规则会成为行业必须补齐的一环。

素材来源:IT之家、Meta、Reuters、Meta Connect 2026 发布时间:2026-09-29