当你在电影院里看到某个角色张嘴大笑,牙齿清晰可见,眼珠随着视线转动,舌头随着说话前后运动,你有没有想过,这背后需要多复杂的技术支撑?在增强现实、虚拟会议、AI生成视频越来越普及的今天,如何让数字人类的头部看起来真实可信,已经成为一个直接影响用户体验的技术难题。谷歌研究团队给出的答案,是一个名为GNM的全新参数化头部模型。
这项由谷歌研究团队主导的研究,于2026年7月26日以预印本形式发布,论文编号为arXiv:2607.23687v1,研究团队由数十位来自谷歌的工程师、科学家和艺术家共同完成,涵盖计算机视觉、计算机图形学、3D建模等多个专业方向。GNM的全称是生成式人体测量模型,名字刻意设计成与人类基因组同音,暗示它对数字人类头部的基因级重建雄心。
GNM最直观的突破,是让数字人类头部的内部结构从无到有。传统方法生成的数字头部,嘴部是空的,没有牙齿和舌头;眼眶里只有一个球形占位符,没有角膜的弧度变化,没有瞳孔大小的控制。而GNM重建的头部模型,包含完整的牙齿、眼球、舌头等内部结构,角色张嘴、大笑、眨眼时,这些细节都会真实呈现,整体真实感大幅提升。
这些内部细节对数字人类的影响,远超一般人的想象。当角色张嘴说话时,没有牙齿的嘴会显得异常诡异;当镜头拉近到眼部特写时,没有角膜反光和瞳孔变化的眼睛会让画面失真。GNM把这些缺失的部件补齐,让数字人类在特写镜头下依然经得起审视,这是传统模型长期无法解决的痛点。
从技术实现看,GNM延续了参数化建模的思路,但把参数空间从表面扩展到了完整解剖结构。研究团队收集了大量真实头部的三维扫描与医学影像数据,通过统计学习建立牙齿、眼球、舌头的形状和运动模型,再与面部外观参数统一起来。这意味着创作者调整某一个参数,比如牙齿的排列方式或者瞳孔的大小,都会影响头部的整体观感,而不再需要单独雕刻每一个部件,这种一体化的参数设计大幅降低了数字人类头部资产的制作成本。
从技术角度看,GNM代表了一种建模思路的转变:数字人类头部不再被当作一张可以变形的人脸蒙皮,而是一个需要完整解剖结构的立体对象。这种从外壳到内芯的升级,让数字人类第一次具备了可以支撑极端表情和特写镜头的结构基础,也为后续更复杂的动画和交互提供了可能。
要理解GNM的价值,先要弄清楚数字人类头部为何长期是个空壳。以往最流行的技术叫三维变形模型,可以把它理解成一套脸部积木:研究人员事先收集大量真实人脸的三维扫描数据,用统计学方法归纳人脸的变化规律,比如鼻梁高低、颧骨宽窄、下巴形状,这些规律被压缩成一组数字参数,调整这些数字就能生成不同的面孔。
这套方法在过去几十年非常成功,从电影特效到人脸识别再到虚拟试妆,都有它的身影。但它有一个根本性缺陷:把人类的头部当成了一个实心的面具来处理。外面的皮肤、骨骼结构、轮廓都有了,但嘴巴里面是空的,眼眶里只有球形占位符。这个问题在平时看起来不严重,但一旦角色张嘴说话、大声笑出来,或者镜头拉近到眼部特写,问题就立刻暴露,生成的画面会让人感到一种说不清道不明的不对劲,专业上叫做恐怖谷效应。
恐怖谷效应指的是当数字角色长得很像真人但又差了那么一点点时,人类大脑会产生强烈的不适感。数字人类头部的内部缺失,正是恐怖谷效应的重要来源之一。GNM通过补齐牙齿、眼球、舌头等内部结构,有效缓解了这个问题,让数字人类在表情和特写维度跨过了恐怖谷的一部分。
GNM对恐怖谷效应的缓解,建立在更细致的观察之上。研究发现,人类对数字人脸的不适感往往集中在口腔和眼部区域,当角色说话时牙齿的咬合关系、大笑时眼周的肌肉褶皱这些微观细节缺失,大脑就会立刻察觉异常。GNM在这些区域的建模精度上做了针对性投入,让数字人类在情绪表达时保留更多真实的生物力学特征,这种对细节的较真,正是跨越恐怖谷的关键一步。
数字人类头部建模的技术演进,经历了多个阶段。早期的手工建模依赖艺术家逐顶点雕刻,成本极高且难以复用;三维变形模型的出现让头部生成进入参数化时代,通过统计学方法实现了千人千面的快速生成;随后的神经渲染技术提升了表面的真实感,但内部结构依然缺失。GNM在此基础上向前迈进,把参数化建模从表面扩展到完整解剖结构。
GNM的意义不止于技术本身。数字人类头部是AR、VR、虚拟会议、AI生成视频、电影特效等众多应用的基础资产,头部真实感的提升,直接关系到这些应用的体验质量。当虚拟会议中的数字分身拥有真实的牙齿和眼球,当AI生成视频中的角色可以自然大笑而不显诡异,这些场景的用户接受度都会显著提升。
当然,GNM作为预印本研究,距离工程化应用还有距离。头部模型的参数化复杂度、实时渲染性能、与现有动画管线的兼容性,都是后续需要解决的问题。但它指向的方向已经清晰:数字人类的竞争正在从表面的皮肤和毛发,深入到牙齿、眼球、舌头这些决定真实感的内部细节,这一层突破,将是下一阶段数字人类技术的关键分野。
从产业角度看,GNM这类研究的价值还在于为下游应用提供了更高质量的基础资产。数字人类技术公司普遍面临同一道难题:头部模型的真实度直接决定产品的用户接受度,而传统模型在特写场景的短板又难以通过渲染和后处理弥补。GNM把内部结构纳入参数化体系,相当于把此前需要艺术家手工打磨的环节前置到了模型层面,让更多中小团队能够直接使用接近影视级的头部资产,这会显著降低数字人类应用的门槛,也意味着虚拟主播、数字员工、虚拟偶像等应用的体验质量有望整体上一个台阶。