当你用手机拍下32张房间照片,想让计算机"脑补"出任意角度的三维画面时,传统方法可能需要数十分钟甚至更久。现在,香港科技大学与华为诺亚方舟实验室的联合团队找到了一个突破性的解决方案——他们提出的AsySplat框架,让计算机不仅算得更快,还省了一半的力气。
这项以预印本形式发表于arXiv平台的研究成果,论文编号为arXiv:2607.10995,聚焦于如何让计算机更高效地从一组照片中重建完整的三维场景。所谓新视角合成,就是根据有限视角的输入图像,生成任意目标视角下的画面。这项技术是虚拟现实、数字孪生、影视制作和自动驾驶地图构建等领域的核心支撑技术,可以说是让计算机真正"理解"三维世界的关键钥匙。
要理解AsySplat的创新之处,先得明白现有主流方法的问题出在哪里。目前行业广泛采用的3D高斯泼溅技术,其工作原理可以通俗地理解为:把照片切成大量微小的图像碎片(即高斯椭球体),然后让神经网络反复处理所有碎片之间的空间关系,从而推断出场景的三维结构和外观。
问题在于,输入照片的分辨率越高、数量越多,所需的碎片数量就呈指数级增长。一张960P的高清照片已经包含海量细节,32张叠加在一起,计算机需要处理的信息量让很多现有方法望而却步。更关键的是,研究团队发现,现有方法在处理过程中存在严重的资源错配——它们把有限的计算资源同等地分配给了两件难度截然不同的任务:一是弄清单个碎片的三维位置(几何信息),二是决定每个位置的色彩和纹理(外观信息)。
研究团队通过深入分析发现两个关键事实:第一,精确的三维重建并不是高质量渲染的必要前提;第二,人类视觉系统对几何误差和外观误差的敏感度存在数量级的差异。这意味着我们可以大胆地降低几何部分的计算精度,把省下来的算力集中在决定画面美感的外观渲染上。
基于上述观察,AsySplat的核心创新是提出了一套"因材施教"的非对称高斯椭球体分配机制。传统的3DGS方法给场景中每个区域分配的高斯椭球体数量大致相当,无论是对几何结构要求高的区域,还是对纹理细节要求高的区域,都享受同样"待遇"。而AsySplat把场景分成两类区域:几何主导区和外观主导区。
在几何主导区,例如桌子的边缘、墙角的交界处等需要精确定义三维结构的区域,AsySplat会分配少量但位置更精确的高斯椭球体。在外观主导区,例如墙纸的纹理、地毯的花色等对视觉效果影响大但对几何精度要求低的区域,AsySplat会分配更多用于表达色彩变化的高斯椭球体,而几何信息则保持粗粒度。
这种非对称分配策略的结果非常惊人:计算量直接减少一半,但渲染质量不仅没有下降,在某些场景中反而因为外观细节更丰富而有所提升。更关键的是,由于需要处理的高斯总数显著减少,场景加载和渲染的速度提升了整整800倍。对于需要实时交互的VR应用和数字孪生系统而言,这意味着一扇新的大门已经打开。
AsySplat的实际应用价值在当前阶段尤为突出。3D高斯泼溅技术自2023年被提出以来,一直面临一个核心矛盾:重建质量与计算效率不可兼得。影视级制作可以容忍数小时的离线渲染,但自动驾驶汽车、机器人导航和VR头显却需要毫秒级的实时响应。
华为诺亚方舟实验室的参与,暗示了这项技术从学术研究走向工业落地的可能性。在华为的昇腾AI计算平台上,AsySplat的并行化推理已经展现出良好的适配性。这意味着,未来搭载昇腾芯片的智能设备,有望在移动端实现接近实时的3D场景重建能力。
在数字孪生城市项目中,传统的基于摄影测量的三维重建流程需要数天甚至数周的计算时间。如果采用AsySplat方案,同样的数据量可在数小时内完成,且计算成本大幅降低。在自动驾驶领域,车辆需要实时重建周围环境的3D地图,AsySplat的速度优势将使高精度地图的实时更新成为可能。
从学术价值来看,AsySplat获得的SPM 2026最佳论文提名也已证明其创新性。SPM(Symposium on Solid and Physical Modeling)是几何建模与物理仿真领域的顶级学术会议,每年收录的论文均代表了该方向的最高水平。AsySplat获得最佳论文提名,标志着中国研究团队在3D视觉与几何处理领域已跻身世界前列。
从产业视角来看,AsySplat的意义不只是一篇论文的突破,更代表着3D视觉领域正在从追求重建精度的单目标优化转向追求效率与质量平衡的多目标优化。这一转向将催生出一系列基于实时3D重建的新应用形态,从动态直播间的特效叠加到远程医疗的三维建模,从工业检测的自动化质检到文化遗产的数字化保护,整个产业链都将因此受益。这种范式的转变将推动3D场景重建从云端走向终端,从专业设备走向消费设备。在AR眼镜、自动驾驶、数字孪生等前沿应用中,实时3D重建能力将是决定用户体验的核心瓶颈,而AsySplat的方案为突破这一瓶颈提供了坚实的基础。