生成式AI在文本、图像与视频之后,正在把扩张的触角伸向空间维度。北京航空航天大学史振威教授与邹征夏教授团队近日公布的研究成果MetaEarth3D,首次将生成式基础模型从二维遥感影像扩展到大规模三维场景生成,只要给定一句文字描述或一张卫星图,它就能生成从大规模地形、中等尺度城市到精细街区连续一致的无界三维世界,并支持虚拟相机自由飞行漫游,论文已被《国家科学评论》正式接收并在预印本平台公开。
MetaEarth3D要解决的核心问题,是三维内容生成的"无界"与"一致"这对矛盾。以往的三维生成模型大多局限在单个物体或单一场景,生成一个房间、一件产品没有问题,但面对地球尺度时,模型既需要理解全球地形的宏观结构,又要保证相邻区域的细节无缝衔接,任何断层或风格跳变都会破坏沉浸感。北航团队的做法是把空间尺度本身作为基础模型的扩展维度,让模型在统一的框架内同时掌握地形、城市与街区的生成规则。
与谷歌地球等传统方案相比,MetaEarth3D走了一条截然不同的技术路径。谷歌地球的本质是把真实世界预先重建并搬进计算机,通过航拍、卫星遥感和三维重建生成场景数据,再以三角网格、点云等格式存储,用户浏览时调用对应数据渲染,本质是一套依赖大规模采集与重建的三维数据库,制备流程复杂且成本高昂。MetaEarth3D则直接从文字或卫星图出发生成场景,不依赖真实三维数据,为数字地球与空间智能应用提供了全新的内容供给方式。
MetaEarth3D最独特的价值,在于生成场景天然携带高度、距离等原生空间标注。传统的视觉生成模型输出的是没有物理含义的像素,AI模型无法从中学习空间关系;而MetaEarth3D生成的每个场景都附带精确的空间信息,相当于给无人机、卫星等空天AI模型提供了一批带标准答案的训练样本。研究团队实测显示,用这些生成数据训练的模型,空间理解能力平均提升22.85%,验证了合成数据在空间智能训练中的有效性。
这一特性直接指向了具身智能与空间智能训练中最大的痛点,真实三维数据的匮乏。自动驾驶、机器人导航与遥感解译等领域对多样化场景的需求近乎无限,而真实数据的采集受成本、场地与法规限制,难以覆盖全部边缘情况。MetaEarth3D相当于打造了一个可无限扩展的生成式模拟器,空间智能体可以在这个模拟器里生成无穷无尽的带标签训练数据,为无人机避障、卫星任务规划与具身机器人仿真提供了稳定的数据供给。
在生成能力上,MetaEarth3D实现了跨尺度的层级生成。给定全球尺度的高程数据或描述,模型先生成宏观地形,包括山脉走向、水系分布与地貌起伏;放大到城市尺度,它能在地形基础上生成建筑群落、道路网络与区域规划;再深入到街区尺度,建筑单体、街道细节与地面要素被逐层细化。用户可以通过虚拟相机在任意层级自由飞行,不同尺度之间的场景保持几何与风格的一致,形成连贯的沉浸式三维世界。
这项能力的前景不止于视觉演示。在数字孪生领域,MetaEarth3D可以快速为城市管理生成可交互的三维底图,用于规划推演与应急模拟;在遥感解译方向,它生成的带标注场景可以预训练模型,提升真实影像的分析精度;在游戏与影视行业,一句话生成大型开放世界的能力则为内容创作提供了全新的资产管线。研究团队表示,后续将围绕真实数据融合与更精细的场景控制继续推进,让生成的世界不仅能看,更能被真实任务使用。在遥感测绘领域,模型生成的三维地形可以作为低成本预览底图,帮助任务规划人员快速评估目标区域的通行条件与遮蔽关系;在灾害应急场景,基于历史影像生成灾前灾后的对照场景,也能为救援路径规划提供直观参考,随着推理成本下降与生成精度提升,这类合成三维数据的应用边界还会持续外扩。
MetaEarth3D发布的时间点,正值全球空间智能竞争升温。世界模型被视为具身智能与自动驾驶的底层引擎,英伟达、谷歌与李飞飞的World Labs都在押注空间理解,而三维生成正是空间智能的数据入口与验证场。北航团队选择从地球观测场景切入,以全球尺度的三维生成为目标,避开了海外团队扎堆的单场景重建赛道,走出了一条差异化的学术路线,也让国产研究团队在世界尺度生成这个新方向上占据了先发位置。
当然,从学术成果到产业应用仍有距离。当前模型的生成分辨率与真实度相比影视级资产还有差距,大规模部署所需的算力成本也不低,空间标注的精度能否满足专业级训练要求仍需更多验证。但MetaEarth3D已经证明,生成式基础模型的空间扩展是一条可行的技术路线,当数字地球、空间智能与具身仿真都需要海量三维数据时,能"凭空造世界"并自带标准答案的生成模型,将和此前的图像生成模型一样,成为AI基础设施中不可或缺的一环。