大晓机器人联合南洋理工大学S-Lab等机构发布并开源了统一多模态世界模型框架Puffin-World。这个框架的设计出发点与传统视频生成模型不同:它没有把目标定为生成一段看起来逼真的画面,而是把物理、几何与外观定义为三种原生的三维世界状态,并在同一个模型中贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索。团队同步开源了代码、模型与Puffin-16M数据集,其中包括1500万组视觉、语言与相机三元组,100万条具有挑战性的旋转轨迹,以及覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注。这些数据的规模,比框架本身更能说明项目的定位:它要解决的是具身智能最缺的那一环,也就是物理正确的训练环境从哪来。
机器人训练对数据的要求与人类观看视频的诉求并不一致。人类看视频关注内容,机器人需要的是能够支撑感知、定位、规划与行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,移动之后会看到什么。一段视觉上流畅的视频如果相机轨迹不符合物理规律,或者场景几何在不同视角之间无法自洽,对训练就是无效数据,甚至会教出错误的先验。图像只是世界状态的一部分,物理方向、空间几何与视觉外观共同构成机器人真正需要的训练环境。
这正是过去几年世界模型研究的分岔点。一部分工作追求生成质量,用扩散模型与自回归架构把画面做得越来越真;另一部分工作追求几何与物理的一致性,宁可牺牲一部分画质,也要保证场景在视角切换后依然成立。Puffin-World明确站在后者一侧。它把三类状态分别建模再统一到同一个框架里,目的是让生成出来的每一个视角都能被机器人的规划模块直接使用,而不只是被人眼观赏。
第一个能力是从单张图片中理解相机的物理信息。模型会结合画面里的地平线、垂直结构与场景构图做空间推理,预测相机相对于真实物理世界的横滚角、俯仰角与垂直视场角,同时生成场景的语义描述。换句话说,它不只识别图中有什么,还理解当前视角以怎样的姿态看到了它。这项能力对机器人尤其重要,因为机器人拿到的往往是单帧图像或少量视角,如果无法判断拍摄姿态,后续的三维推理就失去了参照系。更进一步,这种能力也让普通照片具备了被纳入三维训练管线的可能,而不再依赖专业设备采集的标定数据。
第二个能力是自由视点空间仿真。除了文字描述,用户可以明确指定相机方向与视场角,模型据此生成符合目标机位的画面。这把文生图从内容控制推进到了空间控制:过去提示词能决定画面里出现什么,现在还能决定从哪个角度、以多大的视野去看。对机器人仿真而言,这意味着可以在没有真实场景的情况下,按需生成特定机位下的观测数据,用于训练视觉定位与导航策略,数据获取成本与采集周期都会明显下降。
数据规模是这个开源项目最实的部分。Puffin-16M包含1500万组视觉、语言与相机三元组,意味着每一张图像都配有语言描述与对应的相机参数;100万条旋转轨迹专门覆盖大幅度的视角变化,这类数据在真实采集里极难获得,因为拍摄者很少会绕着物体做完整的旋转记录。团队还开放了覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为可复现、可扩展的训练提供统一基准。
把相机位姿标注单独拿出来开源,价值可能被低估。绝对位姿是三维重建与空间推理的监督信号,公开数据集里大量图像只有相对位姿或完全没有位姿信息,研究者不得不花大量时间做标定与对齐。统一标注把这一层工作前置完成,让不同团队的结果可以在同一口径下比较。对于需要合成数据来训练机器人策略的团队,这套数据可以直接支撑仿真环境构建,减少对真实场景采集的依赖,而真实采集恰恰是具身智能里最贵、最慢的环节。这套数据还有一层现实意义:它把合成数据的成本结构摊开了。真实场景采集需要场地、设备、人力与时间,规模越大边际成本越高;合成数据的前期投入集中在模型与算力,一旦管线跑通,边际成本接近电费。两者的取舍不在于谁更便宜,而在于任务需要哪种数据。几何一致性要求高的训练,合成数据的价值明显更高。
第三个能力是三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定的相机轨迹生成多个新视角,并同步预测每个视角的外观与深度,不同视角随后汇聚成具有一致空间结构的三维世界。这项能力的直接用途是机器人仿真与合成数据生产,间接用途是让模型具备对空间关系的显式表示,而不只是像素层面的拟合。
第四个能力是闭环自校准探索。当相机姿态偏离重力方向时,模型先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成状态感知、动作预测、结果生成、再次校准的循环。这条链路把生成模型与决策过程连了起来,是通向具身智能的关键一步。当然,闭环的稳定性需要大量验证,一旦误差在循环中累积,模型可能会越修越偏。这项能力最终能否用于真实机器人,取决于它在长序列任务中的漂移控制水平,这也是后续最值得关注的评测方向。