9月下旬,计算机视觉顶会ECCV 2026披露了本届的投稿与接收数据。大会程序主席公布,本届共收到10473篇投稿,最终接收2834篇。按研究主题划分,图像与视频合成以超过1400篇位居第一,视觉、语言与推理排在第二,3D则从此前的主导方向退居第三。这组排名在会后引发了相当多的讨论,因为3D长期被视为计算机视觉的核心阵地。但多位与会者的判断是,排名的后退不等于3D退潮,反而说明它正在从独立赛道变成其他方向共同的底座。
理解这个变化需要先看清投稿结构。图像与视频合成超过1400篇居首,反映的是生成式方法在视觉领域的全面渗透。过去几年,扩散模型与自回归生成把图像与视频生成推成了最活跃的发表方向,投稿量自然集中在效率优化、可控生成、长视频一致性与多模态条件控制这些细分问题上。视觉、语言与推理排在第二,对应的是多模态大模型带来的新问题集,包括视觉问答、空间指代与跨模态对齐。
3D的相对下滑,一部分原因是它已经高度成熟。三维重建、点云处理、神经辐射场与高斯泼溅等方向在近几年完成了主要方法论的收敛,单篇论文能带来的突破幅度变小,研究者自然会向新问题迁移。另一部分原因是3D的问题被拆散到了其他方向里:视频生成要保证几何与物理一致,机器人要理解三维空间关系,世界模型要预测场景如何演化,这些任务表面属于不同领域,底层依赖的都是三维表示与空间推理能力。
换句话说,3D从选题的第一名变成了工具链的第一名。研究者不再为了做3D而做3D,而是在解决生成、预测与行动问题时不得不处理三维。这种从目标到基础设施的角色转换,恰恰是技术走向成熟的标志。
如果说投稿与接收数据反映的是热度,工作坊的分布更能说明风向。本届ECCV共设93场工作坊,其中约10场与3D直接相关,11场涉及空间智能,9场指向物理AI,还有5场以世界模型为主题。也就是说,接近三分之一的场次在讨论AI如何理解并作用于物理世界,这个比例明显高于往年。
在工作坊的议程里,可以看到几个反复出现的关键词:三维空间理解、动态场景建模、未来状态预测以及可执行的动作生成。这些议题的共同点是要求模型不只描述当前画面,还要回答物体在哪里、彼此是什么空间关系、遮挡之后还剩下什么,以及一个动作发生后世界会怎样变化。过去这些属于图形学与机器人学的交叉地带,现在被统一到空间智能这个框架下。
这种聚合带来的直接好处是评测标准的统一。当不同方向的论文都在讨论空间一致性与物理合理性,研究者开始使用可比的指标与数据集,而不是各自定义成功标准。对产业方来说,这意味着技术成熟度更容易被量化评估,也更容易判断某项能力距离可部署还有多远。
几位受邀学者的报告勾勒出了这条路径上的关键环节。香港科技大学教授谭平围绕可扩展的3D场景重建与生成展开,从场景表示切入三维空间理解,讨论的是如何用可扩展的方式表达复杂场景,让模型既能重建也能生成。斯坦福大学助理教授吴佳俊则从二维视觉进一步走向随时间变化的三维点云轨迹,用时空表示来理解物体状态与空间关系,解决的是动态场景里物体身份与位置如何保持连续的问题。
中山大学教授梁小丹把重点放在未来预测上,强调世界模型要能够推演接下来真正可能发生的状态变化,而不是生成一个看起来合理却物理上不成立的画面。哈佛大学助理教授杜逸伦的路线从生成式AI与世界模型出发,让模型先想象不同动作可能带来的未来,再通过搜索这些未来结果完成规划。这一思路把生成能力与决策能力串了起来,也是当前具身智能研究里被广泛采用的一条路线。
把四份报告放在一起看,可以读出一条递进的逻辑:先有稳定的三维表示,再有随时间演化的动态建模,然后是符合物理规律的未来预测,最后是把预测结果用于规划与行动。这四个环节分别对应场景理解、时序一致、物理约束与决策执行,也解释了为什么空间智能会被视为AI走向物理世界的核心能力基座。
世界模型与物理AI两个方向的热度,是空间智能升温的直接推手。世界模型的目标是让模型在内部建立一个可推演的环境表征,从而预测动作的后果;物理AI则要求模型把预测落到真实硬件上,在接触、摩擦与形变这些物理约束下完成任务。两者对空间理解的要求都比传统视觉任务高得多。
以具身操作为例,一个抓取动作是否成功,取决于物体的位姿、可抓取区域、手部姿态与接触力,这些信息在二维图像里是部分可观测的,必须借助三维表示来补全。再以自动驾驶为例,遮挡区域的推断、其他交通参与者的轨迹预测,本质上都是空间推理问题。当模型需要做出带有后果的决策时,对空间关系的理解精度就直接决定成功率。
这也是为什么近一年具身智能与世界模型的论文里,三维几何与点云表征出现的频率明显上升。有的模型把RGB、几何与语义放在同一去噪过程中联合生成,有的模型用几何引导来约束视频生成的物理合理性,还有的模型把三维感知作为动作生成的条件输入。路径不同,但对三维的依赖是一致的。
把ECCV 2026的这组数据与工作坊分布合起来看,一个更准确的结论是:3D作为独立选题的热度在下降,作为基础能力的权重在上升。当一项技术从研究前沿变成通用工具,它在投稿统计里的排名往往会下滑,因为研究者不再需要专门为它写论文,而是在解决别的问题时顺带推进它。
这对产业方的启示是明确的。评估一家公司的空间智能能力,不能只看它有没有专门的3D产品线,而要看它的三维能力是否已经嵌入到生成、预测与决策的完整链路里。同样,判断一个世界模型是否可用,关键指标也不只是生成画面的质量,而是长时推演是否漂移、物理约束是否成立、以及预测结果能否直接驱动动作。接下来值得观察的是,这批论文里有多少能在半年内转化为可用的开源模型与工具链,以及具身智能的数据闭环能否跟上模型的迭代速度。三维表示的进步最终要靠真实场景的落地来验证,而不是靠投稿数量。