视频生成模型的镜头控制,长期是行业公认的硬骨头。生成一段"镜头缓缓推进"的画面,模型常常在三维空间里"迷路":画面漂移、物体变形、运镜失控,成为视频生成落地专业创作场景的最大阻碍。8月中旬,腾讯ARC Lab联合香港大学、香港科技大学提出并开源SCoPE框架,给出了一条截然不同的解决思路:与其再加一个相机控制模块,不如从底层重构视频模型理解相机运动的方式。SCoPE为每个视频token绑定一条由相机参数确定的三维射线,并把射线特征写进注意力机制的query与key中,让模型在比较"内容像不像"的同时,也能看到"这两束视线在几何上合不合理"。在Wan2.2的5B与14B模型上,SCoPE新增参数均不到0.1%,却让14B模型的相机旋转误差降低29%、FVD降低43%,几乎不改变模型规模,同时改善了相机控制与视频质量。
要理解SCoPE的价值,先要理解视频模型为何会在镜头运动上失控。现有视频生成模型大多基于2D的文本或图像位置编码,模型知道每个token"在画面中的位置",却不知道"这束像素对应的空间方向"。当镜头转动或推进时,画面内容剧烈变化,模型缺乏三维几何信息的指引,只能靠统计规律"猜"下一帧,于是出现物体漂移、场景重置、运镜生硬等问题。SCoPE的突破口,是把相机参数换算成每条视线对应的三维射线,再将射线特征编码进attention计算,相当于给模型的视觉世界装上了一套3D坐标系。
这套设计在工程上极为轻量。SCoPE没有先把场景重建成显式3D模型,也不需要额外维护几何地图,只需为每个时空token计算一条由相机参数确定的射线,将射线特征注入query与key即可。新增参数占比不到0.1%,意味着它可以直接叠加在现有视频扩散模型上,无需重新训练整个基座。在Wan2.2的5B与14B两个规模上,SCoPE都保持了这种"即插即用"的特性,这一低成本的特性,正是其能够快速开源扩散的关键。
效果的提升来自几何约束对注意力机制的引导。当模型在attention中同时比较内容相似性与视线几何合理性,外观相似但视线不相容的候选会被自动区分,模型不再把"长得像"的两块区域错误关联,跨帧的几何一致性因此显著提升。官方评测显示,14B模型上相机旋转误差降低29%,FVD降低43%,前者代表运镜控制的精准度,后者代表生成视频的整体质量,两项指标同步改善,说明SCoPE并非"牺牲质量换控制",而是同时受益。
SCoPE最直观的能力演示,是单张图像驱动的连续运镜。给模型一张图,用户按下W、A、S、D键,画面即可响应"向前推进、侧向平移、后退"等指令,甚至连续执行一段组合路线,画面同步显示按键与目标相机轨迹。这种交互式漫游体验,对游戏场景生成、虚拟制片预演、空间设计可视化等场景有直接价值:创作者可以在生成前先"走一遍"镜头路径,确认机位设计后再产出成片,大幅减少后期返工。
除了交互式漫游,SCoPE对常规的文生视频、图生视频运镜控制同样有效。输入首帧、文本描述与指定轨迹,模型即可按照目标相机运动生成视频,镜头与画面内容保持几何一致。这意味着电影级的推拉摇移、环绕跟拍、升降镜头等运镜手法,可以通过轨迹描述精确复现,而非依赖提示词"碰运气"。对于追求镜头语言的专业创作者,这种可控性是视频生成工具从玩具走向生产线的关键一步。
当然,SCoPE并非万能。它解决的是"相机怎么动"的问题,对于画面内物体自身的运动控制,仍需要与MotionCtrl等物体运动控制方案配合;超长镜头的累积误差、复杂场景中的几何歧义,也还需要进一步的工程打磨。目前项目已开源论文、代码与模型权重,基于Wan2.2的推理流程自包含,开发者可以直接在本地复现与二次开发。学术开源的价值,正在于让更多人参与到运镜控制的迭代中来。
SCoPE的发布,正值AI视频运镜控制赛道的集中爆发期。此前,CrossView-Warp等LoRA方案尝试通过参考视频改机位,LTX-Video社区也出现了跨视角运镜工具,而SCoPE走的是更底层的路线:直接改造位置编码,让模型原生理解相机几何。两条路线各有优劣,但SCoPE"新增参数不足0.1%"的轻量特性,使其在可移植性上具备明显优势,任何基于Transformer的视频扩散模型都有望受益。
从产业视角看,运镜控制是视频生成走向专业化的最后几块拼图之一。画质、时长、音画同步等基础能力已经基本成熟,而"可控性"决定创作者能否把AI视频用在正式项目中。镜头语言是影视叙事的基本语法,如果AI只能生成"随机运镜"的画面,就无法替代导演的创作意图。腾讯ARC、港大、港科大在SCoPE上的合作,代表了学界与产业界在视频可控性上的共同投入,也说明运镜控制已经从"炫技"进入"工程化"阶段。
值得注意的是,SCoPE的底层思路对更广的领域同样有启发。相机射线位置编码本质上是把3D几何信息注入2D生成模型,这一范式可以延伸到世界模型、空间智能等领域,让生成模型不仅"看见"画面,更"理解"空间。当视频模型真正装上3D坐标系,AI生成内容与真实物理世界的距离将进一步拉近。SCoPE的开源,为这条技术路线提供了一个可复现的起点,也预示着视频生成的下一个竞争焦点,将从"生成什么"转向"如何精准控制"。