Viggle开源Meridian,一条视频能重拍任意机位,单卡就能跑

首页 / AI资讯 / AI视频

0:00
0:00
1x
定时

AI视频生成长期被一个问题困住:生成出来的画面好看,但你想换个角度看同一件事,就得重新生成一遍,而且大概率换了个人、换了条街。9月18日,Viggle AI在Hugging Face开源了几何引导视频模型Meridian,试图把"重拍镜头"这件事从抽卡变成可控制的参数调整。模型基于MiniMax-H3构建,可以从已有视频甚至单张照片出发,重新设计这台虚拟摄影机的位置与运动轨迹。

把"重拍"交给几何信息,而不是提示词

Meridian的技术路线是用几何而非语言来约束画面。模型通过VGGT-Ω从输入视频中估计深度与相机位姿,得到一套度量尺度的空间参照,再据此重新生成画面。这样做的结果是空间自由度被明确地拆成了几项可调参数:可以环绕主体转一圈,可以推近拉远,可以横向平移,也可以上下升降,观察方向与视场角都在可控范围内。相比在提示词里写"镜头从左侧缓慢推进",这种方式给出的是确定的位置关系,而不是让模型自由发挥。

更关键的是它支持单图驱动运镜。官方演示中,一张芭蕾舞者的静态照片就能带动完整的相机运动,画面中的空间关系随之变化,而不是简单地做局部动画。这对素材条件有限的创作者意义很大:过去要生成多角度画面,前提是拍到了多角度素材,或者至少有一段可用的视频;现在一张图就能成为一个可被反复取景的空间。模型权重挂在MiniMax-H3社区许可下,官方演示涵盖越野摩托、NBA扣篮与原视频混合,以及水花凝固的瞬间。值得注意的是,几何估计这一步是整条链路的根基,深度与位姿的精度直接决定重新取景后画面是否会出现结构错位,因此它对输入素材的画质与运动幅度都比较敏感。

时间也能被冻住,子弹时间式的暂停与续拍

除了空间,Meridian还给出了时间维度的控制。用户可以选择视频中的某一段,冻结某一帧,或者在生成前放慢、加快节奏。把这几项能力组合起来,就得到了类似子弹时间的镜头语言:画面在某个瞬间停住,摄影机在冻结的时空中移动,然后再恢复播放。这类镜头过去依赖多机位阵列或昂贵的后期合成,现在变成了一次生成里的参数组合。

时间控制的价值不只是做特效。对剪辑与分镜工作流来说,先冻结关键帧、调整机位、再决定节奏,意味着创作者可以在同一条素材上反复试验不同的叙事方案,而不必每次都从零生成。配合4步快速推理LoRA,试错的时间成本被进一步压缩。Viggle选择把这一代能力开源而不是留在自家平台内,本身也是产品策略的一部分:它的角色动画工具长期依靠运动模板与角色替换吸引创作者,而Meridian补上的正是"镜头"这一层。对以运动模板和角色替换为核心能力的Viggle来说,把镜头控制这一层也开源出去,等于把自家工具链的完整度补齐,同时把社区贡献引向模型改进而不是重复开发。

单张B200跑推理,权重开放意味着什么

部署门槛是Meridian被讨论较多的另一点。官方信息显示模型可以在单张B200 GPU上完成推理,权重通过Hugging Face发布,模型卡挂在MiniMax-H3社区许可下。这意味着有条件的研究团队和工作室可以直接在本地部署,按自己的数据与场景做二次开发,而不必完全依赖云端API的调用额度与排队时间。对制作团队来说,本地部署还意味着素材不必上传,涉及未公开产品、演员肖像或客户机密的项目在合规上更容易过审,这也是不少影视与广告团队坚持私有化部署的原因。

把这件事放到更长的脉络里看,开源视频模型近期的竞争焦点正在从"能不能生成"转向"能不能控制"。过去一年,各家模型比拼的是分辨率、时长与音画同步,现在多机位一致性、相机路径可控性、素材复用能力成了新的分水岭。原因很实际:广告、短剧与电商视频的生产流程里,最耗时的环节往往不是生成第一版,而是客户改需求之后的重做。一个能保留原有事件、只换机位的模型,把重做的成本从重拍降到了调参。对制作团队来说,这类能力比再涨几分钟时长更有价值。

真正的门槛回到素材与版权

不过,几何引导路线也有它绕不开的前提。Meridian依赖VGGT-Ω估计深度与位姿,这意味着输入素材的质量会直接影响输出稳定性:画面过暗、运动模糊严重、缺少可识别的空间特征时,几何估计的误差会被放大到生成结果里。单图驱动虽然方便,但单张照片提供的空间信息终究有限,大幅改变机位时仍可能出现结构上的猜测与补全。

版权与授权则是另一道关口。用已有视频重新设计镜头,天然涉及原始素材的使用权;把真实赛事、商业广告的片段拿来重拍,即便画面经过模型重绘,法律上的边界依然模糊。这也是社区许可而非完全开放许可被采用的原因之一。对使用者来说,比较稳妥的做法是把这类工具定位在自有素材与原创场景上:先用自己的拍摄或生成内容建立可复用的空间资产,再在此基础上做多机位与时间维度的实验。工具把镜头交到了创作者手里,但素材从哪来、能不能用,仍然是需要自己回答的问题。从更实际的角度看,这类工具最可能先落地的场景是自有素材库的复用:把过去拍过的产品、场地与人物转成可反复取景的空间资产,同一条素材在不同投放渠道里生成不同视角的版本,既省成本也降低重复拍摄的协调成本。

素材来源:Viggle AI、ModelScope魔搭社区、AGI Hunt、Hugging Face 发布时间:2026-09-19