长AI视频之所以容易崩,是因为每一个镜头都在相对独立地生成。人脸会变,房间会重新排列,一件道具的颜色会漂移。9月25日,谷歌研究公布了一套统一的多智能体框架,试图通过把长视频生成当作全局规划问题、而不是一串提示词的接力来解决它。官方把这套流程描述为能够生成时间上一致的长篇视频叙事,同时缓解视觉漂移与流水线错误传播,并把整体方法概括为把长视频生成当作全局优化与世界状态跟踪问题。需要说明的是,这是研究而非产品,但它给出的结构对任何在搭智能体视频管线的人都是可直接借鉴的模板。
多数视频模型一次只生成几秒钟,长视频是由许多片段拼接而成的。两种失败模式会互相放大。第一种是视觉漂移:每一段都以前一帧或一段文字提示为条件,身份或布局上的小误差会不断累积,到第二分钟,主角已经不像主角了。第二种是错误传播:在自回归链条里,一段坏掉的片段会污染它之后的所有内容,而如果一味接受精修循环的最后一次迭代结果,一个坏结果就可能被锁死。
此前的应对办法各有代价。要么需要白盒访问模型内部,要么需要跑昂贵的测试时优化。谷歌在说明中指出,测试时方法要么计算成本很高,要么要求白盒访问权限,这正是这套框架中若干组件被设计成把视频生成器当作黑盒对待的原因。把模型当黑盒,意味着这套方法可以套在闭源视频模型上使用,而不必要求厂商开放内部结构。
第一个组件叫AI Video Co-Director,是一个分层多智能体规划器。它不再让人写一段长长的提示词然后祈祷,而是探索创意策略、叙事模式与美学原型,并用多臂老虎机优化在其中做选择。多臂老虎机的框架很关键:它把该用哪种风格与故事结构当成一个探索与利用的权衡问题,把生成预算花在得分高的方向上,而不是一开始就锁定第一个想法。官方公布其在GenAD-Bench上的质量得分为81.4。相关论文编号为arXiv 2604.24842,已列入COLM 2026。
这个设计解决的是一个很实际的问题:长视频的失败往往在规划阶段就埋下了。如果故事结构与镜头节奏本身不成立,后面每一段的生成质量再高也救不回来。把规划独立成一个可搜索、可评估的环节,等于在花钱生成画面之前先花少量算力试错。
第二个组件叫CANVAS,全称是通过视觉智能体分镜实现连续性感知叙事。它维护一份显式的世界状态:场景里有谁、他们长什么样、地点在哪里、存在哪些物件。当某个角色在十个镜头之后再次出现时,智能体会从多模态视频记忆中取回信息,让角色锚定在最初的设定上,而不是根据一段松散描述重新生成。这解决的是长视频里最常见的崩点:角色一致性。
CANVAS对应arXiv 2604.13452,已列入EMNLP 2026。它的思路与记忆式世界模型有相通之处:把容易漂移的属性从生成过程里剥离出来,存成可查询的状态,而不是指望模型在上下文里自己记住。差别在于它面向的是叙事层面的连续性,管的是角色、地点与道具这些语义实体,而非像素级的几何一致。
把世界状态显式保存下来,还有一个附带好处:它让叙事可以被编辑。导演如果想让某个角色换个发型,改的是状态里的属性,而不是重写整段提示词再重新生成,修改的范围和代价都小得多。
第三个组件叫A²RD,即智能体自回归视频生成。它逐段生成一段长视频,并由智能体在每一段上判断是继续从前一段向前外推,还是朝一个已规划好的后续锚点做插值。朝已知的未来帧插值,对防止布局跑偏是很强的约束。谷歌报告称其在LVBench-C上把分钟级布局漂移降到最低,论文编号arXiv 2605.06924。
第四个组件VQQA是视频质量问答。它用一个视觉语言模型对生成的片段提问并作答,再把这份点评转换成语义梯度,用来修改下一轮的提示词。由于它只接触输入与输出,因此可以作用于闭源视频模型。此外还有一个全局选择步骤,评估整条优化轨迹,而不是默认接受最后一次迭代的结果。该论文编号arXiv 2603.12310,在T2V-CompBench与VBench2上做了验证。
这套框架最值得注意的地方,是它对工程实践的友好度。四个组件都不要求访问模型权重或内部注意力,因此可以套在只提供接口的视频模型之上,用规划、记忆、分段与批评这四层外挂,去换取长视频的一致性。对没有自研视频模型、但有大量素材与场景需求的团队来说,这条路径的进入门槛明显更低。
当然,四个组件叠加也意味着调用次数与算力开销的上升。规划要试错,记忆要维护,批评要跑视觉语言模型,每一层都在消耗预算。这套方法是否划算,取决于目标场景对一致性的要求有多高:短片与广告可以用更轻的方案,而几分钟以上的叙事内容,一次性重做的成本往往高于前置的多轮规划。四篇论文的编号与会议归属均已公开,需要复现的团队可以按图索骥。