视频创作正在告别先拍完再剪辑的线性流程。8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,用户在观看视频的同时,可实时修改人物形象、替换场景、调整画面风格。这相当于给视频装上了一块实时编辑面板,过去需要等待整段渲染才能看到效果的操作,如今在播放过程中就能完成。
过去,视频生成模型处理的是离线任务,用户输入指令后要等几十秒甚至几分钟才能看到结果,对细节不满意只能重新输入指令、重新等待,生成式人工智能中输出结果的随机性采样过程,被行业戏称为抽卡。JoyAI-Video-Edit试图打破这个流程,让视频创作从一次性抽卡变成可微调的橡皮泥,这也是视频模型竞争进入新赛段的标志性事件。
JoyAI-Video-Edit的核心突破在于支持任意时长的稳定流式编辑,视频可以持续播放,模型可以持续处理,不必等待整段生成完成。传统模式下,修改视频中的任何元素都需要整段重新渲染,时间成本和算力成本极高;而流式编辑让修改变得像操作橡皮泥一样灵活,哪里不满意改哪里,改动即时生效。
这种能力对创作流程的改造是结构性的。服装展示视频可以实时更换人物穿搭和背景,消费者下单前就能看到不同搭配的效果;家装设计可以一边播放一边切换家具、墙面和灯光效果,设计师和客户在同一个画面上实时沟通方案;影视创作者则可以更快尝试不同的人物造型、场景和视觉效果,减少重复拍摄与整段返工的成本。
更深远的意义在于创作心态的改变。离线生成模式下,创作者对每一次生成都抱有极高的期望值,因为一次失败就意味着重新等待;流式编辑模式下,生成只是起点,修改是常态,创作者可以从容地迭代打磨,把精力放在创意本身而不是等待渲染。这种从结果导向到过程导向的转变,是AI视频工具走向成熟的重要标志。
技术路径上,JoyAI-Video-Edit是一个160亿参数的自回归扩散框架,由多模态大语言模型条件编码器和多模态扩散Transformer组成。多模态大语言模型负责理解用户的修改指令和视频内容,扩散Transformer则负责在流式播放过程中持续生成和更新画面,两者的协同让模型既能听懂指令,又能实时执行。
与传统的先完整生成、再整体编辑的架构不同,JoyAI-Video-Edit把编辑能力内置到了生成过程中。模型在处理当前帧时,会同时考虑用户的编辑指令和历史视频内容,确保修改后的画面与前后帧保持连贯,不会出现跳变或闪烁。这种生成加编辑一体化的设计,是实时流式编辑能够成立的技术前提。
值得关注的是,京东选择了开源这条路径。开源意味着全球开发者可以下载模型权重、研究技术细节、基于自己的数据进行二次开发,这有助于JoyAI-Video-Edit快速积累生态。对于京东而言,开源视频编辑模型既能提升其在AI领域的技术声量,也能吸引更多开发者基于该模型开发应用,反哺电商、家装等核心业务场景。
京东把首个自研视频模型押注在编辑方向,与其电商基因密切相关。电商场景中,商品展示视频的改版需求极其高频,换季要换背景、促销要换文案、面向不同市场要出多语言版本,传统做法是重新拍摄或逐帧返工,成本高昂。JoyAI-Video-Edit的实时编辑能力,让运营人员可以在现有视频基础上快速产出多个版本,大幅压缩素材生产成本。
家装和房产是另一个高价值场景。家装设计视频通常需要展示不同风格、不同家具搭配的效果,过去一个方案要生成多个版本逐一渲染,现在可以在同一段视频上实时切换,客户现场就能看到改动效果。对于以效果图和短视频为主要获客手段的家装行业来说,这种能力直接关系到成交效率。
影视和广告行业则更看重流式编辑带来的创作自由度。分镜预演阶段,导演可以快速尝试不同的人物造型、场景氛围和运镜效果,不必每次重拍;广告制作中,品牌方可以实时调整产品卖点展示和文案呈现,缩短创意到成片的周期。当然,实时编辑模型的画面精度和复杂场景表现仍需在实际制作流程中检验,但从方向上看,它正在把AI视频从生成工具升级为创作生产力工具。
JoyAI-Video-Edit发布的同一天,字节跳动也推出了原生音视频全双工大模型SeedRealtime,主打边看边听边说;此前的7月31日,MiniMax发布新一代多模态生成模型H3,支持2K分辨率直出和音画协同。快手可灵、阿里通义万相、腾讯混元视频等模型近来也动作频频,视频模型赛道的竞争烈度正在急剧上升。
从竞争焦点看,行业已经走过比分辨率、比时长的阶段,进入比可控性、比编辑能力、比工作流适配的新赛段。谁能把生成结果真正嵌入真实制作流程,谁能在保证画质的同时提供精准的编辑控制,谁就有机会在下一轮竞争中占据主动。京东从编辑切入、字节从实时交互切入、MiniMax从多模态融合切入,各自押注了不同的方向。
对创作者而言,这种竞争是实实在在的利好。模型选择越来越多,价格越来越低,能力越来越可控,AI视频正在从尝鲜玩具变成生产力工具。而当编辑能力成为标配,视频模型竞争的下一个分水岭,将是谁能更好地理解创作意图、更稳定地执行复杂指令,那将是一场更考验底层模型能力的较量。