生数科技9月15日发布Vidu S2视频大模型系列,距离上一代Vidu S1只隔了69天,包含面向数字角色实时交互的S2-Avatar与面向视频流实时编辑的S2-Editing两款模型,发布当天即开放体验。官方把这次更新定义为从生成一段视频到与视频实时交互的跨越,并首次公开了面向VR头显的实时空间视频生成与编辑探索。对一个仍在快速迭代的赛道来说,两个月一次大版本、发布即开放体验,本身就是竞争节奏的直接体现。
S2-Editing要解决的问题是传统视频编辑的时延结构。过去改一段视频,流程是导出、编辑、再渲染,创作者与成片之间隔着一次完整的生成周期。S2-Editing把编辑动作放进正在播放的视频流里,支持风格迁移、虚拟试穿、人物替换与背景替换四类任务,画面跟随人物动作自然变化,不需要停下来重新生成整段素材。
这种边播边改的能力,把视频生产的交互方式从抽卡式改成了调试式。创作者可以在同一段运动里连续比较不同服装、不同背景与不同风格,判断标准也从单帧是否好看,转向整段运动过程中是否稳定、是否符合物理直觉。对广告与电商这类需要大量版本对比的场景,节省的不是渲染时间,而是反复重做整段素材的返工成本。
从创作流程看,这类能力改变的是版本管理的粒度。过去一段视频是一个不可分割的生成单元,改一处就要整体重来;实时编辑之后,视频更接近一份可以逐帧修改的工程文件,每次调整只影响被指定的属性。对需要多轮评审的商业项目来说,这种粒度差异直接决定返工次数,也决定创意人员在有限预算内能尝试多少种方案。
实时编辑最难的地方不在单帧质量,而在跨帧一致性。人物在走动时被替换服装,布料要跟着身体形变;背景被替换,光影与遮挡关系要随之更新;角色被替换,动作轨迹与身份特征要保持连续。任何一帧出现错位,观众都能立刻察觉,这也是过去同类功能多停留在静态图片上的原因。
官方披露的技术路径是帧对齐稀疏注意力,让模型在处理当前帧时能稳定地参考前后帧的关键信息,同时把注意力计算量控制在实时生成可承受的范围内。稀疏化带来效率,帧对齐带来一致性,两者共同支撑了运动轨迹不穿帮这一结果。对工程实现来说,这套机制的价值在于它把长时流式生成中最容易崩坏的部分提前约束住了。
工程上还有一层权衡值得注意:稀疏化本身会削弱模型对全局信息的把握,过度稀疏可能导致远景细节漂移,过于密集又无法维持实时帧率。因此帧对齐稀疏注意力的实际效果高度依赖训练时对稀疏模式的设计,这也是同类方案在不同团队手里表现差异很大的原因。官方称S2系列在多项指标上取得最优,但实时编辑的实际体验仍与硬件条件强相关。
生数在S2上还提出了名为Self-Replay Forcing的训练方法,用于抑制长时流式生成中的身份漂移与画面崩坏。流式生成的典型问题是误差累积:每一帧的微小偏差会被下一帧当成条件继续放大,几十秒后人物可能已经不是同一个人。这类漂移在短视频里不明显,一旦时长拉长或镜头切换频繁就会暴露。
这套训练思路的核心是让模型在训练阶段就面对自己生成的历史结果,而不是只面对干净的真实数据,从而学会在自身误差存在的前提下保持稳定。同时S2引入视觉语言模型作为视觉反馈环节,对生成结果做动作可靠性层面的判断。生成模型加反馈智能体的组合,正在成为视频生成提升可控性的通用配方。
这种生成模型加反馈智能体的组合,也改变了训练数据的组织方式。当模型能够在推理阶段获得关于动作合理性的外部判断,训练目标就可以从单纯拟合像素分布,转向优化可被验证的行为指标。代价是推理链路变长、端到端延迟上升,因此这类方案通常只在需要高可靠性的场景启用,基础的快速生成路径仍然保留。
同一系列中的S2-Avatar面向数字角色的实时交互,升级到720P、25至42帧的实时输出,支持随时追加参考图并保留此前的状态信息,用户上传一张图片就能通过语音让角色说话、跳舞,动态加入物品或更换背景。相比早期的语音驱动口型,这类交互的自由度已经从说什么扩展到做什么和周围是什么。
更靠前的一步是空间视频。官方表示S2正在探索面向VR头显的实时空间视频生成与编辑,可将编辑后的视频流式传输至头显。若这条链路成熟,内容消费的形态会从看一段视频变成进入一段可被实时修改的场景。当然,实时编辑对算力的要求极高,普通设备能否流畅运行,以及虚拟试穿与人物替换可能带来的伪造风险,都是这项能力走向普及前必须回答的问题。
从商业化角度看,实时编辑能力的客户首先出现在广告、电商与直播三类场景。它们共同的特征是素材量大、版本多、时效要求高,而深度伪造风险相对可控,因为内容主体通常是品牌自有形象。相比之下,人物替换与虚拟试穿在娱乐与社交场景的扩散速度会更快,风险也更集中,这也是厂商开放能力时需要区分场景、分档管理权限的现实原因。