9月下旬,生数科技与360移动产品中心合作的《甄嬛360传粉丝见面会》互动页面上线。用户进入页面后可以选择甄嬛、皇上、华妃、沈眉庄等《甄嬛传》十大经典角色,输入文字后角色会即时回应,也可以要求角色拿起指定道具。换装与换景功能仍在接入测试。这套方案背后是生数科技的Vidu S2实时交互与实时编辑模型,此前一代产品已经让这批角色在网页端实现了对话,这次把画面本身也交给了用户输入来驱动。
上一代方案解决的是让角色开口。角色能听懂输入并给出符合人设的回应,但画面表现相对固定:穿什么、站在哪里、手里有没有东西,都是预设好的。这种方案在演示层面足够新鲜,但用户很快就会摸到边界,因为对话内容可以自由延展,视觉呈现却不能跟着变化,互动感会迅速衰减。
把实时编辑接进来之后,变化是结构性的。用户可以要求角色从宫殿切换到御花园,场景与人物光照需要重新匹配;可以让角色拿起佩剑或茶盏,手部与道具的动作要连贯自然;可以切换预设造型,配饰与整体风格要同步更新。这些能力叠加起来,意味着画面不再是预先渲染好的视频片段,而是随对话实时生成的结果。
官方把Vidu S2拆成两个方向:面向持续交互数字角色的生成模型,以及面向输入视频流实时编辑的模型。前者负责让角色持续回应并保持人设,后者负责在正在播放的画面上做修改,包括风格迁移、虚拟试衣、角色替换与背景替换。这次H5展示的主要是前者的持物等基础能力,后者的换装与换景仍在测试中,这也是官方明确标注的当前边界。
在IP互动场景里,稳定性是比画质更硬的指标。官方材料提到,单次有效互动时长从上一代的一分钟拓展到两小时,全程输出质量无明显衰减。这个数字的意义在于它决定了这类方案能不能真正投入使用:如果互动只能维持一分钟,那它只能做营销噱头;如果能维持两小时,它就有机会进入需要长时间陪聊、陪练或值守的场景。
长会话的难点在于误差累积。实时生成系统每一帧都基于前序状态继续推演,小的偏差会不断叠加,表现为角色形象逐渐漂移、动作开始断裂、音画不同步。要抑制这种累积,需要在训练方法上做针对性设计,让模型学会在长序列里维持身份与状态的一致,而不是只优化单帧质量。行业里通常用专门的训练策略来处理这类问题。
另一个被低估的指标是角色人设的稳定性。长时多轮对话里,角色很容易聊着聊着就跑偏,语气、身份逻辑与行为逻辑开始漂移。要让角色始终维持在同一个人设里,除了模型能力,还需要知识库与提示管理的配合。官方提到支持自定义形象、音色与人设,并配有知识库功能,这实际上是把IP方的内容资产变成了可配置项,让角色在长对话里始终有据可依。
传统影视IP的生命周期是衰减的:剧集播完,热度靠重播、翻拍、周边与授权维持,用户始终是内容的接收方。可实时驱动的数字人角色改变了这个结构,用户从观看者变成参与者,每一次对话都会生成一条只属于这个用户的支线。这些个性化内容自带二次传播属性,用户会主动截图录屏分享,形成从IP引流到互动产出再到社交扩散的循环。
对IP方而言,这意味着资产形态的变化。过去最核心的资产是剧集本身与角色形象,现在多了一项:角色的可交互版本。品牌需要维护的不再只是固定素材,还包括角色设定、语气规范与知识内容,这些内容的质量直接决定互动体验的下限。同时,用户在互动中产生的对话与情节也变成了新的内容供给,可以反向用于运营。
选择《甄嬛传》作为首个大规模落地案例也有讲究。这批角色认知度极高,观众对形象、语气与关系细节非常熟悉,任何偏差都会被立刻察觉。这相当于一次公开的稳定性测试:如果模型能在最挑剔的观众面前维持角色一致性,那么把这套方案迁移到认知度较低的新IP上,难度只会更低。
从一场H5跑通到能力大规模进入企业,中间还有几道明显的坎。第一道是成本。实时交互的时间越长,算力支出越高,而用户规模上去之后,响应能否保持稳定同样需要验证。这类方案在演示阶段通常由厂商承担算力,一旦转为常态运营,成本结构会成为合作方最关心的问题,按调用计费的接入模式能否覆盖实际消耗,是商业化的前提。
第二道是内容安全。实时生成意味着系统在边运行边输出,数字人一旦说出不当内容,会立刻变成品牌风险。传统预录内容可以逐帧审核,实时内容只能依靠运行时的护栏机制,包括话题限制、敏感词拦截与人工介入通道。官方提到模型支持百余种语言及方言,这进一步放大了审核难度,因为多语言场景下的风险表达方式更加隐蔽。
第三道是授权边界。涉及影视角色时,形象、声音与剧情的商用范围需要提前写清楚,否则项目很难长期运营。此前围绕AI生成内容与真人肖像的纠纷已经说明,这类问题一旦出现,处理成本远高于事先约定的成本。生数科技表示这类能力也可复用到游戏文娱、品牌直播、线下文旅与企业培训等场景,但每个场景的授权链条不同,能否形成标准化的合规模板,决定了它能跑多快。
从公开的体验记录看,当前版本的能力边界相当明确。基础互动已经上线,用户可以要求角色拿取指定道具,角色会一边回应一边完成动作,整个过程是实时生成而非调用预录片段。但换装与换景仍在接入测试,尚未对全部用户开放。此外,复杂动作的执行能力有限,上传物品的互动只能完成简单操作,也不支持多个数字人在同一场景内互动。
延迟是另一个被提及的问题。实时生成依赖连续推理,网络状况与并发规模都会影响响应速度,体验者反映偶尔会出现延迟。这类问题在大规模公域活动里会被放大,因为用户量在短时间内集中涌入,而每个会话都在持续占用算力。官方把这类能力分为两个方向,一个负责角色持续交互,一个负责画面实时编辑,后者对算力的要求更高,这也是它排在测试队列后面的原因之一。