HeyGen宣布开源一套用于构建实时AI体验的框架,这套框架由HeyGen与OpenAI共同开发。它把三部分组合在一起:OpenAI的GPT-Live-1全双工语音模型、HeyGen的LiveAvatar实时虚拟形象技术,以及HyperFrames实时界面生成能力。官方同时放出演示视频,并邀请开发者在框架之上构建自己的应用。其中最具突破性的部分是GPT-Live-1:它是一个能同时听与说的单一模型,不再依赖语音转文字、大语言模型、文字转语音这样的三段式链路。这种端到端架构有望大幅降低延迟,让语音对话更接近真人交流的节奏。
传统语音助手的处理链路分三步:先把用户的语音转成文字,把文字交给语言模型生成回复,再把回复文字转成语音播出去。三段串行带来两个问题,一是延迟累加,每一步都要等待上一步完成,用户说完话之后往往要停顿一到两秒才听到回应;二是信息损失,语气、停顿、情绪与背景音在转成文字时就丢掉了,模型只能根据文本内容判断,无法感知对方是不是在犹豫、是不是被打断了。对需要长时间对话的场景而言,这种信息损失会不断累积,最终表现为对话越来越像在念稿子。
全双工模型的思路是让同一个模型直接处理语音输入并输出语音,中间不经过文本中转。它能够同时聆听与说话,因此可以在用户插话时及时停止输出,也能在对方停顿时判断这是说完还是思考中的停顿。这些在人类对话里自然而然的行为,恰恰是过去语音助手最容易被感知为机械的地方。对数字人应用而言,交互的自然度直接决定用户愿不愿意继续对话,而打断处理与停顿判断正是自然度的核心,这也是这项能力被放在发布首位的理由。
LiveAvatar负责形象层。数字人需要在对话过程中实时生成口型、表情与头部动作,并且与语音保持同步。传统做法是先合成音频再驱动口型,链路长且容易出现音画错位;当语音本身是流式生成的,形象驱动也必须变成流式,才能让口型跟着声音走。HeyGen把LiveAvatar放进这套框架,等于把形象驱动从后处理环节提前到了与语音生成并行的位置,这是实时数字人能否做到自然的关键工程约束。
HyperFrames负责界面层,它可以实时生成与对话内容相关的界面元素。官方演示的场景是一个实时扑克教练:卡牌与界面随对话实时生成,语音模型充当大脑负责讲解,虚拟形象完成整体呈现。这个演示说明数字人正在从会说话的头像变成能操作内容的交互主体。当形象、语音与界面三者能够实时协同,数字人的适用场景就从单向播报扩展到教学、陪练、导购与客服这类需要来回互动的任务,价值密度明显提高。
官方给出的对比数据是,GPT-Live-1在交互性测试中得分80.1%,上一代语音模型GPT-Realtime-2.1为45.4%,提升接近35个百分点。这个幅度不是靠单点优化能实现的,而是架构变化带来的台阶式改进。端到端模型省掉了两段转换,每段转换都要等待前一步输出完整结果,串行结构下延迟无法被并行计算掩盖,这是过去语音助手响应迟钝的结构性原因。把链路从三段压到一段,等于把原本串联的三次等待合并成一次流式处理,延迟改善的来源就在这里。
落地案例提供了更直观的参照。语言学习平台Speak接入后,语音交互中的误打断次数减少了近80%。误打断是语音助手最影响体验的缺陷之一,用户还在思考或换气时被系统抢话,对话节奏就断了。误打断率大幅下降说明模型对语音端点与语义完整度的判断更准,能够区分暂时停顿与说完。这类改善很难从跑分上看出来,却直接决定用户是否愿意长时间使用,也解释了为什么语音交互的竞争焦点正从识别准确率转向对话流畅度。
定价是这套方案能否规模化的现实约束。GPT-Live-1的前端服务定价为每分钟0.05美元,换算下来一小时约3美元。单看单价不高,但实时语音的成本与使用时长为线性关系,而数字人应用往往需要长时间在线。一个每天运行10小时的数字人客服,单是语音接口的费用每月就接近900美元,再叠加形象渲染、界面生成与业务系统调用的成本,整体开销会显著高于传统文本客服。这种成本结构决定了实时数字人更适合高价值场景,而不是无限量铺开。
场景边界因此比较清晰。直播带货、在线教学、语言陪练、高客单价产品的售前咨询,这些场景对交互自然度敏感,也愿意为体验付费;标准化问答、批量通知、简单查询,用文本或预录音频就能解决,没有必要付出实时交互的溢价。开源框架的意义在于让更多团队以低成本验证场景价值,先跑通一个高价值用例,再决定是否扩展到更多环节。当延迟、自然度与成本三个变量同时改善,数字人从演示走向日常业务的临界点就会真正到来。