9月9日,2026京东全球科技探索者大会在国家会议中心开幕,京东宣布开源实时可交互世界模型JoyAI-Echo WM。现场演示中,观众以第一人称视角走进虚拟的京东亚洲一号仓屋顶,鸽子掠过、AGV小车转弯、金属托盘滑入分拣口的声响与画面实时同步,视角转动时光影自然过渡,窗玻璃上的雨痕随移动微微反光。这不是游戏引擎渲染,而是世界模型在持续生成可进入的虚拟世界。京东副总裁段楠用了一个形象的比喻,如果把大模型比作AI时代的操作系统,世界模型就是其中的DirectX,没有它,再强的CPU也画不出一帧真实的光影。
JoyAI-Echo WM的核心特性是打通画面生成与音视频同步。与传统的文生视频工具生成一段固定时长、放完即止的影像不同,Echo WM支持第一人称与第三人称视角切换和多轮交互,用户可以在生成的世界里自由移动,模型根据视角与移动持续生成新的画面,同时输出720P视频、环境音与语音,仓库里的机器轰鸣、人物对话都与画面实时匹配。场景中的物体具备一致的几何关系,绕着一栋建筑走一圈,它的结构不会漂移变形。
这种一致性来自模型对空间的理解而非简单的帧间补全。官方公布的评测数据显示,JoyAI-Echo WM在WBench导航评测中综合得分81.6,断层登顶,其中一致性指标达到89.8,此前领跑的竞品得分分别为72.3与75.1。换句话说,用户在虚拟场景里穿行数分钟,货架编号、灯光色温与场景细节都能保持毫秒级同步。对需要反复测试的机器人训练与数字孪生场景而言,这种稳定的空间一致性,正是从演示走向实用的前提。
京东给JoyAI-Echo WM规划的应用路径清晰指向物理世界。在物流场景,配送无人车可以先在世界模型构建的暴雨夜末端配送路线里试跑上千次再上岗;数字导购员能在虚拟3C卖场里边走边讲解,手指一点,货架翻转展示产品拆解结构;康复机器人则在数字孪生康复中心里陪患者完成海量抬手训练,零风险、零耗材、零等待。世界模型在这里扮演的不是炫技工具,而是让机器在虚拟环境里低成本积累经验的训练场。
支撑这条路径的是京东同步披露的三张牌。算力侧,京东云与合作伙伴打造国产万卡集群,并规划建设十万卡集群,为大规模模型训练与实时推理提供算力底座;数据侧,京东推进1000万小时人类具身数据采集行动,建成覆盖采集、存储、标注、训练、评测、仿真、测试全流程的具身数据基础设施,首批开源的第一视角数据集EgoLive已吸引超过8个国家、百所高校与科研机构申请使用;模型侧,京东已形成覆盖多模态、世界模型与具身模型的JoyAI基础模型矩阵。场景产生数据,数据训练模型,模型驱动终端,再通过任务反馈推动AI持续进化,京东把这条智能飞轮押在了供应链这个它最熟悉的试验场上。
京东入局世界模型,正值全球科技巨头集体押注这一赛道的窗口期。从OpenAI、谷歌到英伟达,世界模型被视为通往物理AI的关键基础设施,国内腾讯开源了混元3D世界模型,阿里推出实时交互世界模型产品,字节跳动也被曝由创始人亲自督战实时空间视频生成项目。据研究机构统计,今年前七个月中国一级市场与世界模型相关的概念累计涌入资金超过600亿元,近六成赛道公司获得融资,资本用真金白银表达了对世界模型将成为下一代AI增长核心变量的判断。
京东的差异化在于训练场的稀缺性。正如京东云总裁曹鹏所说,京东做AI是先量脚再做鞋,不是在论文里诞生,而是在上千个仓库与配送站里一单一单磨出来的。相比通用互联网数据,供应链场景天然提供高保真的物理交互数据,仓库的货物流动、分拣的动作序列、配送的路径规划,都是世界模型最缺乏的真实世界语料。当多数玩家还在为数据发愁时,京东把二十年供应链积累转化为数据护城河,再以开源姿态吸引开发者共建生态,这套打法能否在世界模型混战中跑出第二增长曲线,值得行业持续观察。
评测登顶不代表已经完美。世界模型距离物理AI的终极目标,仍有几道硬坎要跨。其一是长时间的一致性,模型在数分钟级别的连续交互中能否始终维持物体几何与物理规律不漂移,直接决定它能否被用于机器人训练与数字孪生;其二是可控性,生成内容既要符合用户指令,又要服从真实世界的力学规则,两者冲突时模型需要学会取舍;其三是成本,实时生成720P画面并同步音频的推理开销远高于普通文生视频,只有把单位成本压到可商用区间,世界模型才能从演示走向规模化部署。
京东的选择是把世界模型当作长期基础设施来养。开源Echo WM、开放EgoLive数据集与评测基准,意味着开发者可以基于真实仓库验证能力、反馈缺陷,而不是隔着网页围观演示;与具身模型的协同训练,则让机器人先在虚拟世界里试错、再把经验迁移到物理实体,数据飞轮的转速将决定京东在这条赛道上的后劲。正如业内所说,世界模型的竞争不是一场短跑,而是一场比拼数据、算力与场景耐心度的马拉松,谁能熬过技术成熟前的投入期,谁就能在物理AI时代拿到入场券。