9月21日,理想汽车Foundation Model团队发布世界动作触觉模型ME-Dex-1.0,同步公开技术报告与代码仓库。这款模型最核心的改变是重新定义了触觉在机器人操作中的位置:它不再只是当前的条件输入,而是与视频一样,被当作需要预测的未来世界状态。模型在生成下一帧画面的同时,同步预测对应的触觉分布,让机器人有机会在执行动作之前预判即将发生的接触。
传统机器人控制里,触觉通常扮演事后反馈的角色:碰到了、感受到了、再调整。这种被动模式在精细操作任务中天然存在延迟瓶颈,因为从接触发生到策略调整需要时间,而很多装配动作的容错窗口极短。
ME-Dex-1.0的思路是把触觉升级为预测对象。给定任务指令、当前图像、本体状态和触觉观测,模型会联合去噪三件事:未来的视频隐变量、未来的触觉隐变量,以及动作序列。三者被放在同一个生成过程中处理,而不是先预测画面再附加触觉条件。官方认为,触觉信号与视频一样提供了对演化中世界状态的观测,因此应当被建模为未来观测,而不是辅助条件。
这一改动的实际意义可以用一个场景说明:摄像头看不清插头到底插进去没有,这类判断必须依赖力的反馈。如果模型能在动作执行前预测接触位置与受力模式,就可以提前调整姿态与力度,而不是等到失败后再重试。从碰到再反应到还没碰就预判,是操作智能的一次质变。
把触觉变成预测目标,也改变了数据采集的目的。过去采集触觉数据是为了标注动作结果,用于事后评估策略的好坏;现在这些数据要参与训练模型对未来接触状态的想象,采集时就必须关注力的大小、方向与作用位置这些更细的维度,而不是只记录一次接触是否发生。
架构上,ME-Dex-1.0采用混合变换器结构,包含视频专家、触觉专家与动作专家三个分支,全部用流匹配方式训练。三个专家在中间层通过共享注意力连接,官方称之为跨模态桥接机制,使动作生成能够调用视觉与触觉动力学学到的表示。相比简单地把不同模态特征拼接在一起,这种设计保留了各模态的内部结构,同时让信息在中间层充分交互。
触觉数据的异构性是这个方向长期难以推进的原因之一。视触觉传感器、力矩传感器、压力阵列输出的格式与语义完全不同,直接混在一起训练会引入噪声。ME-Dex-1.0的解法是把异构触觉数据映射到双手34区域的标准手模板上,为不同来源、不同模态的信号建立统一的坐标系,再用统一触觉自编码器压缩成共享的潜在表示。这一层归一化让跨本体的联合训练成为可能。
数据不足的问题用工程手段补足。团队构建了自主式触觉数据引擎,在仿真环境中回放轨迹时直接从力传感器记录触觉数据,为RoboTwin与DexJoCo两个仿真平台补充配对的三模态数据。这类数据生产平台的价值在于可扩展性:真实机器人采集配对数据成本高、速度慢,而仿真回放可以在不增加硬件的前提下成倍扩充训练集。
在多组基准上,模型的提升幅度较为明显。在RoboTwin的50个任务上,Clean与Random两种设置下的成功率分别为91.56%与91.92%,对照方案Fast-WAM为89.22%与89.22%。在RoboTwin的Clean-only平均指标上,成功率为78.9%,领先最强对比基线7.6个百分点。在DexJoCo的11项联合训练任务上,总体成功率为65.3%,比DECO高8.9个百分点。在ManiFeel平台上,平均成功率为70.0%,比官方基线高15.0个百分点,其中电源插头插入任务的成功率从58.0%跃升到88.0%。
消融实验更清楚地说明了每个模块的贡献。在Random设置下,只建模视频与动作的基线成功率为86.90%;加入当前触觉观测后升到89.54%;把触觉改为需要预测的未来状态后升到90.60%;再接入跨模态桥接机制后达到91.92%。每一步的提升都对应一个明确的设计选择,而不是靠堆参数换来的。
团队也公开了一个反例。在齿轮装配任务上,模型性能出现下降。他们的解释是,在部分高刚性、低触觉反馈的场景中,过度依赖触觉信号反而会引入噪声。这种坦诚对评估这类方法很有价值,它说明触觉并非在所有操作任务中都是有效信息,模型需要学会判断何时使用触觉。
这次发布并非单一报告。理想同期公开了四份技术文档与配套仓库,除ME-Dex-1.0之外,还包括处理记忆与行动协作的ME-Brain-1.0、作为认知内核并同时提供可端侧部署版本的ME-VLM,以及把任务理解、未来预测与动作生成放进统一模型的ME-U0。这组报告合起来,展示的是从感知、认知到执行的一套完整设计,而触觉模型是其中最贴近物理交互的一环。
端侧部署的效率数据也值得记录。官方称配合自研芯片、词元压缩与低比特量化,参与后续计算的词元数量从4096降到3328,预填充时延从400毫秒降到188毫秒,约实现2.13倍加速。这类优化决定了模型能否装进机器人本体的计算单元,而不是必须依赖云端推理。
把这套工作放进行业图景,可以看出世界模型的竞争重心正在从画面质量转向物理理解。过去一年,视频生成模型让机器学会预测下一帧会发生什么;而现在的问题变成,模型能否同时预测接触、力与形变,并把这些预测转化为可靠的动作。对量产而言,这意味着机器人在精密装配、柔性操作等工业场景中的可靠性会显著提升。对理想自身而言,这是从自动驾驶向具身智能延伸的一步,触觉世界模型成熟后,也可能反哺自动驾驶中的精细交互场景。需要观察的是,这套方法在真实产线与长周期运行中的稳定性,以及跨本体迁移时能否保持同样的提升幅度。