9月15日,武汉人工智能研究院推出并开源新一代面向物理世界的通用多模态大模型ZDTaichu5.0-9B。这个模型参数量约90亿,能同时处理文字、单图、多图、长视频和任意分辨率画面,重点解决真实场景中的空间感知、换视角后的方位判断和机器人任务规划难题。在九大国际空间理解测试中,它拿下8项同参数组第一。
这一定位切中了当前多模态模型的一块短板。过去两年大模型的视觉能力主要集中在识别与描述:这是什么物体、图上写了什么字、这张照片里发生了什么。但机器人要干活,需要的不是描述,而是判断:物体在空间中的哪个位置,换一个视角之后它还在不在原处,从当前位置伸手过去会不会撞到别的东西。这类空间理解能力一直是通用多模态模型的弱项。
从评测结果看,ZDTaichu5.0-9B在100亿参数以内的通用多模态模型中能力领先,在复杂三维推演、跨视角测试等领域优势显著。更值得注意的是官方强调的另一半结论:空间能力大幅提升的同时,图文理解、文字识别、视觉数学、代码工具调用等通用能力仍处第一梯队。这一点很关键,因为专门做空间理解的模型并不罕见,难的是在补上空间能力之后不把其他能力换掉。
更值得关注的是评测口径的变化。官方强调空间能力提升的同时通用能力没有掉队,这背后是一种取舍:模型做小做专很容易在通用语言与推理上退步,而具身场景恰恰需要模型既理解空间关系又听懂复杂指令。90亿参数要在两者之间取得平衡,靠的不是单纯压缩,而是训练数据中空间任务与语言任务的比例设计。
参数规模的选择也透露了策略。90亿参数属于可以在单机部署的量级,与动辄千亿参数的通用模型相比更适合放进机器人本体或边缘设备。对具身智能场景来说,模型能不能跑在机器人身上,往往比它在榜单上高几分更实际,因为感知与决策一旦依赖云端往返,响应延迟和网络可靠性都会成为瓶颈。
该模型通过原生内置的自适应循环推理机制来控制成本。它的行为逻辑是会看题下菜:遇到简单问题少算,遇到空间变换、物体关系判断这类难题,就在模型内部进行多轮推理,不依赖外部工具,也不会明显拉高Token推理成本。这种设计针对的是推理模型落地时最现实的矛盾,即深度思考能提升准确率,但每一步思考都要付算力和时间成本。
循环推理的代价是显存与延迟的波动。同一批请求里,简单任务可能一轮结束,复杂任务要在内部反复迭代,调度做不好,长尾请求会拖慢整条队列。这也是自适应机制通常要配合推理框架优化一起发布的原因。对打算把模型塞进机器人本体的团队来说,峰值显存比平均显存更值得关心,因为它决定了硬件的最低配置。
把推理深度与问题难度挂钩,本质上是让模型自己决定想多久。对机器人任务规划这类场景,这一点尤其重要:抓取一个静止物体和判断一堆杂乱物体里能不能抽出目标物,难度差了几个量级,如果都按最长链路推理,整体效率会被拖垮;如果都按最短链路,复杂任务又容易失败。自适应机制让同一套模型能覆盖两种工况,而不必维护多个不同规模的版本。
官方披露的落地场景集中在两块。科研场景中,模型已跑通从仿真计算到实验的闭环,能够完成试管按序入架、滴管液体转移等操作;智能制造场景中,它可以根据工单规划跨工位配送、机台上料等任务,也能直接输出设备控制指令。这两类场景的共同点是任务链条长、空间约束多,且对错误的容忍度低。
从仿真到实验台的路径,考验的是数据闭环能否转起来。仿真数据量大、标注便宜、可以穷举边界情况,劣势是与真实物理存在系统性偏差,摩擦系数、材质形变、传感器噪声都难以完全还原;真实实验数据恰好相反,稀缺但可信。用仿真做预训练、用真机数据做后训练是较常见的做法,而公开整套数据生产流程,等于把这个配方也一并交了出去。
与模型一同开放的还有整套数据生产流程。企业与科研机构可以用自己的仿真、工业、实验数据继续训练,这意味着行业用户不必从零构建数据管线。对制造与科研这类数据高度私有化的领域,能不能用自己的数据把模型调成本行业的专家,往往决定了项目能不能真正落地。模型已在北京、佛山、青岛等多地具身智能训练场落地,团队表示后续将继续优化从仿真到现实的迁移。
把大模型从数字世界推向物理世界,最大的不确定性在仿真与现实的落差。仿真环境里的光照、摩擦、材质形变都经过简化,模型在仿真中学会的策略搬到真实设备上常常失效,这也是具身智能领域长期存在的迁移难题。紫东太初把优化仿真到现实迁移明确列为下一步工作,说明当前的落地仍处在训练场验证阶段,而不是产线大规模部署阶段。
从更大的格局看,物理世界模型正在成为一条独立的竞争赛道。海外有谷歌、英伟达在仿真与世界模型上持续投入,国内则有多个团队从不同角度切入。紫东太初这次选择开源并开放数据生产流程,走的是一条以生态换迭代速度的路线,让行业用户把真实场景的数据反哺回来。这条路线能不能跑通,取决于有多少企业愿意把自己的工业数据交出来参与共建,而这往往比技术本身更难解决。