亮源新创发布Light-O1,用10万小时人类视频教机器人全身动作

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

训练机器人动作的常规做法是让人类穿上动捕设备示范一遍,或者用遥操作设备把动作录下来。这套流程成本高、周期长,换一种任务还得重新设计采集方案。9月21日,亮源新创发布全身智能基础模型Light-O1,试图把预训练的数据来源换成互联网上已有的人类视频。

机器人动作数据的老问题

具身智能的数据瓶颈比语言模型更难绕开。语言数据在互联网上取之不尽,动作数据却必须由真实设备在真实环境里采集。工业机械臂输出的是关节角度,末端执行器记录的是空间坐标,人类示范则连坐标都没有,同一条指令装在不同结构的本体上,相机里呈现的轨迹完全不同。数据无法直接汇总,训练就难以规模化。

行业最近两年出现了一批具身数据采集中心,据公开统计,两年内国内已出现106个此类中心,其中84个进入运营状态,真机数据的价格大致在每小时500到1000元。这个价格水平说明数据仍然是稀缺资源,靠采购堆规模的路径成本极高。数据规模决定模型上限,这一点在语言模型上已被反复验证,在动作模型上却长期无法成立,因为缺少足够大的公开动作数据集。

Light-O1的思路是绕开这部分成本。它把互联网视频中的人类行为整理成统一的多模态动作数据,通过大规模预训练形成在什么情境下、如何行动的动作先验,再利用目标机器人的数据完成适配。人类视频覆盖的场景远比实验室采集丰富,代价是缺少精确的三维标注,需要用模型把二维观察还原为可执行的动作表示。

10万动作小时,与一条幂律曲线

官方披露,Light-O1把基于视频的人类动作预训练规模拓展到10万动作小时。这个量级放在具身领域相当可观,因为绝大多数动作模型的训练数据仍以千小时计。

更值得关注的是数据规模与效果之间的关系。结果显示,随着预训练数据规模扩大,模型在目标领域适配后的动作预测损失呈幂律下降趋势,离线开环评估中的全身姿态误差也同步降低。幂律关系意味着收益不会很快耗尽,继续扩大数据规模仍有回报,这是判断一条技术路线能否长期投入的关键依据。

这项规律被命名为人类全身动作预训练的跨本体迁移扩展规律,也是这次发布首次验证的内容。它的实际含义是:在人类视频上学到的动作知识可以跨越本体差异迁移到机器人动作预测上,不必为每一种机器人结构从零开始训练。对行业来说,这提供了一个可复用的人类数据来源,而不只是多了一个模型。

预训练之后还需要适配环节。模型用目标机器人的数据做对齐,把通用的动作先验收敛到具体本体的运动学约束上。这条两段式路径与语言模型先预训练再微调的范式一致,区别在于对齐阶段的数据采集成本更高,因此预训练阶段能提供多少有效先验,直接决定后续投入的规模。

自研机器人上的连续执行

能力展示部分给出了具体场景。搭载Light-O1的自研小型人形机器人LightBot可以自主完成递毛巾、打开鞋柜归置拖鞋、捡垃圾等任务,把行动决策、移动导航与全身操作连接成连续的执行过程,并在执行失败或受到外界干扰时调整行动、自主重试。

这些任务看起来简单,难度在于它们都要求全身协调。递毛巾需要走到人面前、调整站姿、伸出手臂并把物体稳定交出去;归置拖鞋需要打开柜门、弯腰、放置再关门,涉及下肢平衡与上肢操作的配合。只做桌面操作的动作模型无法处理这类任务,因为它们缺少移动与姿态调整的部分。

面对自然语言指令时,模型会结合情境理解需求,推理出完成目标所需的身体姿态、动作顺序与约束,再生成全身动作。从理解需求到生成行动的完整链条,是这次发布强调的另一条能力线。亮源新创同时在官网开源了通用动作生成模型Light-O1-Preview,供外部体验这一过程。

据官方表述,Light-O1的发布意味着其规模化预训练、规模化对齐、规模化部署三段范式的技术成果均已落位,形成从基础模型预训练、能力对齐到真实世界部署的完整链路。三段范式的提法本身说明团队把具身智能看作一条需要端到端打通的工程路径,而不只是模型能力的比拼。

世界模型赛道的另一条分岔

把Light-O1放到当前的世界模型与具身智能图谱里,可以看到明显的路线分化。一条路线以物理仿真为核心,把重力、几何与外观建模为原生状态,用生成的场景训练机器人的空间理解,典型代表是用统一动作表示降低跨本体误差的研究。另一条路线以视频生成为核心,预测未来帧,再从中反推动作。

Light-O1属于第三条:以人类动作视频为原料,直接学习可执行的动作表示,把视频当作动作知识的载体而非渲染目标。这条路线的优势是数据来源广泛、与真实人类行为分布接近;挑战在于视频缺少精确的物理标注,模型学到的可能是视觉上的相似而非物理上的正确。

行业同时也在补另一块短板。有分析指出,主流开源机器人数据集中,30赫兹的视觉数据占绝对主导,力觉与触觉等物理交互数据占比不足1%。这意味着当前的能力很大程度建立在看的基础上,缺少触觉反馈的数据飞轮,在精密插拔、柔性操作这类任务上仍存在天花板。Light-O1解决的是数据来源的规模问题,触觉数据的问题仍待另一条路径来补。

素材来源:澎湃新闻、凤凰网科技、环球网科技、FutureX Physical AI Daily 发布时间:2026-09-23