亮源新创的Physical Al路线清晰了
过去一年,具身智能的技术迭代明显加快。VLA、世界模型持续演进,强化学习重新成为机器人学习的重要技术路径,Sim2Real加速从仿真走向真机,全身控制能力也在快速突破。
机器人会做的事情也越来越多:能走、能跑、能抓、能导航,甚至可以完成越来越复杂的长程任务。
但如果把这些能力放到真实世界里,一个更基础的问题正在浮现:
机器人“会做”一件事,和机器人能够在开放环境中长期、稳定、泛化地把事情做成,其实是两回事。
一个机器人能跨过固定高度的障碍,不意味着换一种障碍还能完成;能在一个房间里导航,不意味着换一个场景、换一种机器人本体仍然有效;正常状态下能稳定行走,也不意味着受到撞击、跌倒甚至关节损伤之后还能继续工作。
这也是为什么,随着具身智能从Demo走向真实世界,行业的评价标准正在发生变化。
如果说上一阶段关注的是机器人到底“会多少技能”,那么下一阶段更重要的问题是:这些能力能不能持续规模化扩展。
这里所说的Scaling,不只是模型参数量,也不只是机器人数据量,而是模型能否经历更多环境、覆盖更多任务、迁移到更多机器人本体,并在真正进入物理世界之后,继续适应那些训练阶段没有见过的状态。
过去一个多月,亮源新创连续发布了三项技术: LightParkour、LightNav-0和Light REACT 。
- LightParkour从简短的人类动作片段出发,通过物理仿真与课程学习扩展复杂接触技能;
- LightNav-0基于Real2Sim2Real数据引擎,将 2,000+个 互联网来源的真实场景转化为可反复使用的仿真环境,生成 4,000+小时 视觉、语言和动作经验,并用于通用导航后训练;
- Light REACT则面向外力扰动、跌倒和硬件损伤条件下的全身韧性控制,研究机器人如何依据自身交互历史调整运动方式。
看起来,这是跑酷、导航和全身控制三个不同方向。
但把三项技术放在一起,会发现亮源新创实际上一直在回答同一个问题:如何让Physical AI从单点能力,逐步形成可以规模化训练、规模化对齐和规模化部署的基础模型体系。
三项技术方向不同,但都在围绕亮源新创“三段范式”所指向的核心问题展开:如何让Physical AI的能力持续规模化扩展,并最终形成 从训练、对齐到真实部署的学习闭环 。
具身智能真正要解决的,是能力如何持续规模化扩展
过去的机器人研发,大量建立在任务分解之上。导航解决导航,运动控制解决运动控制,机械臂操作解决机械臂操作。任务和环境越明确,工程系统往往越容易针对性优化。
这套方法并没有问题。工业机器人能够在高度结构化的环境中稳定工作,本身已经证明了它的价值。
但通用机器人面对的是另一种问题。现实世界不是一个固定Benchmark,环境会变,任务会变,机器人本体会变,甚至机器人自己的身体状态也会变。
如果每增加一个任务就重新训练一个模型,每换一个机器人就重新适配一次,每出现一种异常状态就重新设计一套控制规则,那么系统能力虽然在增加,开发和部署成本也会同步增长。
最终,能力没有真正实现规模化扩展,工程复杂度反而先增长起来。这也是基础模型给机器人行业带来的真正启发。
大语言模型的重要意义,并不只是把某一个NLP任务做得更好,而是通过统一模型、统一表示和规模化训练,让越来越多能力进入同一个模型体系。
如果Physical AI也要沿着类似方向发展,那么需要解决的核心问题,同样不是不断增加孤立技能,而是 建立一套可以持续扩展能力边界的学习机制 。
亮源新创将这套机制概括为三个阶段: 规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)和规模化部署(Scalable Deployment) 。
规模化预训练通过大规模数据训练建立基础能力;规模化对齐通过强化学习等方式进一步提升模型能力;规模化部署则推动基础模型进入真实世界,并持续产生高质量真实世界数据,形成驱动模型持续优化的数据飞轮。
三个阶段并非彼此割裂,而是共同构成一个持续迭代的学习闭环。亮源新创过去一个多月连续发布的三项技术,则从不同方向展现了他们围绕这套技术路径展开的研发进展。
LightParkour:先解决一个动作如何变成一类能力
先从LightParkour开始。跑酷是全身运动学习中涉及复杂接触的典型任务之一。普通行走主要依赖双腿和地面形成支撑,但当机器人需要攀爬、撑越或跨越较高障碍物时,环境本身会成为身体支撑的一部分。
手应该在哪里接触,什么时候承重,身体重心如何移动,障碍物高度变化之后动作如何跟着变化,这些都会直接决定任务能否完成。
传统动作模仿在这里会遇到一个明显问题:动作视频记录了“人怎么动”,却没有完整记录“这个动作为什么在这个环境里成立”。
如果直接通过动作重定向(Motion Retargeting)将人类动作映射到机器人本体上,可能出现手掌悬空、身体穿过障碍物,甚至整个轨迹超出机器人动力学能力的问题。
另一种办法是针对每一种障碍重新采集动作。但这样一来,数据成本会随着技能、地形和接触方式线性增长。
LightParkour选择的方式是: 只给机器人一个起点,然后让技能自己生长 。
具体来说,LightParkour首先从真实人类动作中恢复一段简短的动作种子,再把动作和对应的障碍物一起放入物理仿真。仿真负责重新建立动作、障碍物、接触力和机器人执行器约束之间的关系。机器人成功完成当前动作之后,系统继续提高障碍物难度,并把成功轨迹作为下一轮训练的参考。
于是,从一段针对 45厘米 障碍物的初始动作出发,可以逐步生成覆盖至 75厘米 障碍的参考轨迹,对应90厘米高的Lightbot 0约83%的身高。
整个扩展过程中,只有最初的动作和障碍物需要人工对齐,之后的能力增长主要由物理仿真和课程学习完成。
这件事真正重要的地方,不是机器人跨得更高了,而是一个动作样本开始变成一个技能分布。
过去需要针对不同障碍重新采集示范,现在模型开始利用物理世界本身的规律,自动生成新的有效经验。
这已经出现了基础模型实现Scaling的一个关键特征: 能力不再和人工数据一一绑定 。
会很多动作还不够,要把它们放进同一个模型
技能扩展之后,第二个问题随之出现。
如果行走是一个模型,攀爬是一个模型,快速撑越又是一个模型,那么技能数量增加之后,机器人仍然需要一个上层系统决定什么时候调用哪个模型。
LightParkour进一步使用多专家蒸馏,把行走和三项复杂接触技能整合到一个统一策略中。
更关键的是,技能切换本身也不再依赖人工规则。系统进一步对不同技能之间的切换进行训练,让机器人自主学习什么时候保持行走、什么时候进入全身动作,以及什么时候重新回到普通运动。
部署时,不需要外部提供技能标签,也没有人工编写的状态机负责切换。
最终,LightParkour在Lightbot 0上运行的是一个统一的循环深度视觉策略。模型只使用胸前深度相机、本体感知和速度指令,以50 Hz在机载计算平台上运行,不需要运行时参考轨迹、外部运动捕捉或机外状态估计。
这让LightParkour的意义从“人形机器人会跑酷”,进一步变成:机器人能不能把多个孤立技能压缩成一个统一模型,并根据当前环境自主决定什么时候使用什么能力。
LightParkour展示了亮源新创在感知驱动的全身运动、多技能统一策略和真机迁移方向上的阶段性进展。
但仅仅解决身体如何运动,还远远不够。机器人真正进入开放世界之前,还必须知道自己在哪里、目标在哪里,以及接下来应该往哪里走。
LightNav-0:让具身模型经历足够大的世界
导航 是机器人进入真实世界之后绕不开的一项基础能力。
但通用导航与传统导航之间存在一个非常大的区别。传统系统可以提前建图,可以依赖定位,可以针对摄像头和机器人本体进行标定。
但一个真正面向基础模型的导航系统,需要面对不同环境、不同任务、不同视角甚至不同机器人本体。
换句话说,它不能只“记住怎么走”,而要形成可以迁移的空间智能。
这首先是一个 数据问题 。语言模型拥有互联网级文本数据,但机器人没有天然存在的“机器人互联网”。如果所有导航经验都依靠真机遥操作采集,那么每增加一个环境、一个机器人本体,都意味着新的数据成本。
LightNav-0的做法,是 把互联网中的真实世界,转化成机器人可以反复经历的训练世界 。
通过Real2Sim2Real数据引擎,亮源新创将 2,000+个 互联网来源的真实场景转换为可复用仿真环境,形成 4,000+小时 视觉、语言和动作后训练经验。
同一个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,从而避免模型只适应某一种固定机器人视角。
这里有一个值得关注的实验结果。LightNav-0发现,在当前实验范围内, 扩大环境覆盖度 ,比单纯增加相同环境里的轨迹数量更能稳定提升泛化能力。
这意味着,Physical AI的数据Scaling可能和大语言模型有所不同。机器人不仅需要更多数据,更需要在更多样化的环境中积累经验。
导航不是识别目标,而是理解空间之后产生动作
数据规模解决的是“见过多少世界”,但导航还有第二个问题:如何把视觉和语言理解真正变成行动。
例如,机器人接到“走到沙发右边”的指令,理解“沙发”并不困难。真正困难的是,它还需要判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来应该生成怎样的运动轨迹。
LightNav-0因此引入 Point CoT 。模型首先在图像空间预测目标点和可通行点,再生成后续动作token。推理过程因此从“视觉+语言直接生成动作”,变成“视觉语言理解→空间推理→动作生成”。在公开的8项消融评测中,引入Point CoT后,平均任务成功率提高 8.4个百分点 ,SPL提高 5.7个百分点 。
随后,LightNav-0通过RVQ动作编码器,将连续机器人轨迹压缩为3个动作token,使视觉、语言、空间位置和机器人动作能够进入统一的模型训练框架。
这实际上在做一件基础模型非常熟悉的事情:建立统一表示。只不过语言模型统一的是不同语言任务,而Physical AI需要进一步把视觉、语言、空间和动作统一起来。
真正检验基础模型的,不是训练集表现,而是零样本迁移
最终,LightNav-0没有把验证停留在一个机器人或者一个Benchmark里。
在10个仿真设置中,LightNav-0覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型进一步零样本迁移到 人形、四足、轮式和飞行机器人 等不同本体。
官方同时发布了模型、代码和技术报告。这一验证重点考察模型在环境、任务和机器人本体变化条件下的零样本泛化能力。
LightParkour从一个动作示例出发,将其扩展为能够适应不同环境条件的技能分布,LightNav-0则把这种泛化进一步推到环境、任务和机器人本体。
但机器人进入真实世界以后,还有最后一个很难通过Benchmark提前解决的问题。世界会变化,机器人自己也会变化。
Light REACT:环境会变,机器人自己的身体也会变
机器人正常运行时,大多数控制系统都可以工作得很好。
真正困难的是异常状态。人可能撞到机器人,机器人可能跌倒,执行器可能出现故障,关节可能锁死,环境也可能限制它原本的运动方式。
这类异常在单次实验中可能并不高频,但随着部署规模扩大,其绝对发生次数也会增加,对系统韧性、故障恢复能力和运维效率提出更高要求。
如果异常频繁导致任务中断,并且需要依赖人工恢复,部署规模扩大后,运维压力也会相应增加。
因此,规模化部署不只是增加部署数量,还需要 提高机器人在真实环境中的持续运行和异常恢复能力 。
Light REACT就是从这个问题出发。它的全称是REsilient humAnoid ConTrol(韧性人形机器人控制),目标不是让机器人永远保持一种标准步态,而是在身体条件发生变化之后,尽可能利用剩余的全身能力继续移动。
正常走可以,跛行可以,单腿跳可以;如果双腿已经无法维持直立运动,就让手臂参与支撑,切换到爬行。目标始终是同一个:在当前身体条件允许的范围内,继续完成运动。
关键不是拿到故障标签,而是从历史状态判断身体发生了什么变化
事实上,如何让机器人在面对新任务、新环境和新状态时减少显式人工适配,正在成为近期机器人基础模型研究中值得关注的方向。
今年8月,Skild AI发布S1。模型观看一次新任务的视频示范后,不修改模型权重,也不针对该任务重新进行后训练,就可以尝试直接执行。
在其公开的未见长程任务实验中,同样使用10万小时预训练数据时,视频上下文版本成功率达到66%,语言提示基线则为9%。Skild AI将传统机器人面对新任务时仍需要“收集数据—微调模型”的方式,类比为机器人仍处在“BERT时代”。
Generalist AI随后发布的GEN-1.5同样展示了一次示范下的任务适应能力。模型通过3—12秒的单次示范,在不进行梯度更新的情况下,在10类短程任务中取得59%的平均成功率;使用每项任务约5分钟数据进行10步梯度更新后,平均成功率进一步提升至83%。Generalist AI将这种能力归因于大规模物理经验预训练之后形成的单次示范学习和少样本适应能力。
另一条线上,RoboTTT把机器人可以利用的历史信息进一步扩展到8K个时间步。同一模型使用8K上下文训练,相比1K版本闭环表现提升62%,论文由此将上下文长度(Context Length)提出为机器人基础模型一个新的Scaling维度。
这些工作的架构、数据和任务并不相同,也没有必要把它们归为同一条技术路线。
但它们都在触及一个共同问题:当机器人面对变化时,能否更多依靠模型已有能力和上下文完成适应,而不是每次都重新依赖人工采集数据、微调模型或编写规则。
Light REACT把这个问题进一步推进到了机器人自身的身体状态。S1和GEN-1.5使用的上下文,核心信息来自外部提供的任务示范,模型需要理解的是“这一次要做什么”;Light REACT使用的上下文,则来自机器人近期自身的交互历史,它试图判断的是“我现在的身体处于什么状态,接下来还能怎么动”。
严格来说,它们处理的并不是同一种上下文学习。S1和GEN-1.5更接近从上下文中获得新的任务条件;Light REACT则是在训练所覆盖的损伤分布内,通过时序交互信息推断当前身体与动力学条件。它们共享的是利用上下文减少显式人工适配的思路,而不是同一种能力。
如果提前知道哪个关节损坏,那么可以针对每种故障设计一套控制器。
← 返回最新