从柔性本体走向跨本体基础智能,让任务与世界知识延续

机器人身体,正在成为具身智能里最被低估的变量。

过去两年,滚烫的金钱和聪明的大脑纷纷涌入人形机器人行业。

这背后的逻辑足够清晰:现实世界围绕人体尺度建造,双腿可以跨越台阶,双臂可以覆盖工作台,双手可以使用现成工具。

一副与人相似的身体,理论上能够直接进入工厂、仓库、商店和家庭,复用人类已经建立的物理基础设施。

但人形所追求的通用性,也把机器人领域最困难的一组问题,压进了同一套系统。

比如动态平衡、高自由度控制、灵巧操作、碰撞安全、能量效率和开放环境泛化,需要在一副身体上同时成立。

而当机器人真正走向产业,另一个问题正在浮现: 通用机器人是否一定意味着通用身体?

李飞飞近期在围绕空间智能和机器人训练的讨论中,也给出了一个接近工程现实的观察:

人体由演化塑造成了适应开放、非结构化环境的通用形态,当任务边界足够明确时,最高效的身体可能沿着完全不同的方向演化。

她用“爬树”举例,如果一种生物长期面对的核心任务只有爬树,它最终形成的身体形态,大概率不会和人类相同。

这恰好解释了擎羽科技(FEAGINE)选择的路线。

擎羽由香港大学机器人学博士、前大疆创新嵌入式工程师 彭锐 创立,聚集了一批来自 斯坦福、清华、普林斯顿、大疆 等全球顶尖科技与研究体系的人才。

这家公司没有从复制一副人体开始,而是先把“ 身体 ”本身作为一个可以重新设计的变量。

在本次发布中,擎羽带来了 FEAGINE A01、A02、A03 三款仿生柔性机器人,以及第一代跨本体基础模型 Fi0:Foundation Intelligence Across Embodiments 。

前者解决的是机器人可以拥有怎样的身体,后者研究的则是身体发生变化之后,已经获得的智能能否继续使用。

单独看,A01、A02、A03是三款长度、节段、自由度和负载能力不同的柔性机器人;把它们与Fi0放进同一张技术路线图,它们又成为一组真实的embodiment variation。

身体逐渐变长,节段逐渐增加,可达空间、运动路径和接触方式随之变化,而模型需要理解其中哪些东西属于任务和世界,哪些东西由身体决定。

擎羽把这条硬件、数据与模型共同演化的技术路线称为: 柔性具身智能 。

人形之外,具身智能的身体仍有巨大的设计空间

在机器人领域,柔性通常首先指向材料和机械结构。

软体机器人、连续体机器人和绳驱机器人通过弹性结构、连续弯曲或柔顺驱动获得更丰富的构型,使机器人能够顺应环境、包络物体,并降低刚性碰撞带来的风险。

柔性具身智能将这个概念继续向上推进。

柔性具身智能,是以可连续形变、可顺应接触的机器人本体为物理基础,将身体的结构参数、实时形态、感知和驱动能力纳入模型上下文,使任务知识与世界理解能够跨越不同身体复用,并由模型为当前身体生成适配行动的一类具身智能系统。

在擎羽的判断中,柔性本体能够拓展近人交互与复杂动作的边界,连续构型也为数据映射和跨本体泛化提供了新的基础。

友善的本体、丰富的数据、泛化的模型,被擎羽视为机器人进入真实生活空间的三个核心要素。

这条路线没有否定人形机器人的长期价值。它提出的是另一种市场结构: 未来的机器人可能拥有许多不同的身体,通用性由共享智能提供,而每一种身体围绕自己的任务和环境达到更高效率。

全球首个量产绳驱柔性本体产品矩阵

FEAGINE A01、A02和A03,构成了 全球首个 实现标准化量产交付的绳驱柔性本体产品矩阵。

三款产品沿节段数量、自由度、长度和负载能力逐级展开,对应不同的实际部署需求。

FEAGINE A01采用一段柔性关节和2个自由度,整机重量750克,末端负载200克,更适合搭载在移动底盘、巡检设备和其他对重量敏感的平台上,在有限空间内完成轻量操作。

A02扩展至两段柔性关节和4个自由度,整臂长度30厘米,末端负载400克,最高移动速度达到0.78米每秒。

更大的工作空间和连续弯曲能力,使它能够进入桌面操作、近人服务、狭窄空间作业以及需要柔顺接触的场景。

A03进一步增加到三段柔性关节和6+1个自由度,整臂长度50厘米,末端负载600克,最高移动速度达到1.17米每秒。

更多节段带来了更大的构型空间,使机器人能够绕过障碍、从复杂角度接近目标,并承担更长距离、更高自由度的操作任务。

三款产品均支持ROS 1、ROS 2、Python与C++,A02和A03还配套GUI、MuJoCo与SAPIEN环境。

从移动操作、近人服务,到复杂空间中的抓取和交互,擎羽把柔性机械臂从实验室里的科研用具,变成可以 直接集成和部署的标准机器人本体 。

对Fi0而言,这组产品还有另一层意义。

随着长度、节段和自由度变化,同一个任务会自然产生不同的运动路径、身体构型和接触方式。

短臂可以直接接近目标,拥有更多节段的长臂能够利用构型冗余绕开障碍,双臂或多臂系统还可能重新组织任务中的动作分工。

任务保持不变,身体开始系统地改变任务的实现方式。

A01、A02和A03因此不只是三个SKU,它们也为Fi0提供了一组真实、连续且可以反复验证的本体差异。

每增加一种长度、节段和组合,模型都获得一个新的样本,用来理解身体变化究竟如何改变行动。

Fi0:跨本体基础模型Foundation Intelligence Across Embodiments

从上下文学习机器人技能,理解物理世界,并让行动适应不同身体。

Fi是擎羽对Foundation Intelligence的长期研究方向,Fi0是这一方向下的第一代跨本体基础模型。

它建立在一个基础判断上:

机器人对于任务和物理世界的理解,应当可以跨越身体继续复用; 真正需要随着身体变化的,是行动。

当任务是“把方块放进碗里”,机器人从A01换成A03,或者从单臂变成双臂,任务本身并没有重新定义。

操作对象之间的关系、抓取与释放的接触逻辑、任务推进的顺序以及最终的成功状态,仍然可以复用。

随着身体变化,真正需要重组的是可达空间、动作维度、运动路径、身体构型和动力学结果。

Fi0希望让任务意图、物体关系、接触逻辑和目标状态在不同身体之间延续,再根据当前机器人的形态、感知、驱动能力和动态状态,生成适合这副身体的动作。

但跨越身体只是Fi0希望解决的一半问题。

真实世界中的任务同样不会在训练阶段被穷尽。对于模型已经掌握的技能,Fi0可以直接执行;遇到训练覆盖之外的任务时,人类可以通过擎羽的Ego头环来提供一次demonstration。

模型将这段示范作为推理时的skill context,从中理解操作对象、任务过程、关键接触和目标状态,再调用已经获得的世界知识与操作能力完成执行,而无需针对当前任务重新训练参数。

由此,Fi0的能力沿着两个方向同时展开: 新的技能可以通过上下文进入模型,已有技能可以跨越不同身体重新表达。

语言、视觉、人类示范、世界状态和本体信息共同构成Fi0的上下文。

语言给出目标与语义条件,demonstration在需要时补充具体技能,视觉与世界表示持续描述环境正在发生什么,本体信息则告诉模型此刻控制着怎样的身体。

任务可以来自预训练获得的能力,也可以在使用过程中通过上下文补充;真正执行时,模型再根据当前世界和当前身体生成行动。

围绕这条链路,Fi0同时建立对 技能、世界、身体和行动后果 的表示。

  • Skill Encoder将人类示范转化为可调用的技能上下文;
  • Cross-view World Encoder从不同观察视角中学习共享的物理世界;
  • Embodiment Graph将机器人结构与实时状态纳入模型;
  • World Dynamics Model与MAWA则进一步预测并评估不同动作可能带来的未来。

这些机制最终服务于同一个目标: 让机器人能够在使用过程中获得新的技能,并在身体发生变化之后,继续调用此前积累的任务知识和世界知识。

从上下文中学习技能

机器人基础模型正在覆盖越来越多任务,但真实世界里的操作对象、任务流程和技能组合,很难在训练阶段被提前穷尽。

传统路径中,一项新能力通常需要先变成数据,经过示范或交互采集、训练或微调,再重新部署到机器人上。

进入工厂、实验室和家庭之后,这条链路会越来越重;尤其对于端侧运行的模型,现场频繁更新参数很难成为日常使用方式。

Fi0因此把一部分新任务的适配放到了 推理 阶段。

对于已经掌握的任务,模型可以直接执行;遇到训练覆盖之外的技能,人类可以使用Ego头环先完成一次demonstration。

Fi0将这段示范作为当前任务的skill context,从中理解操作对象、任务顺序、关键接触和目标状态,再结合当前环境与机器人自身的本体条件生成动作,整个过程无需更新模型参数。

这意味着,一项新技能不必先进入训练集、等待下一轮模型更新,便可以直接进入机器人的执行过程。

机器人可以带着已有的通用能力进入场景,在遇到能力范围之外的任务时,再通过上下文补充当前任务所需要的信息。

这也为具身智能提供了另一种能力扩展方式:基础模型持续扩大能够直接完成的任务范围,上下文学习则承接真实场景中不断出现的长尾需求。

随着模型能力提升,需要额外示范的任务会逐渐减少,但这条在使用过程中接收新技能的通道仍然保留。

因此,机器人不需要等到训练阶段覆盖所有可能的任务,才开始进入真实世界。

△面对陌生任务,Fi0可以将一次人类示范作为技能上下文,在推理时理解任务,并结合当前视觉与本体信息,为不同机器人身体生成相适配的动作。

从不同视角学习同一个世界

人类和机器人几乎不会从相同位置观察同一项任务。

人类示范通常来自头部第一视角,机器人则可能通过腕部、机身、头部或外部相机感知环境。

相机位置、视场和遮挡关系一旦改变,同一个物体在像素空间中的表现可能截然不同。

但它们经历的仍然是同一个物理过程。

物体具有相同的状态,抓取与释放遵循相同的接触规律,任务也沿着相同的阶段推进。Fi0需要跨过视角差异,保留这些更稳定的世界信息。

为此,Fi0引入 Cross-view World Encoder 。

人类第一视角和机器人视角分别经过视觉编码,再通过跨视角预测与表示对齐,学习共享的世界表示,其中包含物体与机器人状态、空间关系、接触事件、任务进程以及未来动态。

这层表示连接了人类经验与机器人执行。模型需要能够从人类第一视角和机器人腕部视角中识别“方块已经被抓住”这一相同的物理状态;同样,机器人在真机执行中获得的滑落、碰撞和接触经验,也可以继续丰富模型对人类示范的理解。

Fi0最终获得的,并不是某一个视角下的视觉特征,而是 对物体和交互正在发生什么的共同表示 。

只有建立了这层共享世界,人类示范中的经验才有可能跨越相机和机器人本体,真正被模型复用。

△Fi0从人类的第一视角与腕部视角中,学习关于物体、交互、任务进程和未来动态的共享世界表示。

将人类示范转化为技能上下文

一段人类示范提供的,远不止手部轨迹。

当人伸手拿起方块时,视频同时记录了对象选择、接近方式、接触建立、任务阶段变化以及目标如何一步步推进。

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗
← 返回最新