模型可以开源,部署经验不能

过去一年,具身智能行业的新闻雷声大、雨点也大。根据量子位不完全统计,截至2026年6月12日,国内具身智能赛道共融资约438亿元,已经达到了2025年全年的近八成。

这些demo和融资,覆盖的场景五花八门,家用陪伴、商业导览、工业产线,每个细分领域都有公司在做。但demo跑通和真正批量部署,是两张皮的事,不是每个场景都能同时跨过去,如果视角直接盯着「具身智能」这个大概念,未免太过宽泛。

那么究竟哪个场景离批量落地最近?答案是工业。

机器人落地,还得是工业场景

听到「工业」二字,很多人会认为门槛高、技术严苛,但对于具身智能而言,工业生产反而比生活场景来得简单。工业场景中,取放、搬运、插拔,这类动作重复度高,任务边界也相对固定。

相比家用场景里随时可能出现的宠物、玩具、陌生访客,工业场景更容易在短时间内被集中突破。所以,工业变成了具身智能里跑得最快的那条赛道。

国家税务总局的数据显示,2026年1-5月,全国工业企业购进具身智能机器人的总金额同比增长了2.3倍。企业的钱,正在从「买demo」转向「上产线」。

如果说上一轮AI浪潮的主角,是「会聊天的模型」;那这一轮的主角,就是「会干活的机器」。

但「会干活」这件事,没法只靠一次对话或一段演示视频来验证。模型参数堆得再大,论文指标刷得再高,机器人到底能不能在真实产线上运转,答案都只能从产线上找。

这也意味着, 具身智能这条赛道,比的是谁先把机器人送进工厂、让它连续转起来。只凭借模型参数的大小,无法取得竞争优势 。

但同时也需要明晰,之前可能有一批传统的工业机器人已经开始进场上班,但这种模式仍然不能称为「具身智能的工业化落地」。

焊接、搬运、喷涂这类固定动作, 传统工业机器人早已干得又快又稳,但它们面前仍然有两堵绕不开的墙 :

  • 一堵是硬件:结构固定,换一个工位、换一种物料,就要重新设计;
  • 另一堵是软件:动作靠预先编程,看不懂场景、听不懂指令,更不会举一反三。

过去几十年,工业自动化的边界,被死死圈在「重复、固定、大批量」三个词里。

打破这两堵墙,正是这一轮技术浪潮真正要解决的问题。

为此, 机器人得先看懂当前的场景该干什么,这是认知判断;再准确地把动作做出来,这是动作执行;还要在无人盯梢的情况下,稳定运行足够长的时间 ,不能三天两头出故障。

这背后需要一整套体系,从认知判断,到动作执行,再到长期稳定运行,每一环都要跟上。

一周六个模型,直指具身智能落地

要覆盖如此复杂的一整套流程,单靠一个模型可能确实有些捉襟见肘。

最近这几天,有家公司一口气就发布了六款模型, 指向了数据生成、认知理解、训练进化、动作执行、端到端部署几个环节 。从数据到部署,被这家公司用这六个模型给串起来了。

这家公司,就是专注工业具身智能商业化落地的安努智能。

六款模型,分别是实时长视频生成模型Helios、软物体仿真平台SimLab、让世界模型对动作后果负责的ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5,以及端到端部署系统Nexus。

看上去有点眼花缭乱,没关系,我们先用一张图看一看这些模型构成的体系,接下来再一层一层拆解。

第一步要解决的,是工业具身机器人落地绕不开的一个难题——数据采集。

Helios赋能下一代具身智能与世界模型

安努先做了视频生成模型Helios。传统的视频生成往往面临着「生成慢、时间短、易崩坏」的痛点。

Helios通过底层架构的创新,显著改善了这一现状,它不仅能实时生成分钟级的长视频,而且在单张H100 GPU上就能实现 19.5 FPS 的推理速度。

有意思的是,Helios最初并不是专门为机器人或具身智能设计的,但它解决的几个核心问题——长时序建模、持续生成、实时推理、高效视频生成——恰好也是今天具身智能和世界模型绕不开的基础问题,Helios目前已被多家头部具身智能与世界模型团队采用,成为具身智能研究里不可忽视的关键技术底座。

ANU SimLab聚焦软物体操作仿真

工业场景里常见的刚性物体仿真,行业已经做得比较成熟,但物料分拣、快递包装这些任务中的软体物体,褶皱和光线一变,用传统物理引擎就很难精确建模,识别难度陡增。

这种软性物体的仿真,至今仍是各家都在攻克的难题。

面向物流软包裹分拣的抓取数据生成、面向工业设备的热视觉数据生成,以及这套仿真到真机的迁移方法,安努SimLab都已经在实际项目里完成验收落地,并且用百元级机械臂、零真实标注就跑通了全流程。

它的核心是一套自研的软体和热学物理求解器,配合基于Isaac Sim搭建的合成数据工厂,再加上一套已经在真实机械臂上验证过的sim2real迁移方法,把仿真里学到的东西搬到真机上。

配合自研的数采套件负责现场配套采集,三者合在一起,构成了给上层输送训练素材的数据工厂。

ActiWorld让世界模型开始对动作负责

地基打好之后再往上走,就是ActiWorld。它的核心,就是让机器人对自己动作的后果负责,在真正伸手之前,先知道这一下大概率会不会失败。

纵观现有的世界模型技术路线,有的瞄准物理规律,有的关注空间预测,也有像英伟达Cosmos这样走平台化的路线。

问题在于,画面看起来真实,不代表它真的对应了机器人给出的动作。一旦画面对动作不敏感,视频再逼真也无法支撑决策,这种偏差在操作任务里格外致命。

所以,ActiWorld把资源押在了另外一件事上——动作后果的可验证性。

以前评判一个世界模型好不好,看的是视觉效果和画面流畅度,但这个标准会稀释动作信息,回答不了动作有没有被认真对待这个问题。

所以,ActiWorld换了个问法。

它同时关注动作、时间、空间三个角度,确保模型预测出来的画面包含足够的动作信息,用以分辨出这是抬起还是推动;确保当前状态能够「承上启下」,既能清晰描述过去,又能准确预测未来;确保模型的注意力,放在真正发生变化的地方。

为了把这三个方面的能力真正赋予模型,ActiWorld在训练环节设计了三条约束。

  • 逆动力学头,从相邻预测结果里反推动作;
  • 双向预测,训练时把当前观测保留下来当参照,同时要求模型既还原过去又预测未来;
  • 运动加权,根据相邻真实画面的差异算出运动区域权重,强制模型把注意力放到真正变化的地方。

这三条约束只用在训练阶段。真正上岗的推理环节,走的还是标准接口,不多花一分钱的推理成本,而且直接兼容现有动作条件扩散骨干。

而且ActiWorld能干的,不只让画面更符合需求。

研究团队还拿它去做了另一件事,让它提前判断一套动作方案的后果,从而帮助机器人挑出更合适的动作。

测试下来,它对成败的判断和真实结果的偏差,低于3.25%。

这套预演能力,最后也在真机上得到了验证。

例如一个要求把包裹二维码朝上放到传送带上的分拣任务,原本执行策略的成功率是56%,加上ActiWorld引导的预演之后,相对失败率降了大概13.6%。

相比其他头部团队的世界模型,ActiWorld只关注一件事:动作对不对、能不能提前预判失败。

它训练时就把动作逻辑钉死,推理不加成本,也不绑任何本体,工厂落地,最缺的正是这种「先想一步」的判断力。

光有判断力还不够,机器人真正开始动手实操后,暴露出来的问题往往更棘手。

RoHIL和EvoHIL,让机器人持续可靠工作

比如光照条件一变,动作可能就跟着乱套。这是 RoHIL和EvoHIL 两代真机强化学习技术要解决的问题。

在RoHIL和EvoHIL框架下,机器人训练只需要30分钟就能达到满分水准,跨光照场景也不需要重新采集数据。奖励标准同样不用人工每次离线重新标注,系统会根据人工确认过的成功样本自己迭代,不用停线重训。

以USB插入这类精密任务为例,做到了100%的成功率,而且光照条件发生完全偏移时,需要人工介入的比例只有1.32%,不到旧方法的十分之一。

既然光照变化是最容易让机器人翻车的因素之一,RoHIL索性把世界模型重新打光,让机器人不管碰到什么样的光照条件,都能维持稳定的判断,跨光照条件部署的成功率做到了100%。

但产线上会变的不只是光照,工位换了、任务变了,同样会让训练好的模型失灵。

靠人工离线重新标注数据、停线重训来应付,成本又太高。

所以这时候,需要机器人拥有自我进化的能力,EvoHIL就是干这个的。

它给奖励模型、动作生成器、视觉感知都装上自适应能力,让模型自己判断动作做得好不好,不用人工离线重新标注数据、停线重训,就能适应新工位、新光照,自己生成新的动作方案去试。

真机测试结果表明,有了EvoHIL,机器人在6类典型工业任务中,成功率大幅提升。

训练、迁移、奖励设计这三块成本叠加起来,同等规模部署下,整体成本能降低80%左右。

但这里其实还没到执行层,真正落到「动作」这一步的,是世界动作模型AnuVerse-0.5。

AnuVerse-0.5攻克工业落地,实现端到端无人作业

它采用视频专家预测画面、动作专家输出动作的MoT架构,基于14B参数的Helios开发。其推理速度做到百毫秒级,一张桌面级显卡就能跑起来,速度和部署成本都处于产线边缘能承受的水平。

这套体系走到这一步,其实已经能看出安努的落子逻辑——数据、判断、执行,每一层都对应着工业落地路上一个具体的卡点。

模型的工作做完,接下来就是部署,这里安努准备了一套部署系统Nexus。

Nexus卡位产业链中最稀缺的「软件定义部署层」

不同品牌的机器人形态不一样,模型也可能不止一种,如果每换一次场景都要重新对接底层控制系统,效率就无从谈起。

Nexus把这些模型和不同机器人之间的调度统一起来,让VLA、世界动作模型这类不同的端到端模型都能快速部署上线。

Nexus端到端部署系统具备快速部署、自主调度、资源汇聚这三大优势。

另外,要想上真实产线,安全稳定是不容忽视的一环,机器人在产线上一旦做错动作,就可能带来巨大的代价。Nexus因此内置了一层基于动作层面的安全盾,兜住这类风险。

还有一个要考虑的问题是,工厂在引入机器人之前,已经有了自己的一套生产管理系统。和人类员工一样,机器人干的活也要能被看到、被管理,需要接入工厂的生产管理系统。

在这方面,Nexus已经打通了SAP的EWM和Joule系统,让机器人真正嵌进工厂原有的生产管理流程里。

除此之外,机器人在产线上的运行情况,也会用来反哺底层的数据环节。

Helios/SimLab生成数据,ActiWorld负责预测,RoHIL和EvoHIL负责机器人技能进化,AnuVerse-0.5负责执行。

它们跑出来的真实数据,会顺着这条线,回流到最底层的数据基座,接着用来训练下一轮。

如此一来,这套完整的体系就实现了有条不紊的运转和进化。

模型可以开源,部署经验不能

关于安努的这套模型体系,还有一个有意思的地方,是他们的研发路径。

具身智能公司常见的打法,是先把模型打磨扎实,再拿着模型去找场景落地。

安努却选了另一路,他们没有一味追求强大的基模,却让工程师先扎进富临精工的真实产线。这背后源于安努一个独到的判断。

安努智能董事长兼CEO文宏杰表示,以前看一家公司,往往先看技术路线、团队背景、市场空间和资本效率。真正进入工厂以后,他对具身智能的理解发生了变化。

他认为,模型能力会随着全行业进步持续外溢,真实产线上,单项技术指标做得足够好,并不能保证整套系统长期运行。

只有部署经验才会越攒越深,成为自己的制胜武器 。后来具身行业的发展,也印证了他们的这一预测。

这两年,越来越多的具身基础模型相继开源,没有自己模型的那些公司,也有了可以踩上去的开源肩膀。安努智能就是这么做的,他们基于开源模型,用几个月时间把认知底座和动作模型补了上来。

模型可以依靠开源,但产线上的部署经验,必须靠自己实打实的积累。

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗
← 返回最新