少花一半成本,部署效率提升80%!机器人研发可以不用重复造轮子了。

上周五,逐际动力线下黑客松实训大赛「创学营2026」的收官现场,选手们正在云上跑最后一轮仿真评测。

他们打开浏览器,登录一台远在云端的工作站,旋转着Isaac Sim里的机械臂场景,调整参数,生成数据。

这一幕要放在3年前很难实现。

筹办类似的比赛,光是找场地、配机器就要耗费1个月的时间。

机器人训练可不是打开电脑,写写代码这么简单。

背后需要Isaac Sim、NVIDIA Omniverse等仿真环境,需要GPU算力支撑,还涉及不同版本软件、驱动和开发工具的统一配置。

一场创学营办下来,每多一名选手,对主办方的环境部署、设备采购和资源管理都会提出更多要求。

更麻烦的是,活动结束后,这些高性能设备又可能长期闲置。 买得越多,浪费越大 。

逐际动力选择了一种不同的方式。

借助阿里云旗下的 AI创研算力平台无影灵构 的云上工作站,选手们可以快速接入统一研发环境,算力资源按照实际需求弹性调整,不需要提前采购大量固定设备。

这场演练明面上是在探索「机器人怎么变聪明」,背后的隐藏副本则是 「如何让研发机器人的公司,变得更高效」 。

为什么训练一个机器人,这么费机器?

大模型让机器人开始具备理解和推理能力。

但从会聊天到会干活,还需要经历一整套复杂流程:遥操作数据采集、算法调试、仿真训练、真机部署。

与数字AI不同,机器人面对的是一个高度复杂、不断变化的真实世界。

它需要理解空间,需要感知物体,需要预测动作,还需要在真实环境里不断试错。

每一个环节都离不开计算资源支撑。

图片由AI生成

这也是为什么,具身智能的竞争从来不只是模型参数竞争,更是一场围绕算力、数据和工程效率展开的长期竞赛。

逐际动力联合创始人兼CTO谌骅告诉量子位,过去两年,粗略估算,公司 研发团队对算力的需求增长了5到10倍 。(吞卡兽.jpg)

而且是有多少卡就能吃掉多少卡。

算力需求暴涨,只是问题的一面。

更大的变化在于,机器人研发正在从单点实验走向复杂工程协作。

过去,一名算法工程师拥有一台高性能工作站,配置好环境,就能完成部分研发工作。

但今天,一个完整的具身智能团队,需要同时处理仿真训练、数据处理、模型迭代、多人协作和真机验证。

研发资源不再只是「一台机器」,而是一整套持续运行的基础设施。

阿里云智能集团副总裁、终端智能计算事业部总裁张献涛认为,云计算的发展已经经历了两次基础设施迁移。

第一朵云支撑了互联网,第二朵云支撑了移动互联网。

而现在, 机器人时代需要第三朵云 。

这一次,云需要解决的不只是计算资源的问题,而是 让算力、开发环境和3D交互能力一起进入机器人研发流程 。

话说回来,为什么机器人研发会逼出第三朵云?

一个机械臂抓取物体,看似只是伸手、移动、拿起几个动作,但背后需要理解物体位置、形态、重量、摩擦力以及周围环境变化。

一个人形机器人行走,也不是简单输出几个动作指令,而需要持续调整重心、处理身体平衡、关节控制和空间反馈。

尤其在人形机器人研发中,3D仿真环境需要同时处理复杂场景、机器人运动和物理交互,对 图形算力 提出了更高要求。

这让机器人研发天然成为高算力行业。

但过去,支撑这种研发的 基础设施没有跟上产业速度 。

此前,业内通常采用 采购工作站-安装软件-配置GPU环境-逐台维护 这套模式。

工程师想要搭建一套可用的开发环境,得登录集群,靠命令行一步步安装软件、配置依赖、下载库文件、编译程序、启动各项服务,整套流程经常耗费四五个小时。

这简直是一种「折磨」。

麻烦不说,关键是在团队规模较小时,尚且勉强可行,一旦团队扩大、任务增加,这种方式越来越难适应快速变化的研发节奏和快速扩张的团队规模。

谌骅也表示,实际工作中,团队在仿真环境的配置,训练资源的调度上总会遇到各种各样的小问题。

比如CUDA、ROS2、Isaac Sim等工具链组合复杂,依赖库、驱动之间极易出现版本冲突;

软件、仿真器迭代更新速度快,团队多台本地工作站硬件型号不一,很难做到全设备环境完全统一。

甚至新人入职,或者临时让外包人员进场,还得从零开始下载、编译、调试全套开发环境。

「单人配置耗时长达大半天,这些都是机器人研发中的隐藏成本。」

此外,外包和跨地域协作带来账号、数据权限、审计和离场的回收压力,也是具身智能公司不得不考虑的现实问题。

拥有一个可以 云端灵活调用、弹性扩容、开箱即用和安全环境 的工作站,迫在眉睫。

把工作站搬上云之后

在与多家具身智能公司沟通后,张献涛发现,当行业走到工程化阶段,环境、算力、数据、仿真这些事,眼下每家公司都在自己搭一遍。

「这背后不是谁愿意重复造轮子,而是这一层还没有变成标准件。」

在他看来, 共性越强的部分,越应该被尽早沉淀成标准件。

无影灵构要承载的就是这些共同需求:把具身智能的研发现场搬到云上,环境按需复用,算力随任务调度。

「本体、模型、数据和真实场景,始终应该长在机器人公司自己手里。我们要做的是 把基础设施带来的研发摩擦降到最低 。」张献涛说。

今年3月,逐际动力与阿里云无影深聊了下。

尽管逐际动力很早就和阿里云建立长期合作,但此前双方仅依托PAI平台、通用GPU算力,完成大规模模型训练的底层算力合作。

而这一次,他们讨论的问题聚焦在 具身智能研发全链路的前端工程痛点 :

仿真难可信、训练难稳定、真机难规模化、数据难形成高质量闭环。

这四个问题背后,又共同受到环境碎片化、算力错配、成本和安全治理等因素影响。

过去,机器人团队往往需要自己搭建一整套研发环境。

买GPU工作站、安装CUDA和ROS2、配置Isaac Sim、管理不同版本依赖,再把数据在本地和云端之间反复搬运。

对于成熟团队,这是一笔持续投入;对于快速成长的机器人公司,这更像是一种重复建设。

无影灵构给出的思路,是把过去摆在工位上的高性能工作站搬到云端。

一些重型计算单元(GPU、仿真环境、数据盘)全部上云,工程师只用轻量设备通过网络串流画面操作云端工作站。

对工程师来说,最直观的变化首先发生在 环境交付 。

机器人研发环境最大的痛点之一,就是复杂。

CUDA版本、驱动版本、仿真软件版本之间存在大量依赖关系。一台机器能运行,不代表十台机器都能稳定运行。

尤其对于创学营这类需要快速接入大量开发者的场景,如果每个人都从零开始配置环境,时间成本非常高。

无影灵构 提前把研发机器人要用的所有软件、驱动打包做成固定模板镜像 。

想新增开发机器,一键复制模板就行;新人登录账号,点开就能用一模一样的环境,不用自己折腾安装。

谌骅表示,过去团队本地配置Isaac仿真环境时,经常会遇到各种报错,而在无影灵构AI工作站里,可直接选现成镜像启动。

「半小时就能开工,很少出故障,稳定很多。」

这不只是节省安装时间,还让机器人研发环境具备了软件行业熟悉的标准化能力。

算力弹性,是另一个关键变化。

机器人研发天然需要大量试错。

算法调优、仿真训练、模型评测,不同阶段对于算力的需求并不相同。

传统模式下,企业只能按照峰值需求采购硬件。

结果就是:忙的时候,GPU永远不够;闲的时候,高价值设备长期闲置。

更麻烦的是,显卡更新换代很快,一次性花几千万自建算力,过两年硬件升级,钱等于打了水漂。

云端工作站改变的是算力获取方式。

据无影灵构产品经理王姣阳介绍, 企业可以根据不同任务灵活选择GPU规格 。

日常研发保持稳定资源,高峰期遇到训练营、大规模测试等任务时,可以快速扩容,项目结束后再释放。

「算力跟着需求灵活调整。」谌骅说。

从买设备,到调用算力,机器人研发正在进入一种新的资源组织方式。

但对于具身智能而言,仅仅解决算力供给还不够。

决定云端工作站能否落地的,还得看云上的机器人研发体验,能不能接近本地。

云端工作站,先要过「像不像本地」这一关

判断一个云端工作站好不好用,还得看工程师能否感觉到GPU在哪里。

就拿机器人仿真训练来说,工程师需要实时操作3D场景,拖动机器人模型,调整环境参数,观察运动结果。

任何一个环节出现延迟,都会直接影响调试效率。

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗
← 返回最新