一台机器人的「多任务实战」

走进一家大型汽车制造商的线束车间,你会看到和整车工厂截然不同的画面。

整车车间干净、明亮、几乎完全自动化。线束车间密密麻麻,弥漫着汗味。

很多工人培训一个月,在岗坚持不到 三个月 就离开了。

这是工业自动化界公认的「深水区」。

△图为AI生成

如今,被具身智能彻底打爆了。

2026年WAIC, 它石智航 把一条 1:1还原的环形线束流水线 ,搬进了展馆。多台机器人集群合作,流水线轮转线束板,每个工位同一时间装配不同的线束线型。

效率自然大幅提升。它石智航首席科学家 丁文超 甚至调侃道:

现场我们都不敢让它一直干活,怕机器人干太快给料用完了。

撑起这条全自动化产线的,是它石智航刚刚发布的具身原生基座模型 AWE 3.5 。

这也是具身智能领域第一个真正打通预训练到后训练完整范式的原生模型。

一台机器人的「多任务实战」

它石给新版本取名3.5,信号也挺明确的:希望它像 GPT-3.5 一样,在多任务能力上开始展现新的可能。

回看AWE的发展趋势,也确实是这样。

3.0首秀,它石打爆了线束场景。

到了3.5,模型开始向更多场景溢出。工业装配、插接、收纳……全部被放进同一个模型里。

今年它石WAIC展台的主题-打造可信赖的物理AI,也是围绕这项特点展开,任务之间不重新加载新的模型,不切换参数,全靠同一个基础模型。

现场的展示非常魔幻,他们的机器人简直是「劳模」,整理桌面、打包手机、插网线、零件分拣……反正不管啥东西,递过去就开干。

用丁文超的话说就是:

跟主播带货一样(笑)。

但,这只是开胃菜。

2026年是世界模型百家争鸣的元年,不过, 究竟什么是世界模型?

在大部分人的认知里,它还是论文里的架构图和评测表格里的数字。

这次,它石智航在WAIC给出了最直接的答案:

你上手试一试。

现场观众戴上数据采集夹爪,就能和一个 由AWE 3.5生成的平行世界 展开互动。

你捏起一块积木,松手,积木像受重力一样落向桌面。你拖拽手机盒,盒子产生对应的位移和摩擦。蜡烛上微弱的火焰,也在模型中被忠实地呈现出来。

这些交互没有一行牛顿定律代码,没有碰撞引擎,没有物理结算。所有重力、柔性、碰撞反馈、物体位移……全部,由模型从真实类数据中学到。

而在这个涌现之外,有一项被严重低估的能力: 长时记忆与空间理解。

视频模型有一个难以治愈的缺陷——

预测未来的时间一长,物体就容易突然消失、变形,或者在一帧幻觉之后彻底蒸发。

究其根本,像素监督本身不鼓励长程物理交互的连续性,无法用于具身训练。

为此,AWE 3.5依托human-centric数据专门强化了模型结构,让它显式学习长时记忆和长时序空间理解,在数分钟的连续、交互闭环推演中保持环境稳定。在此基础上,后训练可以从连续过程中切出多个动作片段,而不用担心环境在下一秒崩掉。

在世界模型中做强化学习,成为了可能。

原生模型,从第一性原理重构具身大脑

今年以来,行业一直有VLA or 世界模型的争议,但最近和很多做具身的朋友聊了后发现,真正训模型的人根本不在乎所谓路线之争。

无论哪条路线,最终,还是要看 是否能优化Action。

VLA架构 里,视觉和语言在预训练阶段就紧密耦合,动作模态却要到后训练才通过SFT接入。这相当于一个学生先学了全部理论课,临考试前才开始动手做实验。理论和实操之间,隔着一道先天的裂缝。

世界模型 路线往前走了一步,至少可以利用大规模视频学习表征能力。但互联网视频模型的Attention结构已经在几十万到百万小时的猫狗视频上定型了,直接往具身基座模型里嵌, 容易走向两个极端:

1、视频模型原有的幻觉跑进动作策略,导致操作不到位或判断混乱;

2、视觉理解、空间理解和动作永远无法同步。

因此,早在行业掀起「世界模型」热浪前,它石从第一天便毅然选择了另起炉灶——

从头训一个原生的具身模型。

具体而言,AWE 3.5从预训练阶段开始,就把视觉、语言、动作等多种模态一起喂给模型。同一套架构,既能输出动作,也能预测未来。

丁文超把它称为 One Model结构。

这个架构设计有一个精妙之处: 模型本身不变,只改变输入输出的组合方式,就能切换出完全不同的「人格」。

视觉到动作,是Base Policy,负责制定策略、发出指令;以动作为条件预测未来视觉,是Action Condition World Model,负责预测环境变化。两者交互在一起,就是一套完整的强化学习闭环。

打个比方:打包书包时拉拉链。

这是一个毫米级精度的活,而且处处是「卡点」。拉多一点可能成功,拉少一点可能抓不住,用力过猛可能卡住。

传统的做法是把机器人放在真机上一遍遍试,失败一次就记录一次,数据贵、速度慢、设备磨损还大。

AWE 3.5的做法是:先在预训练模型的「脑海」里模拟。模型想象拉链在不同力度下的各种结果,然后把最优策略告诉Base Policy。这比在真机上反复试错快了不止一个数量级。

这就是它石原生模型最核心的突破: 模型成了自己的「仿真器」,而无需手工搭建仿真环境。 预训练建立通用物理交互能力,后训练在模型内部的世界里自我对弈、自我强化,形成自闭环。

这套范式,是语言模型在文本领域已经验证过的路径;但在具身原生模型里,它石开发的AWE 3.5是第一家完整跑通的。

而之所以能成,也是它石长期布局之下两条暗线的交汇所赐——

足够大的真实数据规模,以及能消化大规模数据的Infra。

缺任何一样,这个闭环就转不起来。

先看数据量——

AWE 3.5,基于 超百万小时human-centric数据 训练。

这个量级有多夸张?

这么说吧,目前市面上大多数 视频生成模型 ,训练数据是在百万小时级别。

自动驾驶所需数据,也是这个量级。

但百万小时,不是简单的堆量游戏。

具身数据的价值分布极不均匀。部分数据对模型至关重要,但重复度高、交互单一的数据,对模型几乎没用。

如何从百万小时中筛出真正高质量的部分 ,已经成为比采集本身更紧迫的问题。

这对数据Infra提出了极高的要求,也是它石这几个月以来重点优化的方向。

它石数据系统的重心,正在从「更多」转向「更聪明、质量更高」, Data Efficiency 正在成为新的评测维度。

而当数据规模和数据效率同步上去后,Scaling的威力也终于得到了印证。

丁文超表示,现在预训练已经足够扎实,一个新任务 只需要小时级别的数据采集 就能跑通。

这正是当初它石选择One Model架构的前瞻性:先建立通用基础能力,再向各个场景分发。

如今随着AWE 3.5发布,这项前置战略的红利也终于开始显现——

它石等的,从来不是线束这一个场景的闭环。

量子位获悉,除线束之外,柔性操作、分拣、检测协同……等多个工业场景,也已经在验证中。

基于此,丁文超给出了一个大胆判断:

具身Scaling已全面释放。2027年上半年到年中,可能出现分水岭。

行业已经从「机器人文娱舞蹈」,进入「机器人真干活」的阶段。

展会热度,则是一个先行指标。 今年的WAIC,具身智能企业超过200家,机器人展区的人流明显超过其他区域。

而它石的展区,同样也是堆满了人。

「机器人究竟什么时候进厂干活?」——这个问题,无论线下还是线上,都已经很少再被人提起。

原因很简单:各大头部厂商早已争相把机器人送进了工厂的深水区,让它在真实环境中摔打、学习、迭代。

WAIC世博展馆一楼,从北门进入,映入眼帘的便是「模登时代·伙伴之城」。一个机器人各司其职、埋头干活的实景展区。

而进门右侧第一个展位,它石带来的 汽车精密线束装配演示 ,无疑是其中最为独特的一个。

我亲手体验了一番: 插孔极小,必须眯起眼睛才能勉强对准 ,即便插了进去,也很可能是误插,必须要插到正确点位才能使用。人工操作尚且如此,对机器人而言,难度可想而知。

这是它石首次亮相WAIC,也是我第一次在线下近距离观看他们的Demo。但说实话,这或许就是WAIC这类线下活动的意义吧,看完之后,脑海中原本模糊的印象一下子变得具象起来——

这不仅是一家技术过硬的公司,更是一家特点鲜明、场景定位极其清晰的具身智能企业。

这也是丁文超在与量子位对话中,反复强调的观点:

具身智能的下一步,是让系统获得梯度,也就是明确的迭代方向。而这个方向,不可能仅靠公司内部的几个Demo来牵引,它必须来自真实场景的正反馈。

它石正在做这件事。

对话它石首席科学家丁文超

具身Scaling能力释放

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗