九大空间测试10B规模通用模型中8项第一

来了!这一次, 国产多模态 在物理世界也夯起来了——

九大国际权威空间理解基准测试中, 八项断档第一 ,通用能力还能不打折。

紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B ,直接把10B以下通用模型空间具身的天花板又往上顶了一大截。

这里可能就有朋友要问了,让多模态看懂真实世界,为啥值得单拎出来说?

一个字: 难!

过去的多模态模型,已经能把一张图片理解得头头是道,但一旦走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为了补足空间能力,又不得不以牺牲通用能力为代价。

能同时跑通这两件事的模型寥寥无几,效果还突出的更是凤毛麟角。

紫东太初就是其中之一,ZDTaichu5.0-9B堪称 全能 。

眼见为实,咱们直接上效果。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

这是一段由 ZDTaichu5.0-9B 控制的美工刀具身收纳演示。

如果让人来做,应当是个非常简单的过程: 拉开抽屉→放进去→再关闭 。但具身不一样,一连串的动作背后都是相当细致的空间判断。

刀柄在哪里?抽屉状态如何?夹爪有没有对准?

每一步都要承接住上一步带来的变化,动作才能看起来顺,这对模型能力的考验是极为苛刻的,而ZDTaichu5.0-9B已经能完成 复杂的空间理解和高层任务规划 。

与此同时,对于这个只有9B大小的模型,其图文理解、文字识别、数学推理和代码能力也依旧稳居 第一梯队 。

通用能力不降级,空间具身能力向上突破。

很好奇,究竟是如何做到的?

空间具身+多模态双领先

在回答这个问题之前,咱们不妨再多看几个效果感受感受。

先来几道空间具身题目尝个鲜。

从视频目标定位到三视角推理,空间判断稳准狠

第一道题 「找东西」 :从左至右,找到第二个银色盒子。

这个 空间感知任务 对于机器人来说,是后续执行任务的大前提。指错了,后面的抓取动作再准确,执行的也是另一个任务。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

△实测由紫东太初完成

画面中,台面挤满杯子、收纳容器和各种杂物,干扰项较多。模型得同时读懂银色这个关键属性、盒子这个对象,以及从左到右第二个这层空间排列关系。

从对比演示中看,ZDTaichu5.0-9B给出的 归一化坐标 (237,226)最为精准,落在目标标注区域内。

接下来难度升级,不仅要找得对,也要看得准。

这是道考验复杂空间推理的 「看位置」 题。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

△实测由紫东太初完成

输入的是同一房间的三个视角。模型需要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。

其中模型得把不同画面中的对象一一对应起来,再根据新的观察位置和朝向转换参照系。

ZDTaichu5.0-9B给出了右前方, 预测完全正确 。

再往前一步,空间判断还得回答哪里具备操作条件,给予机器人接下来的操作以方便。

比如这道 「找空位」 ,要求在最右侧杯子的杯柄方向上,找一块空闲区域。

认出杯子只是开始,随后还要确定杯柄朝向,检查旁边是否被其他物体占用。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

△实测由紫东太初完成

结果也不出所料,ZDTaichu5.0-9B依旧稳稳 落入正确区域 。

当我们把三个例子放在一起看,它们分别对应目标选择、参照系转换和交互条件判断,都在机器人执行真实物理任务中扮演关键要素。

换言之,这些基础能力都决定着 具身能否从一句任务指令到真正可执行 。

再来看 完整成绩单 ,模型优势就更加清晰了。

在所列的10B档位开闭源模型中,ZDTaichu5.0-9B几乎是 断层领先 。

比如差距较大的MindCube-tiny,ZDTaichu5.0-9B的得分是78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别是48.8462、70.87和63.56。

整个榜单把 空间感知、三维推理、多视角变换、具身交互 都囊括在内了,可谓是面面俱到,足见ZDTaichu5.0-9B已彻底看懂物理场景该怎么操作。

双线突破,通用能力不降级

考完空间能力之后,另一个重要问题随之而来: 通用能力 还hold得住吗?

这里同样有份基础能力的成绩单。

图解理解基准AI2D达到 91.48分 ,仅次于Gemini 3 Pro,高于其它所有对照模型。

WeMath为75.9分,同样领先;MathVista Mini为84.5分、OCRBench为85.5分,表现颇具竞争力。

除此之外,ZDTaichu5.0-9B在 Agent与文本任务 上也依旧表现突出,尤其是代码成绩。

这些能力具体怎么组合起来用, 科研Agent 的阻尼振子求解demo给出了直观展示。

该问题要求Agent组织解析求解与Python/SciPy数值计算,并对照两种结果,最后生成相空间图、位移与速度曲线,以及分析报告。

ZDTaichu5.0-9B在整个过程中也丝毫没有掉链子,在问题理解、代码执行、结果核对和图表输出四个阶段子任务上都完美实现连续衔接,最后输出非常完整。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

事实上,这对于同一个9B模型是相当不容易的。

要同时兼顾 空间具身能力与通用能力 两条线,背后要解决的有很多,例如数据如何组织,以及复杂判断时算力怎么分配。

9B多模态大模型的空间具身能力,是怎样练成的?

ZDTaichu5.0-9B给出的解法贯穿 训练 和 推理 两部分。

全栈数据生产管线:把通用能力、Agent能力以及空间具身能力全部练进模型

紫东太初先是围绕这一需求,组织了一套 经过全流程验证 、 可复用 、 可迁移 的数据工程链路。

整体包括三个渐进式成长阶段:

Step 1:预训练数据管线。

这一步数据覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景。

原始素材进入管线后,先通过 感知哈希 与 URL 去重,再过滤低清晰度、图文不相关等较差的样本,随后进行内容重写解析和视频抽帧描述,最终打包组织成可训练的图文与时序输入。

最终建立的是视觉、语言、时序和空间概念之间的对齐联系。

Step 2:监督微调数据管线。

随后训练开始覆盖完整任务。

开源SFT指令、真实业务问答、空间具身案例,以及Agent工具调用轨迹,都被组织成多轮对话、多图和视频序列。

其中针对 具身样本 ,管线还会检查图像、问题、对象关系和操作约束是否一致。还是以开头的美工刀收纳举例,如果图中抽屉关着,模型就不能直接要求夹爪往里放东西。

带步骤的思维链 也要经过拒绝采样、格式和一致性校验。这样进入训练的,才是有视觉依据、能解释操作顺序的任务样本。

Step 3:高质量退火+GRPO强化学习数据管线。

最后一步继续针对短板优化。

团队为数据建立 能力域-难度-质量标签三维自动标签系统 ,为模型筛选高信息量样本。

值得注意的是,评测数据不会直接作为训练样本,标签也只是用于提供能力分类与样本筛选的参照。

GRPO 则把答案是否正确、空间坐标是否命中、输出格式是否合规,都通通转化成可自动校验的奖励信号,让模型沿着具体反馈继续改进。

于是在层层递进之后,物体识别、空间关系和任务约束都开始逐步连接起来。

未来即使是企业自己的车间录像、实验操作记录和仿真素材,也都可以通过这条路径转化成训练样本。

内置自适应循环推理:把算力用在真正难的判断上

但训练数据只是打好了地基,再往上, 每次推理的难度也会随着任务变化 。

比如有些画面中目标清楚、关系简单;有些任务则要整合多个视角,还要判断遮挡和操作前提。

显然,后者更需要 额外计算 来修正判断。

ZDTaichu5.0-9B为此引入了 内置自适应循环推理 ,让模型根据预测的不确定性,决定当前Token是否需要再算几轮。

具体来说,模型先完成一次标准前向计算,得到Token预测分布和隐层状态。 熵门控 随后评估预测的不确定程度,分布越分散,意味着模型对输出的把握越小。

确定性较高时,模型直接输出;遇到 高不确定性节点 ,就在内部重复执行部分层块计算,迭代调整隐层表征,为当前判断 增加计算深度 。

由于这段额外计算发生在模型前向传播内部,也无需为此调用外部工具。

当然,到底算几轮也要有约束,总不能无限制发散下去。

ZDTaichu5.0-9B配套了 三重稳定化工程设计 ,以致于模型能够让算力合理倾斜:

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗
← 返回最新