让模型和设备共同进化

静态互联网数据的增长红利,见顶了。

下一轮模型能力的跃迁,会越来越依赖与真实环境持续交互的「端侧」。

当整个行业还在想办法把更强的模型塞进设备时,一支从北大走出来的团队,给出了上述这一激进的行业判断。

甚至在端侧AI迎来爆发的这个时间节点,他们还直接给它重新下了一个定义:

生产力=元空端侧AI=模型×Agent×设备。

端侧AI也由此从一条「把模型搬下来」的单向链路,开始变成一套能自己转起来的飞轮。

△AI生成 得出这个反常识判断的公司,大家应该也不陌生: 元空智能 (元空AI)。

三年前,这支从北大走出来的创业团队,靠国内最早一批AI Excel产品ChatExcel迅速出圈,短时间积累上百万名用户。

三年后,它已经一路从云端应用,杀到了本地端侧——

就在近期,元空一口气发布端侧模型 Boxer 、面向办公场景的 元空AI Work ,以及科研Agent 元空AI Science 。

三者从模型、Agent到设备侧形成完整闭环,让模型与设备完成共同进化。

更值得玩味的是,当行业还在讨论端侧AI到底怎么走进更多设备时,市场已经先给这家公司投了一票。

就在几天前,元空AI的端侧模型,刚刚拿下 惠普商务电脑预装 。

一家从高校实验室走出来的创业团队,就这样从一个办公AI产品,一路走到了全球头部硬件厂商的设备里。

△AI生成 当前,端侧AI的分水岭,正在从「跑起来」走向「长期跑」。

当行业还在反复讨论端侧AI究竟该如何落地时,已经有行业玩家顺着原有产品线一路延伸,把端侧能力真正接进了自己的产品路径,并率先跑出了规模化市场结果。

重新定义端侧AI,让模型和设备共同进化

今天再聊端侧AI,行业里最常出现的几个关键词依旧很熟悉——

成本、安全、稳定性,以及怎样把一个足够强、又足够小的模型塞进更多的设备。

过去几年,这几乎就是端侧AI最核心的工程题。

但在这家公司看来,在当下这个时间点看这个问题,显得多少有些不够用了。(扎心.jpg)

相较于更习惯从技术本身寻找答案的团队,元空AI会在行业内给出这样一套反常识的判断,其实算不上意外。

△AI生成 外界最早认识这家公司,大概是因为2023年火出圈的AI表格产品ChatExcel。

也就三年时间,ChatExcel就积累了数百万用户,元空AI的产品版图也一路向外延伸——

从 AI DataAgent ,到国内首个对标Claude for Science的 开源OpenAI4S项目 ,再到 元空科研实验室e2Sci.com ,已经逐渐从办公场景走进更复杂的科研工作流。

值得一提的是,作为一款面向科研场景的Agent,元空AI4Science也没有停在查文献、跑分析的能力层,而是进一步把文献检索、数据分析、模型与工具调用一路接到真实实验设备,让AI开始真正参与实验执行。

这也意味着,科研Agent的边界也开始从屏幕里的「信息处理」,开始伸进「真实实验流程」。

也正是因为长期贴着用户的真实使用场景跑,让这个北大团队逐渐看到了模型下一阶段竞争里一个更关键的变量——

大模型从静态互联网数据中攫取的增长红利已经见顶。

下一阶段真正有价值的能力增量,会越来越多来自真实任务、真实环境,以及持续发生的交互。

这听起来多少有些反直觉,但整个行业其实已经陆续亮起预警信号。

△AI生成 今年上半年,斯坦福在《AI Index 2026》报告专门提到了一个词,叫 「Peak Data」 。

简单来说,就是互联网上真正高质量、适合训练的人类生成数据,正在越来越接近被前沿模型吃到头。

更扎心的是,这个趋势已经开始在真实训练实验里露出「迹象」。

此前, Hugging Face 等团队在JMLR发表的一项研究中进行了超过400次模型训练,最大做到9B参数、9000亿训练Token,专门模拟模型反复吃已有数据的情况。

结果发现,已有数据重复到一定程度之后,继续增加训练计算的收益不断下降,最终新增算力带来的价值 趋近于0 。

换句话说,最容易挖的「富矿」被不断抓取、清洗和训练之后,剩下的数据越来越杂。

已经吃过的数据再反复喂,模型也很难一直长个儿。

于是,大模型继续从互联网里挖静态数据疯狂往前scaling law的老路,开始显得有些力不从心了。(doge)

△ JMLR论文《Scaling Data-Constrained Language Models》

问题也随之而来。

既然互联网里的现成数据越来越难继续提供足够大的增量,下一批真构建真实环境的数据,又会从哪里长出来?

元空AI,把答案直接指向了 「设备」 。

换句话说,设备除了是AI能力的载体外,它还有另一个身份: 一个能持续产生稀缺数据的环境。

这个判断听上去有点反常识,但仔细想的话,其实也很合理。

因为在今天这个时间点,模型要想从现实世界里继续学东西,总得先有一个能碰到真实任务、真实环境的入口。

而设备真正特殊的地方,恰好就在于它天然站在「任务发生」的现场。

无论是PC、手机还是机器人,只要AI真正开始干活,就一定会留下三样东西:为什么做、怎么做、最后做成没有。

这和互联网里的静态数据很不一样。

网页可以告诉模型世界是什么样,但真实设备留下的轨迹,却可以告诉模型「事情究竟是怎么被做成的」。

其与真实环境的每一次执行交互,以及最终的成功或失败,其实都会持续沉淀出新的行为轨迹、环境反馈和结果。

而这些,恰恰也是静态互联网数据里最稀缺的那部分。

当这些真实任务里的动作、反馈和结果被重新沉淀进后训练、强化学习或者记忆系统,模型也就有机会从一次次执行里继续修正自己。

于是,端侧AI开始从一条单向链路变成一个循环——

模型做判断,Agent组织行动,设备真正去执行;现实世界给出反馈,结果再重新回到模型并持续进化。

设备由此也从AI能力的「终点」,变成下一轮能力增长的「起点」。

△AI生成 也正是基于这套逻辑,元空AI把对端侧AI的判断压缩成了一条很直给的公式: 生产力=元空端侧AI=模型×Agent×设备 。

而「生产力」,恰恰是这套公式最后要交付的结果。

毕竟对用户来说,模型、Agent和设备再怎么协同,最终都得回答一个很骨感且现实的问题——

一件事儿到底有没有被顺利做完,有没有被稳定持续地做完,以及有没有得到一个可靠的交付结果。

这家做了多年ToC产品的公司,再清楚不过这个道理。

也正因如此,沿着这套逻辑,端侧AI是否真正成立,自然也落到了两个更现实的维度上:

能不能解决真实的生产力问题,以及能不能跨过技术验证阶段,走向面向普通用户的规模化交付。

只有当能力真正进入一台台设备、融进一次次真实任务,并持续产生可验证的结果,端侧AI才算真正从一个技术概念,长成一套可以被用户长期使用的生产力系统。

模型×Agent×设备,端侧AI开始长出真实生产力

行业判断讲得再漂亮,最终还得落到产品上。

既然生产力是端侧AI成立的关键标准,那模型、Agent和设备就必须真正进入任务链路里跑起来。

事实上元空AI这套关于端侧AI的判断,也已经开始从一个行业命题,沿着产品和技术一路长出更具体的落点。

就在几天前,元空AI正式发布端侧模型Boxer,并同步推出元空AI Work与元空AI Science两款Agent产品,模型、Agent和设备,也由此被接进了同一条执行链路。

先来说说其中最底层的一环,面向真实办公场景打造的 端侧模型「Boxer」 。

有意思的是,Boxer从一开始就没有一味追求更大的参数规模,它押注的是一个今天并不算最性感、却很现实的区间: 中尺寸模型 。

之所以把端侧模型落在中尺寸区间,背后其实是一笔很现实的「生产力账」。

模型尺寸最终权衡的,无非两件事: 任务能不能跑得动,以及设备养不养得起。

这有点像给一辆长期使用的车选动力系统。

跑车发动机当然强,但拿去每天通勤并不经济;微型发动机便宜,真碰到长途又不够用,真正适合大多数用户的,往往是中间那段甜点区。

这个道理,在大模型身上同样适用。

10B以下的小模型足够轻,适合聊天和简单调度;200B以上的大模型能力更强,更适合高度开放的复杂问题。

但长期和真实用户、办公场景打交道的元空AI发现,绝大多数高频需求恰恰落在中间地带:

做汇报、处理Excel、设计实验、分析结果,这类任务边界相对明确,却同时考验模型的推理、规划和长链路执行能力。

于是, 20B—100B成为团队最终押注的区间 。

能力足以覆盖复杂工作,资源开销又能压进PC和实验设备真正可部署、可持续运行的范围,绝佳。

△AI生成 当然,这个平衡点到底有没有成立,最终还得回到两件很现实的事情:能力到底够不够顶,设备跑不跑得动。

能力侧,在元空自建的WorkArena评测中,Boxer-35B-A3B-v0-0819拿下73.1分,位列对比组第一,领先第二名10.3分; 部分任务表现甚至超过一年多前的GPT-4o 。

部署侧,在40 TOPS算力、不到8GB内存占用下,Boxer依旧能保留87.3%的原始模型任务效果。

这波算是真·把高阶模型生产力跑到端上了。

模型跑起来只是第一步,真正把生产力组织起来,还需要Agent把理解、规划和执行串成完整流程——

这也正是 元空AI Work 和 元空AI Science 两款Agent产品承担的角色。

具体到办公场景,元空AI Work打通了目标-跨应用执行-结果验证-状态更新-继续工作之间的闭环。

像做表、查数据、写文档、做PPT,甚至处理代码和文件这些需求,用户只需要直接说清楚目标,剩下的步骤由系统自己往下跑。

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗
← 返回最新