编辑|Max

前几天,著名外宾AI应用 Genspark 干了一件以前不太像它会干的事。

它开始自己训模型了。

9 月 10 日,Genspark 发布了一个专门做 PPT 的模型 Gen-1 Slides。底座是 MiniMax M3,训练这件事则找了 Fireworks 一起做。

现在,这个模型已经成了 Genspark AI Slides 标准模式的默认选项。

Genspark 过去一直是很典型的 AI 应用公司。

模型是谁家的不重要,谁好用就用谁。

今天 Claude Opus 4.8强一点,就多调一点 Claude;明天GPT-5.6更便宜,就重新把请求都切过去。

应用公司最擅长的事情,本来就是不对模型公司产生感情。

所以看到 Genspark 自己下场训练模型,我停了一下。

因为这已经不是这个 API 好不好用的问题了。

调 API 不好用,最多改个配置。

自己训练,先得交 GPU 的钱。

行业里夸模型的人很多。

愿意为了这句夸奖,自己买单继续训练的人,就没那么多了。

这也是我后来重新去看 MiniMax 的原因。

PART.01、开源模型准备好了

先说 Genspark 为什么选 M3。

现在开放模型很多,甚至有些模型在榜单上的成绩比 M3 更好。

但还有一个前提:

现在这批开放模型,本身已经跨过了可用线。

放在前几年,应用公司拿到权重以后,可能还得先补 Coding、Agent、长任务这些基础能力。

现在像 M3 这样的模型,底子已经够用了,应用团队才有资格把资源集中到自己的业务上。

但对一家准备继续做后训练的应用公司来说,选基座模型并不是简单从排行榜第一名往下挑。

Genspark 做的是 PPT。

一份复杂 PPT,要读很长的参考资料,规划页面,写代码,调用工具渲染,再自己检查和修改,跑几十轮很正常。

所以它需要的底座, 最好同时具备原生多模态、长上下文、不错的Coding和Agent能力,而且还得开放权重。

M3 基本把这些条件凑齐了。

但我觉得还有一个很现实的原因:

它的模型大小也刚刚好。

M3 大约有 428B 总参数,每个 Token 激活约 23B。

400 多 B 当然不能叫小模型,但放在今天前沿的开放模型里,又没有大到完全脱离应用公司的训练和部署范围。

市面上确实还有一些跑分更高的模型,但模型越大,后面强化学习、部署、推理、持续迭代的成本都会跟着上去。

对模型公司来说,可能更关心谁是最强的。

但对应用公司来说,选基座模型不是找最聪明的那个, 而是在能力、成本和可训练性之间,找性价比最高的那个。

能力已经足够覆盖自己的任务,模型规模又没有大到让后训练失去商业意义。

所以 Genspark 选 M3,我觉得本质上 M3 是在这个区间里找到了一个平衡点。

Genspark 自己也说,因为有 M3 这样的开放底座,他们才能直接跳过预训练,把预算花在 Slides 这件事上。

这句话其实把事情说得很清楚。

应用公司真正需要的,不是再造一个最强基础模型。

而是找到一个已经足够好的模型,然后把有限的钱和工程资源,花在自己真正懂的业务上。

PART.02、为什么要训模型

但有一个合适的底座,不代表 Genspark 就一定要自己训。

真正的问题是 这件事值不值得。

答案首先藏在 Genspark 自己的调用规模里。

Fireworks 披露,Genspark Slides 每个月消耗的 Token 已经超过 1 万亿 。

到了这个量级,模型成本就不再只是技术团队关心的事情了。

哪怕每百万 Token 只便宜一点,乘上每月上万亿 Token 的消耗,最后都会变成一笔很具体的成本。

所以 Genspark 真正要算的是: 如果把最常用、最稳定的一部分任务自己做专项训练,能不能把效果留下来,同时把成本压下去。

他们做了一组测试。

Gen-1 Slides 完成一份 PPT,平均模型调用成本是 0.44 美元 。

而用之前行业主力模型 Opus 5 的成本是 4.16 美元 。

这是接近十倍差距。

这时候,Genspark 为什么愿意自己训,就比较容易理解了。

更重要的是,成本降下来以后,效果并没有明显打折。

Gen-1 Slides 的平均评分是 4.25, 略高于 Opus 5 的 4.23;下载率也达到 33.1%,高于后者的 31.5%。

这时候,Genspark 为什么愿意自己训,就比较容易理解了。

它不需要做一个全面超过所有通用模型的新模型。

它只需要在 PPT 这件高频、稳定、自己又足够熟悉的任务上,做出一个更合适的版本。

效果够好,成本能降,而且还能围绕自己的产品继续迭代,这笔账就开始成立。

PART.03、为什么能训模型

训练过程中,Genspark 遇到过一个很典型的问题。

他们不希望 PPT 里的文字溢出,于是给模型设计了一条规则:文字超过页面边界,就扣分。

模型训练一段时间以后,很快找到了解法:

把字体缩小。

从评测器来看,问题解决得非常漂亮。

文字确实没有溢出。

只是用户也快看不见了。

这个例子其实刚好解释了, 为什么 Genspark 这种应用公司有必要自己参与模型训练。

因为模型公司可以把模型训练得很聪明,却很难替每一个应用定义:到底什么叫把活干好了。

对于 PPT 来说,没有文字溢出只是一个指标。

真正交到用户手里,还要考虑字号能不能看清、信息密度是不是合适、页面结构顺不顺、用户会不会拿到结果以后又自己重做一遍。

这些东西没有一个通用 Benchmark 能完全告诉你。

它们来自产品每天和真实用户打交道。

Genspark 做了这么久 Slides,它手里真正值钱的,不只是调用量,还有大量关于什么结果用户会接受的经验。

哪些错误用户最敏感,哪些问题可以忍,哪些页面看起来没报错但根本不能交付,这些判断,模型公司很难凭空获得。

以前,这些经验主要被用来改 Prompt、改 Workflow、改产品。

现在多了一条路:

把它们变成 Reward、评测器和训练数据,直接参与模型本身的调整。

这也是 Genspark 能参与这次训练的原因。

MiniMax 负责把 M3 的通用能力做好,Fireworks 负责把训练工程跑通,而 Genspark 手里有另一类东西:

真实用户,以及这些年做 PPT 积累下来的产品判断。

它最清楚什么样的 PPT 用户愿意留下,哪些错误会让人直接重做,哪些页面看起来没报错,实际上根本没法交付。

这些东西,模型公司很难凭空知道。

所以应用公司开始训模型,不是因为它们突然更会训练一个通用模型了。

而是当开源基模的能力过线以后, 它们终于可以把原本停留在产品层的经验,继续往模型里压。

说到底,Genspark 不需要比 MiniMax 更懂模型。

它只需要比 MiniMax 更懂 PPT 这门生意。

PART.04、不只是文本模型

看到 Genspark 这次拿 M3 去做后训练,我突然想起了一个月前的 H3。

原始来源PANews 中文文章

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗

免责声明:本文仅用于信息交流,不构成投资建议。数字资产具有高风险,请自行判断。

← 返回最新