TL;DR
如果让你在外围赌一把德扑谁会赢,绝对不要在牌局初期就草草下注。
- 起手牌,美国目前占优。 前沿模型、高端芯片、美元资本、云平台和全球软件入口,构成了美国最整齐的一手牌。如果今天立刻摊牌,美国胜率更高。
- 牌面更新太快,优势不是胜势。 大模型领先窗口正在从稳定的代差,缩短为不断开合的时差。Kimi K3在部分长程代码评测上的局部反超,说明中国看牌、拆牌和重新组合的速度已经大幅加快。
- 算力决定筹码深度,算法重新标注筹码面值。 美国掌握高端芯片、HBM、互联、CUDA和超大集群,拥有更多同时押注、反复试错的机会;中国拿不到同样多的高面值筹码,就设法提高每一枚筹码的购买力。
- 美国扣住底牌,中国扩大牌桌。 OpenAI和Anthropic要把能力领先变成可以反复收费的“模型租金”;中国厂商用低价、开放权重和本地部署换取分发权,争夺云服务、产业部署与开发标准形成的“生态租金”。
- Token价格只是下注额,单位任务成本才对应底池。 便宜离绝杀还很远。真正的较量,是完成同一项工作最后花多少钱。美国守住失败代价最高的关键任务,中国则试图让数量更庞大的普通任务也有资格入池。
- 资本既购买试错权,也启动回报倒计时。 美国私人AI投资规模显著领先,能同时押注更多路线;中国的资本更分散,也更依赖大厂、产业资本和政策力量。双方烧掉的都不只是钱,还有从未来借来的时间。
- 场景多不等于已经成牌。 中国手里不缺带有真实输赢的业务牌谱,但只有交易、履约、质检和设备运行的结果能够回流训练,产业规模才会转化为模型优势。
- 最后还要看谁能控制回撤,并躲过掀桌变量。 就业震荡、诈骗、隐私事故、Agent失控、资本泡沫、封锁升级乃至AGI提前到来,都可能让今天最值钱的筹码重新定价。
序:玩家入座,德州开牌
灯从天花板低低地垂下来,绿呢桌面吸走了四周的冷光,只留下筹码、扑克牌和两双不肯先眨的眼睛。空气里混着咖啡、冷烟、服务器散热和新印钞票的迷幻气味。那是有人准备把未来拿来抵押的味道。
荷官低头洗牌,手指干净,动作温柔。时间总是这样。它替你发牌,却不替你负责。
AI的桌边原本坐过不少人。欧洲拎着监管文件来过,日韩死咬着芯片供应链里的位置,中东把能源和石油资本一摞摞放上桌。但随着盲注上涨,真正还能把前沿模型、超大集群和全球入口一轮轮跟下去的,主要只剩美国和中国。
美国面前的一垛垛筹码垒得像曼哈顿天际线。OpenAI、Anthropic、Google和Meta亮在明处,风头无两;英伟达、云平台、美元资本和全球软件入口压在下面,结结实实。中国的筹码没有那么整齐,却在迅速变厚:DeepSeek、Qwen、Kimi、智谱、MiniMax、阶跃,以及背后的互联网平台、开源社区、国产芯片和庞大应用市场,已经厚实到让对手不能再按照旧赔率悠闲下注。
荷官无言,翻开牌面,上面用水性光油赫然写着:大模型。
ChatGPT问世时确实震撼,但最初进入用户生活,或许也只是一个更加聪明的Siri。人们让它写诗、编故事、解释量子力学,也把它一本正经的胡说八道截成图片四处转发。仅仅几年过去,那个聊天框已经不知不觉钻进搜索、编程、办公、客服和研究流程。
它真真切切地开始接管工作,或者说,生产力。
一、前沿模型能力:先看牌面,再看能不能成牌
不管是打德州还是其他牌局,都有一个很朴素的道理: 抽到大牌不等于赢。 因为大牌距离成牌仍是山高路远。
A和K拿在手里当然气势逼人,但翻牌如果毫无关联,它们暂时也只是一张A高。相反,两张不起眼的小牌,一旦和公共牌接上,反而可能暗度陈仓,连成顺子。
大模型正是这张起手牌。
1. 先看牌面:美国牌大,中国已坐进前排
不同Benchmarks测量的是不同能力,不能直接混成一个总分。但把截至2026年7月17日的几张核心榜单铺开来看,仍能看出当前牌桌的大致形状。
大牌越来越多,但还没有一张牌能够通吃。
如果只看最强模型,美国仍然握着更大的起手牌。Anthropic、OpenAI、Google、xAI与Meta构成了一整排前沿模型堡垒,能够在通用推理、Coding、多模态和Agent之间轮番领跑。美国的优势不是某家公司偶然冲上榜首,而是前沿模型供给的整体厚度。
但今天发布的Kimi K3显著缩小了中国与最大牌面的距离。第三方Artificial Analysis给K3打出57分,位列综合智能榜第4,与Claude Fable 5约60分、GPT-5.6 Sol约59分之间只差两三分。中国模型由此开始贴近全球综合能力上限。
Coding则是K3打得最漂亮的一张牌 。在公开的同组测试中,K3的Program Bench为77.8分,略高于GPT-5.6 Sol的77.6分;SWE Marathon为42.0分,高于Sol的39.0分;Terminal-Bench 2.1则以88.3分紧贴Sol的88.8分。在由用户盲选作品的Frontend Code Arena中,K3又以1679分登顶,并在七个前端细分领域中的六个排名第一。
牌面因此发生了变化。美国仍掌握综合能力、通用体验和系统化Agent能力的上限,但中国已经能够在Coding这张高价值公共牌上赢下几手。
中美前沿模型的竞争,正在从全面追赶转向局部互有胜负。
2. 牌局节奏:代差正在变成时差
Benchmarks依旧重要,但它逐渐没那么重要了。
关键在于,它越来越只能告诉我们牌桌在这一秒的定格照是什么样子,却很难告诉我们几周以后谁还能笑傲榜首。
模型迭代较慢时,一次领先往往意味着半年乃至更长时间的代差。那时,榜单高分不只是一张漂亮成绩单,也代表一条足够宽的技术护城河。26年3月,斯坦福《2026 AI Index》显示,美国头部模型已挤进不到25个Arena Elo分的狭窄区间,Qwen和DeepSeek也进入前沿区域;自2025年以来,中美模型多次交换位置,到2026年3月,双方顶尖模型的公开性能差距约为2.7%。
所以,benchmark正在失去的不是测量能力,而是预测终局的能力。
“中美大模型只差三个月”,正是在这种背景下出现的说法。这其实并不是中国在所有方向上固定落后美国三个月,而是双方的竞争正从相对稳定的“代差”,变成不断开合的“时差”。月之暗面从6月12日发布代码专项模型K2.7 Code,到7月17日推出旗舰K3,中间只隔了35天。代码、数学、多模态、Agent与真实产品体验各走各的钟,有的相隔几个月,有时则只剩几周。
让追赶进一步提速的,还有蒸馏。学生模型不需要看到教师模型的参数,只需大量学习其回答、代码方案和工具使用方式,就可能沿着对方已经走通的路,更快掌握部分判断路径。蒸馏本身是常见技术;争议只在于,竞争者是否未经许可大规模调用另一家商业模型。
2026年6月,Anthropic致信美国参议员,指控与阿里巴巴及Qwen团队有关的操作者通过近2.5万个虚假账户,与Claude进行约2880万次交互,试图提取其Agent推理、软件工程和长程任务能力。相关说法来自Anthropic,仍应与独立调查结论区分。但它至少揭示了一件事:美国前沿模型公司已经不再只把参数、芯片和训练代码视为战略资产,连模型生成的答案,也开始被视为可能泄露能力的出口。
美国仍在更频繁地打出新牌,中国看牌、拆牌和重新组合的速度却已经远快于过去。榜首变成了一项短期行动权,而不再天然等于长期胜势。
二、重算胜率:算力、算法、数据和人才如何改变牌面
树欲静而风不止,牌欲静而心不止。
一个玩家明明拿着更好的牌,却可能筹码太浅、信息不足,或者根本没有看懂对手的范围而落败;另一个玩家起手稍弱,只要能以更低代价多看几轮,也可能把胜率一点点扳回来。
算力、算法、数据和人才,合起来决定的正是这部分尚未兑现的胜率。它们决定一家AI公司能尝试多少条路线、一次试错有多贵、经验能否留存,以及下一轮模型更新后还能不能再次坐上牌桌。
1. 算力:美国控制最高面值,中国争夺经济可用
相比基模这张起手牌,算力才是美国手中真正的金筹码。牌不好还可以等下一张公共牌,筹码断了,就很难继续坐在桌边。
美国掌握着高端AI算力的铸造权:英伟达定义加速器、互联和软件栈,台积电承担先进制造,日韩企业供应HBM,云厂商再把数万颗芯片组织成训练集群。芯片、网络、存储、供电和CUDA彼此咬合,前沿竞争早已不是比较单卡跑分,而是看一座“AI工厂”能否把数万颗芯片拧成一个整体。
中国已经越过“有没有国产AI芯片”的门槛。华为CloudMatrix把昇腾、鲲鹏、网络和软件组织成统一系统,并用于DeepSeek模型训练与推理。真正还要跨过的,是从“能够运行”走向“经济实用”:芯片要供得上、连得稳、调得动;模型迁移不能付出无法接受的工程代价;万卡集群运行一个月,也不能让大部分时间被通信、故障和兼容问题吃掉。
有效算力比芯片数量更诚实。 理论算力要经过内存带宽、节点通信、软件算子、故障与利用率的层层折损。一万张卡写在纸上气势惊人,真正连续用于训练的能力却可能远低于简单相乘。美国的优势,是芯片、HBM、互联和软件已经围绕同一种训练需求共同优化;中国的难处,是每补上一环,瓶颈就可能立刻转移到下一环。
一旦中国跨不过“经济实用”这道门槛,美国就能把筹码优势不断映射到模型胜率;一旦跨过,出口管制仍会增加成本,却很难再让中国离桌。
2. 算法与工程:DeepSeek重新标注筹码面值
德州扑克里,筹码越多当然越有优势。但倘若对方能把你手里10000面值的筹码抹去两个零,场上的购买力就会被重新计算。
中国就曾经打出过这样一张技惊四座的牌,DeepSeek。
DeepSeek-V3技术报告给出了一张罕见的明细账:最终一次完整训练约使用278.8万H800 GPU小时。这个数字没有计算前期探索、失败实验、硬件采购和基础设施,因此“只花约600万美元训练出前沿模型”省略了大半张账单。但它仍然震动行业,因为它撕开了一条被许多人视为常识的旧赔率:模型能力与算力投入之间,并不存在一成不变的汇率。
V3采用MoE架构,每个token只激活部分参数;多头潜在注意力压缩缓存,FP8训练降低计算与通信成本,负载均衡减少专家闲置。R1又把效率推进到后训练阶段:在数学、代码等结果可验证的任务上,模型通过强化学习反复试错,把一部分昂贵的人工推理示范换成可自动判定的奖励信号。也就是说,DeepSeek没有凭空获得更多芯片,它重新使芯片更高效地工作。
美国仍然更擅长探索新路线。Transformer、Scaling Law、RLHF及多种Agent框架,大多首先由美国研究机构和企业推向前沿;更深的资本池,也允许实验室同时押注多条尚未证实的方向。中国过去更强的是复现、压缩和工程优化。DeepSeek之后,这条边界开始松动:中国团队不再只是把别人的路线做得更便宜,也开始提出足以改写行业成本预期的方法。
不过,算法红利不会永久替代硬件。论文会扩散,领先模型也会吸收同样技巧;效率提高还会刺激更多调用,让省下来的算力很快被新需求吃掉。牌手学会了更精确地控制下注,盲注却也在继续上涨。
所以,工程效率对中国的战略价值,更多的是可以用有限算力增加实验次数、缩短验证周期,并为国产硬件成熟争取时间。
3. 数据:带着结果的数据正在升值,而美国目前占优
职业牌手复盘,自然不会只记录自己拿到了A还是K。他要保存完整行动:谁先下注,转牌圈如何加注,公共牌怎样变化,对手最后亮出什么,自己的判断又错在哪里。
数据之于模型,正是如此。
早期大模型主要从公开互联网学习语言、知识和代码,美国依靠英文网页、GitHub、论文出版与全球数字平台获得先发优势。随着高质量公开语料被反复使用,真正稀缺的已经不只是模型没读过的文本,而是那些带有明确结果、能够判断任务成败的数据。
一段客服对话的价值,不只在于客服说了什么,还在于问题是否解决;一段程序代码的价值,不只在于它看起来是否合理,还在于修改后能否通过测试。不能指向结果的数据,更多只是噪音。
2026年初,阿里为编程Agent Qoder训练定制版Qwen-Coder,把真实软件任务、产品环境和工程奖励引入训练。阿里披露,迭代后代码线上保留率提高3.85%,工具异常率下降61.5%,token消耗减少14.5%。数字来自厂商,仍待外部验证,但它点破了专业数据最昂贵的部分:不是那段文本,而是文本背后一个可以核验的结果。
美国拥有更广泛的反馈入口。ChatGPT、Claude、Gemini、GitHub和办公套件连接全球消费者、开发者与企业,模型公司可以观察用户在哪里修改答案、程序员保留哪些代码、Agent在哪一步失败。
中国的机会则在更密集的业务过程。字节的短视频与广告,美团的外卖和配送,阿里的电商与履约,新能源汽车的智驾,工厂的质检与设备运行,每一条链路都带着真实输赢。
中国真正缺少的,是高质量的完整牌谱。 大量产业数据仍被切在不同企业、部门和地方系统中。只有任务可以标准化、结果可以验证、数据能在合规条件下流动,业务痕迹才会变成模型资产。场景多只是原料多,能不能形成“模型执行、现实反馈、结果回流”的短链条,才决定下一轮训练吃到的是营养,还是一仓库无法清点的旧牌。
4. 人才:中国是人才上游,美国则是人才放大器
前几轮牌局里,中美之间的竞争看起来总是由一个个科技公司下场出面。美国这一边,出 OpenAI、Anthropic、Google、Meta;中国这一边,就出 DeepSeek、智谱、月之暗面、阿里、字节。
科技公司发布模型、囤积算力、争夺用户,也代表各自国家在牌桌上不断“出战”。但公司终究只是大国竞争在商业世界中的载体。真正决定一家公司能读懂什么牌、敢押哪条路线,又能不能把一次领先延续下去的,仍然是组织背后的人才。
人才可以是提出新架构的研究者,是搭建训练系统的工程师,也可以是把模型推向市场的产品团队。倘若范围扩大些,还可以包含持续为整个大模型体系培养、输送新人的大学、实验室和竞赛体系。
大模型的成功常被讲成某位科学家的一次灵光,这是一种具有造神倾向的谬误。就像职业德扑虽然由一个人坐在桌前,顶尖牌手背后却有教练、Solver、手牌数据库、体能管理和长期资金管理。真正稳定的优势、胜势,不只来自某一次神来之笔,而来自一整套持续复盘与纠错系统。
AI 公司也是如此。顶尖研究者可以对一条路线是否值得下注做决策,但背后数百名系统工程师会投入进计算损耗、处理故障,并把一次偶然成功变成能够反复复制的训练和产品。
大国人才竞争,本质还是对比谁能提供一张更值得坐下来的牌桌。顶尖研究者会选择薪资更多、算力更深、同伴更强、问题更重要,也更允许失败的地方。美国长期吸引全球高手,靠的正是这种“牌桌选择权”。
这张表最吊诡的地方在于:中国并不是没有人才。恰恰相反,中国已经是全球顶尖 AI 人才最重要的上游之一。问题在于,许多人才完成早期训练后,最终接入的是美国的放大器。
美国大模型优势不是一个封闭体系自给自足的结果。它更像一台巨大的全球人才离心机:把中国、印度、欧洲和世界各地最聪明的一批年轻人吸入美国博士体系,再送进 Stanford、MIT、Berkeley、CMU的顶级实验室,最后输送进 OpenAI、Anthropic、Google DeepMind、Meta、Microsoft、NVIDIA 等公司。
大学仍然提供方法、论文和人才,但真正能把方法放大到万卡集群、全球产品和商业收入里的主体,已经越来越集中到企业。Stanford AI Index 的统计也显示,重要前沿模型的发布主体已经高度产业化。大学负责发明牌型,企业则掌握了真正的大额牌桌。
中国的牌不完全一样。中国优势不在于少数明星一定更多,而在更大的工程人才池、更短的责任链和更贴近产业现场的任务密度。
这种工程队伍的价值,只有在大模型进入复杂系统后才真正显现。前沿模型需要少数顶尖科学家,但模型落地需要成百上千名系统工程师、数据工程师、推理优化工程师、芯片适配工程师和产品团队。美国擅长把少数顶尖人才推到能力边界,中国更擅长把大量工程师铺进产业现场。前者适合冲击通用能力上限,后者适合快速改造、部署和交付。
这也是 DeepSeek、月之暗面等公司给中国大模型叙事带来的变化。它们证明中国公司可以用另一种组织方式参与牌局:更紧的团队、更短的反馈链、更强的工程压缩能力,以及让年轻人更快进入核心任务的空间。
或许,中美大模型牌局真正的胜负不在现在,取决于下一代的学霸们从北京、上海、广州等地出发时,他会把哪个地点视为自己的主场。 是飞向硅谷,接入美国的超级放大器;还是留在中国,在一张正在扩建的新牌桌上,把国产模型、芯片、系统和产业场景连成闭环。
三、牌路打法:美国占领制高点,中国农村包围城市
当模型领先从代差压缩成时差,问题就不再只是“谁先打出一张大牌”,而是这张牌能不能被转化成长期优势。
1. 美国守住底牌,是为了证明定价权
OpenAI、Anthropic和Google把最强模型留在订阅产品、API和云平台。开发者可以调用,却不能下载完整权重、自由修改或绕开平台部署。
闭源首先是一种定价策略。
OpenAI与Anthropic无论何时进入公开市场,都要面对硅谷和华尔街的定价逻辑。资本市场不会长期为一次benchmark登顶付费,更关心收入、留存、毛利和议价能力。只有控制最先进模型的入口,它们才能对每次调用、每个订阅用户和每份企业合同收费,把暂时领先变成可以反复出售的资产。
这两家公司承担的是芯片、数据中心和能源的重资产成本,却希望获得软件平台的估值。如果权重完全开放,云厂商和应用公司可以迅速托管、包装和降价,基础模型就可能变成同质化原料。训练者承担最重的风险,利润却流向算力和入口。
所以,美国守住的不只是技术秘密,也是模型租金。API、Agent框架、企业权限、数据连接和安全审计,都在模型外围增加锁定层。客户接得越深,迁移成本越高,暂时领先才越可能穿过下一次榜单洗牌。
2. 中国公开部分牌路,是为了换取分发权
今天,习近平在WAIC(世界人工智能大会)上提出坚持开放共赢,鼓励开源开放、合作共享,并把帮助全球南方国家加强能力建设、弥合数智鸿沟列为全球人工智能治理的重要方向。同日发布的大会主席声明进一步提出,应当以负责任的方式共建开源生态,在尊重企业自主选择和知识产权保护的前提下,提高人工智能技术与服务的可及性。
多数中国模型公司没有ChatGPT、Google和Workspace此类的全球入口。故而把大模型锁在自己的平台里,未必能像硅谷模式一样换得来高利润。
因此,开放权重首先是一种分发手段。
DeepSeek、Qwen、GLM和用可下载权重、低价API、接口兼容和本地部署争夺开发者。今天发布的Kimi K3,更是把这条路线推到了“慷慨”的极致:总参数2.8万亿,原生支持视觉,最高上下文达到100万token。月之暗面称它是首个开放的3T级模型,并承诺在7月27日前放出完整权重。
中国允许别人拿走自己手里的这副牌,自行观摩、摸索,让更多国家拥有另一套不必完全依附美国API的技术选项。这就是“农村包围城市”的逻辑:不先争夺最昂贵、最封闭的中心市场,而是用开放权重、低价API和硬件适配,进入数量更多、预算更紧、数据不愿出域的场景。
对许多发展中国家而言,最重要的未必是模型在排行榜上多赢两分。它们更关心模型能否支持本地语言,数据是否必须离境,价格是否可以承受,能否部署在本国服务器,以及供应商会不会因为地缘政治变化突然切断服务。
习近平在讲话中宣布,未来5年中国将面向发展中国家提供5000个人工智能专题研修培训名额,面向东盟、阿盟、非盟、拉共体、上合组织和金砖国家建设国际人工智能应用合作中心,并推动气象智能预警方案在30个国家落地。世界人工智能合作组织也在上海宣告成立。
由此,中国正在形成三层相互配合的分发体系。
免责声明:本文仅用于信息交流,不构成投资建议。数字资产具有高风险,请自行判断。
