海外团队纷纷下注,NeoLab浪潮狂飙

2026年夏天,注定是 自进化AI 的历史一刻。

当海外NeoLab还忙于靠叙事拿下数亿美元融资时,一家中国团队用连续三篇论文,交出了自进化AI领域 第一份 全栈答案。

它就是 EverMind ,由盛大集团孵化,延袭当年创新院研究基因。

其实回顾中国互联网史,盛大创新院的存在几乎算得上 「异类」 。

2008年,陈天桥在盛大集团内部创立该机构,其定位不是做产品、也不追KPI,就是纯粹地探索技术前沿。

这在那个流量为王、变现至上的互联网时代,其实是一种极为罕见的企业内研究文化。

彼时,这种模式在中国企业界几乎是开创性的。

十余年后,时代的底色已经从互联网切换到了AI。

而盛大集团的战略布局,也已经集中到更为前沿的脑科学和人工智能方向——

近三年来, 盛大All in AI ,在原有风险投资体系基础上,通过内部孵化机制在全球范围内广泛吸引顶尖AI人才,陆续孵化出多支专注于不同AI方向的研究型团队。

EverMind,正是其中一支。

如果说盛大创新院开创了中国企业内研究型组织的先河,那么EverMind的出现,则是这一基因在AI时代的延续与升华。

也正因如此,这支团队从一开始便选择了一条在商业上看似“最难”、在技术上却“最根本”的路:

解决AI的长期记忆问题,并在此基础上,探索AI的自进化之路。

放至2026年的AI版图上,这个模式有了一个更为响亮的名字—— NeoLab (新一代AI实验室)。

海外团队纷纷下注,NeoLab浪潮狂飙

NeoLab 这个词,最早是被用来描述那批从OpenAI、Google DeepMind、Meta等顶级AI机构出走、押注前沿技术方向独立创业的研究型团队。

他们的共同特征是: 面向下一代AI技术、研究驱动和长期主义。

2026年,这股浪潮已经汹涌到了无法忽视的程度:

比如,前Salesforce首席科学家Richard Socher与前Meta FAIR科学家总监田渊栋联合创立的 Recursive Superintelligence (RSI)。

其在团队不足30人、尚无任何产品的情况下,拿到了6.5亿美元融资,估值高达46.5亿美元,并随即与AWS签署了4.1亿美元的多年算力合作协议。

DeepMind的AlphaGo之父David Silver带着 Ineffable Intelligence 以51亿美元估值杀入战局。

Engram 以6亿美元估值完成了9800万美元A轮融资, Adaption Labs 以10亿美元估值拿到了5000万美元种子轮, Core Automation 的估值目标直指40亿美元……

这些团队押注的核心命题,都指向同一个方向: 如何让AI在部署后不再是一成不变的静物,而是能够通过自我迭代实现持续进化 。

这个方向,在学术上被称为 递归自我改进 (Recursive Self-Improvement),在产业上被称为 自进化AI (Self-Evolving AI)。

然而,当我们仔细审视这些估值惊人的NeoLab时,会发现他们大多仍停留在单点突破的理论探索阶段:

  • RSI:初步分享了先进的理念和路线设计,但尚未公布具体方案或成果;
  • Engram:专注于参数化权重记忆,但缺乏脚手架层的灵活进化机制;
  • Adaption Labs:主攻推理时适应,但没有长期技能沉淀体系;
  • Core Automation:方向最为接近,但也还没有公开的论文和开源生态。

就在海外团队还在各自的细分领域摸索时,EverMind悄然完成了一件令人瞩目的事:

连续发布三篇重量级论文,从 技能层 、 脚手架层 到 模型权重层 ,系统性地给出了一套完整的自进化AI技术答案。

一次对话,两个入口:当RSI遇上EverMind

在深入这三篇论文之前,有一个细节值得单独记录。

今年四月,EverMind主办了一场名为 “记忆起源” (Memory Origins)的Hackathon活动。

在这场活动上,出现了一位特别的嘉宾——Recursive Superintelligence(RSI)的联合创始人之一, 田渊栋 。

田渊栋在活动上分享了他对AI记忆工作的深度理解,而彼时RSI融资的相关进展尚未披露。

在活动结束后,田渊栋与EverMind负责人 邓亚峰 共同接受了「硅谷创见汇」播客的采访,两人就AI行业的发展走向和记忆相关技术的前景进行了深入对谈。

在这次对话中,邓亚峰提出了一个核心判断,也透露了EverMind技术战略的脉络:

从长期记忆,结合持续学习,走向自我进化是下一代AI的核心技术路线。

这句话值得细细品味。

记忆,是Agent积累经验的 载体 ;自进化,是把经验转化为能力跃升的 路径 。

没有高质量的记忆,自进化就是无源之水;没有自进化作为目标,记忆就只是一个越来越大的档案馆。

EverMind从EverOS(记忆操作系统)到Raven(自进化Agent框架),再到三篇自进化论文所构建的完整技术栈,正是这一判断的系统性实践。

田渊栋与邓亚峰在同一个舞台上的相遇,某种程度上也是一个隐喻:

当海外最顶尖的自进化研究者,与中国最具研究深度的记忆AI团队相遇,他们发现彼此正在从不同的入口,攀登同一座山峰。

为什么「自进化」重要且难?

在深入EverMind的技术细节之前,还需想清楚一件事: 为什么“让AI自我进化”既是必答题,又是一道难题。

传统大语言模型一旦完成训练并部署,能力就被冻结了,不再随使用而增长。可人类智能最迷人的地方恰恰相反——每一次交流、每一次思考,我们都在悄然进化。

下一代AI 也理应如此:能够通过持续学习不断变得更聪明,而不是停在出厂那一刻。

而且这条路正在变得现实。

随着大模型能力的跃升,越来越多的案例表明, “AI自主改进AI” 已经从设想走向可行,在某些环节甚至开始超越人类专家。

一旦AI能够稳定地自我改进,随之而来的很可能是一场生产力的跃迁。

但要真正做到这一点并不容易。业界通常有三条路径,每一条都横着一道难关。

脚手架 (Harness) 的自我改进 ,是第一道关卡。

一个Agent的实际表现,不仅取决于模型本身,更取决于包裹在模型外围的 「脚手架」 ——提示词、注入的知识、运行时控制逻辑等。

让模型自己修改这些代码看似简单,真正的难点却在于如何避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,换个场景就会导致 灾难性崩溃 。

技能 (Skills) 的规模化管理 ,是第二道关卡。

当Agent把成功经验固化为可复用的技能文件,技能数量会爆炸式增长,那么如何管理这些碎片化、冗余、质量参差不齐的技能?又如何在一个数十万量级的技能库中,精准检索出当前任务真正需要的那几个?

这类工程问题长期被学术界忽视,却恰恰是 产品能否落地的关键 。

模型权重 (Weights) 的训练信号分配 ,是第三道关卡。

在最底层的模型训练阶段, 同策略自我蒸馏 (On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。

但传统OPSD在处理长序列推理时,会把相同的监督权重均匀分配给每一个生成步骤,完全忽略了错误发生的时序上下文。这就像长跑时,无论你在起跑摔倒还是在终点前摔倒,教练的惩罚都一模一样。

如此粗颗粒度的信号分配,严重拖累了模型的学习效率。

EverMind的三篇论文 ,正是分别瞄准这三道难关,各自给出了严谨的解法。

HarnessBank:让Agent学会安全改写「脚手架」

在实际部署中,模型权重往往是冻结的, 修改Agent外围的Harness 成为了提升性能的最直接手段。

EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架:

它能够让Agent自主诊断失败并重写自己的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。

这套框架的核心创新在于将 “提出变更” 与 “归因变更” 彻底分离。

在过去的研究中,模型既当运动员又当裁判,自己写代码自己评估,极易产生幻觉式的性能提升。

而在EverMind的方案中,语言模型只负责诊断失败原因并提出补丁(Patch),所有的采样、测量和显著性检验全部交由 确定性的代码逻辑 来控制。

这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。

更有创新性的是其引入的 装备基因库 (Harness Gene Bank, HGB) 机制 。

传统的自进化系统往往以“任务”为键(Key)来存储改进,这极易导致系统只学会了如何解决特定的几道题,换一个场景便原形毕露。

EverMind则将每一份高性能脚手架以 “WHERE × WHY” (改动作用在哪个环节、又是为何被引入)作为语义坐标存档,并支持通过故障诊断进行“重新发明”,或跨单元进行“机制重组”,防止搜索过程陷入崩溃或原地打转。

这种设计引入了强大的 抗过拟合归纳偏置 ——系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。

为了从大量候选后代脚手架中高效挑出真正有效的改进,团队还设计了 分级装备筛选 (Gated Harness Screening)机制,用有效性、激活、配对显著性、增益四道顺序闸门层层过滤,兼顾了评估成本与结果的可信度。

实验结果证明了这一设计的有效性。

团队默认以Qwen3.6-27B作为任务Agent、Claude Opus 4.8作为进化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七个多样化基准上评测,并与GEPA、DGM(Darwin Gödel Machine)两种当前最先进的自进化方法对比。

结果显示,在冻结任务Agent权重的情况下,HarnessBank在全部七个基准上取得了 5.1% 到 15.4% 的一致性能提升。

同时所有增益均通过了配对显著性检验(z≥1.96),证明这些提升在统计意义上绝对可靠,而非测量误差或随机波动。

论文中还有一个极具启发性的发现:

跨模型实验证实,这些性能提升来自 模型特异性的自进化过程 ,而不是存在某个放之四海而皆准的“万能脚手架”。

获胜的补丁追踪的是 模型的主导“病理” ,而不是模型的大小或家族。

也就是说,当你更换一个不同的基础模型时,主导病理会改变,对应的最优脚手架也会随之改变;但同样的病理-补丁匹配关系,会在不同的模型家族中重复出现。

这意味着,EverMind构建的这套 “诊断-归因”循环机制 ,是一种可以跨模型迁移的元能力,证明了AI for AI的技术可行性。

SkillCorpus:10万技能库背后的工程与科学

如果说Harness的自进化赋予了Agent重写逻辑的能力,那么 “技能” (Skills)则是Agent沉淀经验的具体载体。

在EverMind的Raven框架中,内置了高达 10万项 开箱即用的技能。

这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。

随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。

原始来源量子位

原文页面仍是署名、版权归属和后续更新的最终来源。

查看原文 ↗
← 返回最新