下一代Agent天然会走向云端和更大规模的计算资源
“只要哥想重置,哥随时都可以重置”
刚刚,赛博义父、AKA Codex重制额度的神,Tibo在最新一期与Matthew Berman播客节目中自信表示道~
而且最骚的是,为了重置,Tibo已经专门搞了一个实体按钮。
作为现在Codex的负责人,除了介绍怎么给大伙发福利,Tibo在这期播客节目中,更仔细回顾了自己之前的谷歌生涯,并透露了自己和OpenAI现阶段的一些重要工作。
可以说,这是外界少见的一次深入了解这位OpenAI新晋产品负责人的机会。
从OpenAI 产品文化、下一代Agent、GPT究极极速模式(Ultra Fast)再到未来人机交互、OpenAI停止开发前沿模型训练,RSI,几乎是应包尽包,无所不谈……
Tibo的核心观点如下:
- ChatGPT和Codex最终会走向融合。 未来不会有“编程Agent”和“聊天助手”两个产品,而应该是同一个高度个人化的AGI,根据不同人的任务、能力和习惯自动调整界面。
- 下一代Agent的核心,不是再加更多Skill、Memory或子Agent,而是让这些机制“消失”。 用户真正想要的是一个持续理解自己、目标、日常和团队上下文的伙伴,而不是不断管理skill文件、记忆和Agent网络。
- 笔记本电脑会成为AI Agent的新瓶颈,下一代Agent天然会走向云端和更大规模的计算资源。
- 今天同时跑10~15个Agent,是在用并发弥补模型慢;Ultra Fast一旦把响应压到接近人类思考速度,工作流会重新回到实时交互和“心流”,而不是不停切换上下文。
- 不看重竞争。OpenAI对Anthropic的差异化叙事,不是单纯“模型更强”,而是“把最强能力交给尽可能多人”。OpenAI强调广泛分发、社区参与和降低使用门槛,这也是Codex并入ChatGPT的重要原因。
- OpenAI已经在实际使用“递归式自我改进”。 不只是让模型研究模型,更包括让最强模型优化CUDA内核、推理栈和基础设施,形成“更强模型→更高效率→更多算力→更强模型”的飞轮。
(Tibo全名Thibault Sottiaux,来自比利时,本科就读于鲁汶天主教大学(UCLouvain),学习应用数学。2015年,他加入Google,最初参与Google Maps相关工作,随后进入Google DeepMind,负责AI研究基础设施建设,并参与支撑包括AlphaGo在内的前沿 AI 项目。2024年,他加入OpenAI,开始负责Codex项目。随着AI Coding浪潮爆发,Codex迅速成为OpenAI增长最快的产品之一,Tibo也因此进入开发者社区视野。由于他经常亲自回复用户反馈,帮开发者重置Codex使用额度,被网友尊为“赛博义父”。)
以下是对话全文,经整理:
Google与DeepMind的经验
主持人: 太好了,我真的很期待和你聊聊。我想先从你在Google的经历聊起。你当时在DeepMind团队。在ChatGPT出现之前,Google有一个叫作LM Chat的东西。
你曾发帖说,Google太紧张了,不敢发布它;DeepMind也被阻止推出可能冲击Google的产品。我经常想到这件事。当时你在做这些产品,而那是在ChatGPT真正改变世界之前很久,你那时是怎么想的?
Tibo: 那是一段非常令人兴奋的时期。DeepMind是一个很有创造力的地方。
我个人的专长是为加速研究而建设基础设施和产品。当时有一个团队在做语言模型,以及它们的scaling。
后来他们已经取得了相当不错的结果,所以就很自然地想到:能不能把它变成一个可以与你对话、并能用于各种事情的产品?
于是,像LM Chat这样的想法自然就出现了。它起初是内部项目,之后大家产生了把它做成面向公众开放工具的愿景。
主持人: 那是哪一年?
Tibo: 大约是在ChatGPT出现前一年。
Tibo: 此外我们还在做各种其他项目,我就不展开说了。那确实是个非常有创造力的地方。只是DeepMind并不是一个被设计来交付产品的组织;
相比之下,OpenAI在这方面非常不同。我们现在的研究与产品团队协作得极其紧密。
我们一起构思,一起共同设计很多东西。我们非常倾向于把产品推出去,也非常倾向于让人们能够用上它们。我很喜欢这一点。这也是吸引我来到这里的原因:使命、人才,以及人才密度。OpenAI有太多很棒的地方了。
主持人: 你当时参与LM Chat时,是否已经知道它很特别,或者将来会变得很特别?
Tibo: 确实感觉非常特别。那种模型让你第一次意识到:它能够生成连贯的文字,而且能提供一些帮助。一开始,它只是好玩,后面才逐渐变得越来越有用。
主持人: 你说你经常想起那件事,我很能理解。我觉得Google在很多方面是自己绊住了自己。你从那里学到了哪些经验,并把它们带到了OpenAI?
Tibo: 是的,这就是我常常思考它的原因。我会从团队文化以及OpenAI整体文化的角度去想:哪些好的部分要保留,哪些事不该做。
OpenAI的文化非常自下而上,也非常赋能。人们可以提出各种想法,聚在一起,然后非常快地推出东西。对于新产品创意,整体上几乎没有什么阻力。这很令人振奋,也很有趣;一切都是为了积极地影响世界。保留这一点对我来说非常重要。
另一件同样重要的事,是别让它变得一团乱,对吧?你不希望最后堆出一大杂烩:全是新功能,却没有整体方向和一致性。因此,它也需要由简洁感来平衡,并且要为产品质量感到自豪。
我认为ChatGPT的iOS应用是市面上最好的应用之一。我们希望保持这一点。我们在愉悦感、性能、效率和简洁性等方面投入很多。这些是总体原则,同时仍然要赋能每一个人去尝试新事物、快速交付。
打造OpenAI的文化
主持人: 如果要给创业者一些建议,怎样培养出这样的文化?OpenAI内部有哪些更具体的要素或做法,是你会建议创业者借鉴的?
Tibo: 我认为,要有坚定的信念;同时要找到一种方式,既能够贴近用户,又能根据反馈快速迭代。此外,还要愿意颠覆自己。对创业者来说这点或许没那么直接相关,但对OpenAI这样的公司就很相关。
我们不断会有新的研究、新的想法;能够判断什么时候该投入其中,即使这意味着可能要从主营业务中重新调配资源,也极其重要。这很难,但真的非常重要。
主持人: 没错。这正是你刚才描述Google没能做到的事。
Tibo: 有一说一,他们是有计划的,只不过一切都属于一个更大计划的一部分。对我来说,那不是正确的地方。
主持人: 随着OpenAI或任何公司逐渐成熟,要维持这种快速交付、愿意自我颠覆的文化,会不会变得更难?尤其当你已经有一头不断赚钱的现金牛,同时另一边又有个可能很酷、很有创新的新东西时。
Tibo: 我们非常面向未来。AI的未来、它最终会是什么样、人类会怎样从中受益,并不会停下来等待,也不会在意你在接下来一个月或三个月已经建立起来的东西。
因此,我认为非常重要的是要全情投入,并且对它的发展方向保持开放的眼光,再想清楚自己该如何定位,确保你能够抓住那股浪潮。
即便对OpenAI来说也是如此:我们训练模型,然后才发现它们的能力。基准测试并不能告诉你一切。
我们必须亲自花很多时间试用模型,才会意识到:噢,也许我们之前没有想过可以用它以这种特定方式获益,或者,噢,它居然能做这件事。
于是,这会改变我们思考产品的方式。比如现在,我们推出了新的语音功能,它非常令人愉悦,交流起来也很自然。它还能使用工具。
这就改变了很多事。现在我会花更多时间直接跟它说话。还有一件我一直在做的事是语音听写,因为听写的质量非常、非常好;与打字输入提示词相比,这种方式高效得多。
所以早上,我会坐在那里拿着手机说一大段话:“要让ChatGPT做几件事……”然后它就会去完成;它能访问我的所有工具。而在我们有了真正出色的语音模型之前,这并不可能。因此,它会突然彻底改变你对产品的思考方式。
AI Agent的未来
主持人: 好,我们继续聊新模型、新的harness(智能体运行框架)。几周前,我还要从你另一条很精彩的帖子说起:“Codex在两到三个月后会显得很原始。我们即将经历又一次重大演进。下一代模型需要的,不只是你的笔记本电脑。”那么,先从harness开始。随着模型变得更强,harness的哪些方面仍有很大的创新空间?
Tibo: 太多了,真的太多。比如我刚才说的语音。现在,如果你是Codex或其他编程智能体的资深用户,你已经有点习惯那种不够顺畅的感觉了,对吧?
你得管理skill文件;这是一种教它东西的方式,但我认为许多人也意识到,这些文件长期维护起来挺难的。记忆也是个问题:它并不总能记住一切;如果你有子智能体,就得操心子智能体,还得搭建某种小型网络。在与它互动的各个环节,这种“它是一个完整伙伴”的幻觉都会被打破。
你真正想要的,只是一个能深刻理解你、理解你的目标、理解你的日常,也理解你的团队在做什么的东西。理想情况下,它还能做出反应,主动出击,在日常中帮助你,并且不打破那种幻觉:它就是你身边那个完美的小伙伴。这正是我们努力的方向。
另一件事是,当你拥有非常、非常强大的模型时,你会发现笔记本电脑本身也会成为限制。一台笔记本电脑所能承载的工作量,是为人类设计的。
△AI生成
它大致是为了容纳你能产出的工作量、你的打字和思考速度、你需要同时打开多少应用程序而设计的——这些都是人类的限制。
模型没有同样的限制。举例说,模型也许将来能同时处理100个打开的应用程序,而且完全没问题。因此,从资源访问的角度看,很明显,未来的模型需要的资源会超过一台笔记本电脑所能提供的资源。
主持人: 你的意思是,我猜,是云端智能体?而一旦有了我们稍后要谈的Ultra Fast,token速度达到据称比Fast快10到14倍,到时候带宽约束会改变。CPU会成为带宽;从字面上说,工具调用、网络、任何工具以及技术栈中的任何开销,都会成为限制因素。
Tibo: 不过,你也可以通过同时并发地做多件事来补偿。你可以一边探索、一边写测试、同时编译,并且同时验证一个新假设。这样你就在不断转移瓶颈的位置,因为你能够并发处理更多事情,模型也能非常高效、非常快速地思考和推进。
主持人: 以目前的token速度,我发现自己会并行启动10到15个智能体,这给我带来了相当明显的认知负担:要不断切换上下文、不断启动它们,而且你可以预期一个任务要30到45分钟后才会返回。
现在有了Ultra Fast,这个工作流会显著改变;我想我不会再同时开10个或15个智能体,这或许是件好事。可能一次只需要三四个。你认为独立开发者的工作流会如何随时间变化?
Tibo: 我认为,管理你的注意力、让体验更贴合你的注意力,是我们非常重视的事情。
AI如何改变开发者工作流
Tibo: 毕竟,我们是在为人类构建产品。我们希望打造最能赋能人类的技术,这就要求围绕你的多任务处理能力来设计:你希望怎样管理注意力?某件事应当现在呈现给你,还是30分钟后再呈现更好?
而当Ultra Fast的速度与语音结合时,你会突然感觉:好吧,这个东西的运行速度可以和我一样快,甚至更快。
于是你能保持心流、不断构思、看到原型,实时地生成小型报告,那种感觉真的很好。你会突然觉得:对,之前我让10个智能体多任务并行,那种方式我其实并不想再回去了。
所以我们正努力带来那种非常自然、同时又仿佛为你量身打造的体验,你无需去适应它,而是让技术来适应你。
主持人: 过去几个月里,大家讨论了不少智能体式编程技术。Loops曾经很流行,现在仍然流行;如今我又听到graphs。这些技术是否都是为了让独立开发者能够管理注意力,或者像你所说的那样,对注意力更友好?我喜欢这个说法。
Tibo: 我会把问题分为两类。第一类,是构建最好的个人AGI,或者说个人智能体:它能和你一起处于心流之中,主动提出重要的新想法;一旦找到机会,就非常高效地按你的意图做事。
无论是技术问题,还是研究、建议之类的事,它都能完成,而且能高度贴合你。这是非常重要的事情,它深深扎根于对作为人类、作为独特个体的你的理解。我们正在全力推进这一类问题。
另一类问题则是全面自动化:你更多是在构建智能系统,让它们接管一个非常复杂的流程。也许这类流程需要、或者曾经需要智能,并且看上去非常复杂。
举例来说,查看生产日志并自动做性能优化,或者发现回归问题后自动修复。在网络安全里,我们也看到了这种趋势:
比如,有扫描器发现一个漏洞时,能否自动修补它,并把这个漏洞暴露的窗口期缩短到几乎为零,不让人参与那些闭环,或者只让人极少参与;你只需要批准高风险动作,系统主体仍然是自动化的。此时你也不必对它保持那么直接的控制。
主持人: 明白。
ChatGPT与Codex的融合
主持人: 那么,我想稍微换个话题。过去几个月,ChatGPT和Codex一直走在融合的路径上。
我首先想问:这件事进展得怎么样?在内部是什么感受?你从用户那里收到了什么反馈?
Tibo: 它确实带来了很大的助益。起初我们收到的反馈是:“为什么要合并它们?真的必须这么做吗?”但未来的模型要求我们合并。
所以,我们就会这么做,因为这是构建那个极具个人化、能力超强、能以各种方式帮助你的智能体时,最简单、也最正确的做法。
它们的底层会是同一套技术:同一个harness、同一种思路。它高度多模态、语音优先、极其高效;无论你是不是在编程都没关系。这个智能体什么都能做,而且效率极高。
你想要的界面则应当根据你的需求来调整。你不该先决定“我是程序员,所以我要一个程序员界面”,或“我不懂技术,所以我要一个非技术界面”。
人们处于一个连续的光谱上;软件工程师、设计师之类的标签,只是我们为了应对过于复杂的现实而创造的人类概念。
因为说到底,每个人都在那条光谱的不同位置。因此我们要构建一个能为每个人适配的完美界面。无论你懂不懂技术,它都会根据你的具体个性来调整。这就是我们这样做的原因。
主持人: 不过,这是否意味着最终必然会变成一个统一界面?不再有下拉菜单让人选不同产品?想到我妈妈可能会使用和我完全相同的界面,确实很不可思议。
当然,它会按我的需要进行定制。如果我在做更复杂的工作,可能需要更多信息。但对你来说,最终形态是什么?
Tibo: 没错,就是同一件东西。你和你妈妈会使用同一个东西。它会是你们各自的个人AGI。你们会有非常不同的任务、从中获得不同的效用,也会把它连接到生活中不同的工具,带来不同的想法和需求。然后它会持续调整自己,尽可能地让你受益。它也会以同样的方式服务你的朋友和所有其他人。
人机交互的未来
主持人: 我想回到你刚才说的一点。你在描述最终状态时好几次用了“幻觉”这个词。对普通用户来说,那个完美的“幻觉”是什么?如果你设想一下几年后,AI和人类之间的互动会是什么样?
Tibo: 对我而言,它会是一种极其贴合人类的东西。这也是大型语言模型成功的原因:它使用自然语言。自然语言本就是人类的概念,对吧?我们习惯彼此交谈。如果明天你给我写一封信,我就能读懂。我们现在已经相当了解彼此了。所以,如果你给我写一封信,我还能从中解读出一点情绪,或许还有一点字里行间的细微意味。这一切都深植于人性。
因此,我们正在构建的技术根植于人类,也根植于人类沟通与把事情办成的方式。它不该让你说:“哦,你误解我了,因为你没有完全读懂我语气里的微妙含义,或者没有完全理解文字中我真正的意思。”
这正是我们努力避免的。因此,我们非常努力地不让你去适应技术,而是让技术被打造得恰到好处,成为人类原本在世界中行动方式的自然延伸。
主持人: 我想到人与人之间的交流,其中很多是非语言的。比如我手势的方式、面部动作。你认为未来AI会在多大程度上感知到或通过视觉读取这些信息?
这重要吗?因为你现在描述的似乎只是文字。而对我们这些在互联网上长大的人来说,我们很习惯通过文字交流,也会在文字中加入细微的变化,来传递我们真正想表达的语气。不过,AI仍然有必要能读懂我们的面部表情、手势等等吗?
Tibo: 我认为有必要。当我思考我们正在构建的未来时,它会非常环境化,也非常自然。
← 返回最新