主持人: 大家好,我叫 Rocky,欢迎来到 AGI House。这场峰会围绕一个问题展开:当 AI 开始自己做研究,会发生什么?我们的下一位嘉宾并不是在空想那个未来,而是把自己的公司押在了它上面。他在 OpenAI 待了七年,带领团队教会语言模型"思考"——o1、o3,以及 GPT-5 内部的推理能力。在那之前,他是 Codex(GitHub Copilot 背后的模型)的核心贡献者;再往前,他教会一只机械手解开魔方。今年一月,他离开了 AI 领域最有影响力的研究岗位之一;四月,他创办了 Core Automation,目标非常明确——打造世界上自动化程度最高的 AI 实验室。有请 Jerry Tworek。

Jerry: 非常感谢,谢谢邀请我,很高兴来到这里。

主持人: 太好了。那我们就直接进入正题吧,这是一场���术同行之间的对谈。我很想听听你对 AI 前沿现状的诸多判断。你在阿姆斯特丹做了五年量化交易,从充满噪声的期货市场里提取信号。交易教会了你什么大多数 ML 研究者永远学不到的东西?我想这是第一个问题。

Jerry: 这是个好问题。我觉得有些技能、有些必备的东西是可以迁移过来的。交易教给我关于机器学习研究最重要的一点,是对自己的算法保持偏执,以及找 bug 的能力。当你实现一个交易算法时,它和 ML 有点像——你在写一段管理一大堆数字的代码,输入好、输出就好。但一旦哪里出了错,你通常只是在最后拿到一个错误的数字。而那个数字可能意味着你该卖的时候买了,或者拿一大笔钱做错了事。所以要做一个好交易员,你必须极其透彻地理解自己的算法,知道它是否运转良好、是否在做你想让它做的事——因为你最终看到的输出,只是盈亏(P&L)。

我刚开始做 AI 研究时,对网络内部、学习算法、超参数里发生的一切都非常偏执。我总是反复核对两遍三遍,确保我知道到底在发生什么,确保算法在精确地做我想做的事——因为我以前的算法可是在交易巨额资金。这在很多方面是做好 AI 研究的一种"超能力"。这也是我想推荐给每一位当代 AI 研究者的一点:在这个 AI 研究已经高度自动化、模型能替你做很多事的时代,你没有办法把"理解"外包出去。所以搞清楚盒子里到底装了什么,是非常有价值的。

主持人: 明白。巧的是,我们确实观察到很多优秀研究者来自交易背景。你要是记得那家公司 DeepSeek——我觉得整个公司差不多就是那个圈子出来的,现在他们在做那样的事。上次我们办 AGI 晚宴系列,Google Gemini 的一位共同负责人 Oriol Vinyals 也来了,我们聊到——其实是我们一位嘉宾提问——他也是交易背景。他们有一个清晰的目标:最大化收益。这种设定是不是恰好为研究者创造了做实验、做研究的好环境?

Jerry: 是的是的,我觉得交易是个很好的环境。当然世界上没有完美的环境,每个环境都有它的好处和坏处。对交易来说,信噪比相对较低,再加上 RL 的样本低效性,确实带来了一些挑战;另一个是反馈往往不够快,有时你得等一等。但除此之外,我觉得已经有些人非常成功地把强化学习应用到了研究上。某种意义上这就是我 2018 年做的决定:我是要去 AI 实验室,尝试把 AI 应用到编程、用于做研究;还是要把强化学习应用到交易上?我选择了加入 AI 实验室。我很可能本会是最早把强化学习用于交易的人之一——但从当前的技术状态看,那确实也成了一个非常成功的领域。

主持人: 是的,我们都看到了。你曾说自己骨子里是个数学家。在如今的前沿研究里,数学品味到底体现在哪?

Jerry: 很大程度上是从第一性原理去思考。某种意义上,数学是抽象的语言——至少是人类数学运作的方式。我觉得当模型接管这个领域时(这大概很快就会发生),数学会变得非常不同,因为模型有能力在"脑子里"、在它们的注意力范围内同时操作多得多的对象。但人类数学家做的事,本质上是搭建一座座抽象的高塔,好让自己能相对轻松地谈论复杂的对象。而且在数学里,一切都必须完全形式化,一切都必须严丝合缝,所有论证都必须可检验、可验证,遵循逻辑规则。数学就是关于如何遵循逻辑规则、去构造越来越抽象的对象。

某种意义上,这让你能对机器学习研究有一个很好的鸟瞰视角:我们到底在计算什么?我们是怎么计算的?如果你能围绕它建立一个好的抽象,并开始操作这个抽象,我觉得这是一个非常强大的领域,能帮你开始理解——为什么我们的模型能做某些事、不能做某些事,实际的循环是什么,输入是什么,输出是什么。所有这些在某种意义上都是数学对象,是我们可以不断操作、不断建立理解的。

主持人: 酷。这又回到了根子上——数学在这件事上仍然非常非常有用。我们来聊聊你在 OpenAI 做的核心工作之一。你启动了 OpenAI 在代码上做训练的研究,是 Codex 的核心贡献者。为什么代码是你当时着手的第一个垂直领域?是因为数据、可验证性,还是你当时看到了别的什么?

Jerry: 好问题。回头看,这在 2021 年似乎是个非常正确的决定。但你得理解当时这个领域处于什么阶段。那是 GPT-2 刚训练出来、刚呈现给世界的时刻。当时还有一整套叙事说 GPT-2"太强大以至于不能发布",人们对它感到担忧。今天的开源权重模型比 GPT-2 强大成千上万乃至上百万倍,但当时那至少是个值得讨论的话题。可 GPT-2 是什么呢?如果你看那个模型,它能写出几句连贯的话,差不多就到此为止了,这就是它的极限。然后 OpenAI 内部开始看到 GPT-3 以及它能做什么——瞧,它能做少样本提示(few-shot prompting),这在当时是另一项感觉相当突破性的技术,不过从今天的视角看也没那么了不起。

当时 OpenAI 有一种氛围,是对新技术进展的兴奋——模型能做到我们以前做不到的事。但我内心有一个固有的信念:这些模型太"模糊"了。当它们生成几句话时,我们怎么知道这些话有没有意义?模型到底是真的聪明,还是只是随机鹦鹉、把训练数据反刍出来?它们是在全世界的数据上训练的,每个人都想尽可能多地塞训练数据进去,然后模型给你写几句话,你根本不知道自己是不是真的触到了某些有意思的思考,模型是不是想出了什么新东西,还是只是从数据里冒出来的。

所以,去教模型写程序、去评估模型写程序,某种意义上是一种"钉住"模型的方式。我们最开始是从"衡量"入手——我们的第一篇论文,我记得叫《评估大语言模型写代码的能力》。它的出发点就是:我们必须搞清楚它们能不能推理。如果它们能推理、能想出有意思的程序……我觉得可验证性正是"钉住"模型、看它们到底懂不懂自己在做什么的关键。因为某种意义上,你没法在不理解概念的情况下写出一个正确的程序。围着一个话题绕来绕去、说些天花乱坠的话总是容易的,但要写出一个真正正确的程序则非常难。所以我觉得这是最主要的一点。

那时我们也已经在看各种 scaling law。之后我们开始研究测试时算力(test-time compute)——它是怎么 scale 的,模型规模又如何随理解能力 scale。我们当时能生成一整套多少算是分布外(out of distribution)的问题,我很确定之前没人想到过那样的东西,然后去衡量这些模型的表现。从那个角度看,至少对我而言,我对大语言模型如何思考、如何解决问题的很多理解,都来自那段时期、那个时代。

主持人: 是的,我们这儿还记得——有家叫 Cursor 的公司就是建在这上面的,大概是 2023 年底。我��在这儿办过一场黑客松,一些做主办的人发现了这个方向。当时我们都觉得编程还是个很"玩具"的应用,大家都在怀疑它到底行不行。而你们已经领先三年,把它做成了。

Jerry: 是啊,很多东西在它真正推出之前,外界是看不见 OpenAI 在做什么的。但没错,其中一些正是我们那时开始做的。

主持人: 那回到关于 HumanEval(人类评估正确性基准)的问题。你觉得过去五年的进展里,有多少是"拥有可验证奖励"这件事的下游产物?

Jerry: 我心里的看法——我可能会说得有点"辣"——我觉得 evals 的时代已经结束了。

主持人: 它已经没意义了,好。

Jerry: 我觉得 evals 现在已经不再有意义了。但它们确实在相当长一段时间里很重要,有一阵子它们是进步的主要驱动力。一部分原因是当时它们还没被"刷分"刷得太狠,另一部分是模型当时还不太擅长做 eval 那类问题。

主持人: 比如 HumanEval——就是我和 Vixa 俩人坐在房间里,各自写了大概 30 道题。

Jerry: 对,我当时就是想看看模型在这类问题上表现如何,这是我们实验、我们建立理解的一部分。然后我们看到越来越好的模型、越来越好的推理技巧能不断把这些模型的分数提上去。我觉得 HumanEval 有过一���"黄金时代",持续了一两年,也许三年,我很难说准。但到了今天,有了推理模型,尤其是 RL 已经到了它的高峰,大家都能几乎随心所欲地构建环境,加上那些能让你投入海量算力的训练框架,再加上相当不错的基座模型——几乎任何你想要的任务,你都能塞进模型里。几乎每一个 eval 都会立刻被"刷爆"。你看那些模型基准,有时一个基准发布时是 50%——那基本上就是它这辈子最低的分数了——然后它会冲到 90%。我们只用了两三代模型。我们生活在这样一个世界里:无论你有什么基准,你都会把它刷满,因为存在一套算法、一个循环去做这件事,你就是能做到。

所以我觉得,现实地讲,evals 已经不再是看待模型的正确方式了。我们需要更多地从一个"连续过程"的视角来看模型。Eval 是某个单一时间点上的东西——这个模型在此刻能不能做到某件事。

主持人: 但现在的问题很大程度上关乎模型的"改进"。模型从今天到明天、到下个月是怎么变化的?因为我们知道模型还没有替我们做完所有事,但它们在成长,而这个成长的方向也是被实验室里的人引导的——他们在琢磨人们最想要什么、我们该把注意力引向哪里。可现在没有任何单一的 eval 能真正讲出一个好故事,它顶多告诉你:这个特定的 eval 在训练模型的人心里占了多大分量。

主持人: 完全同意。但现在,持续学习(continual learning)——你需要模型能自我改进——是下一个前沿,对吧?可这又绕回到:你怎么知道模型在改进?你仍然需要某种验证机制、评估机制,对吧?你怎么看?

Jerry: 我怎么看——这是个好问题——又回到了交易。

主持人: 也就是你怎么评估交易算法。

Jerry: 你总是要做回测(back test),然后再做真实世界测试。这两件事对于真正验证一个算法都是必需的。回测怎么做?你选过去的某个日期,用那个日期之前的旧数据训练模型,然后在模型训练时从未见过的、全新的数据上测试它。这在很多方面是衡量你的模型是否具备某种泛化能力——泛化到新数据、新时间——的最好方式。这种因果性、这个"时间之箭"在这方面非常非常重要。

我觉得,同样地,在处理 LLM 时,我们需要能拿到一些过去的数据,然后设法搞清楚:我们如何适应来自未来的数据——那里可能存在分布漂移、可能存在差异。做交易时你必须极其小心,绝不能把任何关于未来的信息泄露进训练数据里。每个交易员都犯过这个错:以为自己有个好算法,然后才意识到自己不知怎么泄露了未来信息。有些泄露可能非常诡异、非常非常难以预料。

接下来就是真实世界测试:你用所有数据训练模型,把它部署到真实世界,然后看模型在未来的表现如何、明天的表现如何。所以对我来说,"过程式评估"就是:你真的把模型部署到真实世界场景里,然后观察——你可以做实时 A/B 测试,这个模型还是那个模型,哪个明天表现更好、哪个爬升得更快。唯一的测试就是真实世界,唯一真正的度量,就是用这些模型去自动化实际工作。

主持人: 拥有真实世界的反馈。酷。那下一个问题:Copilot 可以说是第一个大众市场的 LLM 产品。这次部署教会了你哪些基准测试给不了的东西——就真实世界反馈而言?

Jerry: 我觉得有一个主要答案,非常真实但也相当"无聊":真实世界和 eval 不是一回事。你可以有很多 eval,但一旦你部署产品,你就会开始意识到——有些改进 eval 的方法并不改进产品,有些改进产品的方法在 eval 里根本量不出来。我们做过很多提升模型的工作,把它们发给微软,微软说"哦,我们的用户不在乎这个"。所以每当你真的想给世界提供有用性时,你必须开始思考:我怎么衡量这种有用性?怎么确保我们造的是人们真正需要的模型?这涉及延迟、性能(比如速度)、推理的深度、用例的类型。很快我们就开始做诸如"脚手架工程"(harness engineering)之类的事,因为你逐渐意识到,训练模型很慢,而围绕它你可以构建很多东西,你可以用一套 harness 把 GitHub Copilot 做得更好——这些东西会在很多方面产生复利效应。

主持人: 完全同意。上个月我在这儿请到了 Sergey,我们有一场很有意思的对话,聊 Google 怎么训练编程 agent。他问了个问题:GitHub 上的代码是否是正确的训练数据?我反问他:你们把 Google 整个代码库都拿去训练了吗?他没给出答案。

Jerry: 会担心的(笑)。

主持人: 正是。那么下一个问题,关于你 2021 年那篇在数学应用题上做验证器(verifier)的论文——现在看来简直是测试时算力的种子。你在这些方向上做了太多开创性工作。请带我们走一遍那个思想跃迁:从"训练一个验证器去给样本排序",到"直接在思维链(chain of thought)上运行"。当 o1 在"思考"时,它内部到底发生了什么?我觉得大家都非常好奇,我们能看到那些痕迹,但很想从第一性原理听你讲讲,你是怎么想通这些、让它奏效的。

Jerry: 是的是的。scaling RL 这个梦想在 OpenAI 陪伴了我们非常非常久。我加入 OpenAI 就是因为我想做强化学习。我参加的最早几次研究全员会上,Ilya Sutskever 站在台上说:我们的研究路线图是训练一个大型生成模型,然后用它做强化学习。这话极其精准——这正是七年后我们今天在做的事。他看到了��他知道这就是计划。但那时我们并不知道要训练什么样的生成模型,也不知道怎么做强化学习、算法是什么。当时 PPO 正当红,我们做了大量 PPO,主要是在数据和机器人上。

我们花了好一阵子才走到今天,其中很大一部分关乎算法,也有一部分关乎信念(conviction)。很多时候我们想扩大 RL 的规模,但总有个问题:GPU 从哪儿来?分配多少 GPU?和 OpenAI 领导层的很多讨论都是——"给我们点证据,确保这真的值得,因为我们本可以用这些 GPU 训练 GPT-4、GPT-5,为什么要拿去 scale RL?"我是"信 RL"的(RL-pilled),但当时 OpenAI 里信 RL 的人并不多。自然有我们这么一些人,但我觉得很多年里我们都是少数派。

而且总有个"鸡生蛋、蛋生鸡"的困境:没有 GPU 你怎么拿出证据?可你又需要证据才能拿到 GPU——一个第 22 条军规式的算法难题。我觉得,强化学习 scaling 的诞生,很大程度上要归功于 Mark Chen 来找我、说"Jerry,嘿,我们想给扩大强化学习分配 GPU,把你们目前手上的东西拿去开始 scale,我希望这能成"的那一天。某种意义上这变成了一个自我实现的预言:我们有了 GPU,于是我开始琢磨——好,我们怎么组织?要 scale RL,我们需要更多数据、需要拿到问题、需要一个有 scale 潜力的算法,需要建立"轮班照看"(babysitting rotation)机制和一套人员结构,来确保我们能执行前所未有的大型 RL 训练。我某种程度上是"假定成功",开始把一切就位,然后事情开始"咔哒咔哒"地对上、开始发生。研究上有很多进展,你先假定"好,我需要什么才能到那儿",然后一切就渐渐拼到一起了。

不过今天几乎所有人从高层面上大致都知道那个"公式"了。你需要环境给出奖励,这个想法并不特别新——RL 里的奖励已经存在很久了。但很多难点在于,比如那个"对单个 prompt 做多次 rollout 来构建基线"的简单想法,是一个真正非常强大的点子,它帮助很大;还有大量关于数值稳定性的问题;还有很多,比如你得从 PPO 里移除一些东西,才能让算法工作得更好、scale 得更好。始终有一个信念:简洁性才是让 scaling 奏效的东西。

主持人: 很好。那么,当模型回溯并说“等等,让我重新考虑一下”时,这种能力是从强化学习中涌现出来的,还是你认为是受奖励设计塑造的?

Jerry: 完全不是受奖励设计塑造的,奖励与此毫无关系。模型只是自己摸索出来的,而且它很快就发现,这种方式能在某种程度上帮助它思考得更久。在强化学习(reinforcement learning)中发生的事情是,模型吸收了我们在预训练中学到的所有行为和所有类型的激活状态。它见过了所有的文本,见过所有的片段——在那些片段里有人在思考,有人说:“嘿,让我重新考虑一下这个。”模型试图唤起这些内容,并把它们几乎像思维链的函数调用一样使用,来引导它的推理,然后那些更成功的推理路径就会被强化。

主持人: 明白了。所以你把 o1 描述为一个本质上很擅长做谜题的技术演示,而 o3 是你们实际发布的一个工具。在训练中做了什么改变,才让工具使用(tool use)成为推理循环的一部分?

Jerry: 这其中 99% 是系统问题,只有 1% 是算法问题。我们确实遇到了一些有趣的算法问题,但更多的是关于在大规模下实现工具使用。这只是一个非常艰难的软件工程问题。现在每个在做这件事的实验室和公司都知道这有多痛苦。在某个时刻,你运行的分布式系统规模堪比有史以来最大的分布式系统。我认为 OpenAI 的训练框架拥有比 Netflix、亚马逊更多的虚拟机,传输着更多的数据——你可以想象像 Facebook 这样,大概率也是如此。想象任何一个人们认为“这就是 scale,这就是我们正在扩展的东西”的大型网站,而我们的团队必须在几个月内把它建好来训练模型。我们推送了大量的数据,有大量的同步工作,我们要努力确保不会遇到规模化的瓶颈,尝试对数据进行分片,并处理所有的通信问题。这就是我们解决的主要问题。我们知道一旦建成它就能奏效,因为推理已经被证明是有效的。我们知道像编程这样的任务确实需要工具使用,来自真实世界的反馈也会非常有用。但那里的工程部分真的是极其残酷的。

主持人: 是的。我一直在想,这种工具更像是一个架构师,你试图调度各种工具来解决这个特定的问题。

Jerry: 是的。

主持人: 那么接下来的问题是,实际的测试时算力(test-time compute)什么时候会收益递减?对于不同类型的任务,思考时间的 scaling 曲线到底是什么样的?

Jerry: 我们还没有看到测试时算力有任何实质性的限制。目前的限制主要有两个方面,但我认为最大的限制只是延迟,因为执行非常长的 rollout(展开)需要很长时间。没有多少人愿意为非常长的 rollout 等那么久,这是一个相当大的问题。例如,如果在你的训练中,开始出现需要花费一天时间的 rollout,这会极大地限制你能进行的步数和能做的事情,毕竟时间有限,所以这是一个非常大的限制因素。第二件事偏向架构层面,很明显,Transformer 在越来越长的上下文中的泛化能力并不完美。这有些困难。所以这两件事让这个问题变得有点棘手和复杂。我们只是没有非常长的 rollout,因为没人愿意等,而且很难对非常长的 rollout 进行迭代,因为它们太耗时了。我想我们现在已经看到了一种趋势,人们在做更多并行的 rollout,被称为子智能体(sub agents),这在一定程度上解决了延迟问题,但它的用处也大打折扣。它不是串行计算,那些 token 的使用效率要低得多。这是一种更昂贵的算力消耗。人们抱怨 Claude 或 Codex 的使用成本高,因为它是基于这些子智能体的,而且并没有那么有用。这是一个很难的问题。它可能是架构问题,在很多方面也可能是强化学习的问题。但我们在这里没有看到期望中的那么多进展,很大程度上就是因为这些限制,不过模型确实可以泛化得非常远。是的,这很难优化。

主持人: 明白了。对于 GPT-5,他们将推理和非推理合并到了一个系统中。从研究管理的角度来看,哪个更难:是科学研究本身,还是在这个范式仍在快速演进的时候,向十亿用户发布一个统一的模型?

Jerry: 这在很大程度上是一个组织问题,其中一部分是“创新者的窘境”,这在那个时候对 OpenAI 的打击非常大,因为 OpenAI 拥有有史以来最成功的消费者产品之一——ChatGPT。我们有一个非常具体的产品形态:我们希望模型能非常快速地响应,对一个相对小而简单的问题给出一个相当合理的答案。在这个领域有一个巨大的市场,这也是一个非常好的产品。早期很多讨论是:“我们有这个模型,它是一个推理模型,它思考的时间更长,技术上它更聪明;而我们有这个叫 ChatGPT 的产品”,这在一段时间里就像是试图把三角形的钉子硬塞进方形的孔里。我觉得在很多方面,以无缝的方式将它们结合是一个好主意,但早期的 ChatGPT 并不是合适的产品形态,我们现在已经看到结果了。整个世界和 OpenAI 都花了一些时间才弄明白,比如 Cursor 实际上可能是首批优秀的 agentic(智能体化)产品之一,而当时 OpenAI 还在试图把 agentic 模型硬塞进 ChatGPT,这在产品层面上没有任何意义。所以现在,ChatGPT 正在将自己重塑为一个 agentic 产品,因为很明显,这是一个大得多的机会,那个单纯的问答机器人虽然是个好东西,但在此时此刻,它在 AI 版图中变成了一个越来越小的市场。所以当时的问题是,我们如何利用推理模型来带来最大的效用,而当时它还没有完全确定下来产品形态。这也表明,不仅要在机器学习层面、在模型层面进行创新,思考如何将这种有用性交到创造者手中也同样重要。

主持人: 明白了。我们稍微从推理的话题中跳出来。我们讨论过持续学习(continual learning)对于 AGI 是必要的。这里是 AGI House,嘉宾们总是被问到这个问题。今天的模型在卡住的时候就变得无可救药了,而人类会从失败中学习,并在卷土重来时变得更强。我想问,为什么不能用更大的上下文窗口、更好的记忆脚手架来模拟这种能力呢?我们是不是需要一种全新的架构,我想这就是我们正在讨论的,对吧?

Jerry: 是的,这正是我的信念。答案其实很直接:如果那样就足够的话,我们早就拥有它了。我们现在的上下文窗口已经相当长了,至少在很多方面,我们有所有的 Markdown 文件,我们有所有的搜索方法,但它起作用了吗?我和很多拥有大量 Markdown 文件并经常进行检索的人聊过,每个人都说这种方式很脆弱,不能泛化,根本行不通。这让我想起了 2023 年试图构建智能体的人们,你还记得 AutoGPT 或 LangChain 吗?那时候人们说,让我们用 GPT-4 这个相当聪明的模型,通过搭建脚手架、控制工具和函数调用,在它之上构建智能体。但最终发现这是模型本身的问题,模型并没有被端到端地训练成一个好的智能体。而现在我们也在想:“模型有这么大的上下文,我们可以处理这么多的 Markdown 文件,为什么不能用它来学习呢?” 答案是,模型并没有被端到端地优化以进行学习。我认为这些是机器学习的问题,而不是 Markdown 文件的问题。

主持人: 明白了。我想可以这样说,你对这一点深信不疑,以至于你决定围绕这个理念创立一家公司,这就促使你创立了 Core Automation,对吧?

Jerry: 是的。不管怎么表述,我正在把精力投入到需要的地方,因为我决定围绕这个论点和想法创办一家公司。

主持人: 明白了。我想这让“自动化研究”变得具体了。我猜这是 Core Automation 的使命之一。今天在 Core Automation,当一个智能体去执行两年前 OpenAI 的研究工程师所做的工作时,它实际上在做什么?比如编写实验代码、运行评估(evals)、读取结果,或者提出下一个假设?

Jerry: 我们首先试图建立一个 AI 实验室自动化系统。理念是,对于我们试图做的每一项工作,首先要问的问题是:我们如何让智能体去做?每次你启动一个研究项目,你需要有一个基线(baseline)。这个基线就是尝试使用现有的智能体来完成我们在公司所做的所有事情,看看它们有多好。然后开始我们设想的过程,即我们在测试时训练(test-time training)中本质上想要做的事情。你构建了一个 eval(评估),这个 eval 就是你的实验室,让模型来做所有事情。我们如何改进它?我们如何让它第二天变得更好一点?这就是那种迭代,这就是针对你真正关心的事物进行的优化。如果加速实验室运营是你想要的,这就是你该去优化的。不要去改进那些你根本不在乎的、不是你产品的 evals,而是真正去优化你想要做的事情。随着它变得越来越好,我希望我们也会成为一家越来越好的公司。

主持人: 绝对的。我们非常期待。你们接下来会推出什么?有一些报道猜测描述了一个被称为“Aster”(音)的旗舰概念模型。这是一个在生产环境中不断学习、根据真实世界经验更新权重的模型,目标是所需训练数据减少 100 倍。不要求你确认任何代号,你如何让一个每天都在发生非常大变化的模型保持安全,并且是非常可评估和可调试的?我认为这似乎是接下来的挑战,对吧?

Jerry: 是的。可调试性确实很难。我不认为我非常看好机械可解释性(mechanistic interpretability)之类的东西。我不认为你能完全解释人类的思维过程。模型拥有万亿个参数,我们怎么能认为自己甚至可以试图去掌握它们、理解它们呢?但我们绝对可以观察和测量它们的行为。这也是我非常倾向于从行为学角度来对待模型的原因:模型即它们的行为,以及它们在现实世界中做的事情。我想建立这样的机制:我几乎要把模型当作迷宫里的老鼠一样对待,我们分析它们正在做的一切,试图将其归类、分解,试图理解它在哪里卡住了,哪里需要改进。你需要建立一个系统,把模型当作你的奥运会游泳运动员。你希望它成为最顶尖的研究者,你就必须分析它生活中的每一分钟:它是怎么进食的?它的技术是什么?在哪个时刻它在高效利用能量,哪个时刻不是?并努力给它反馈,试图让它改进,成为最好的自己。

主持人: 很好。那么我想我们回到关于架构的问题。我猜你们也在探索比 Transformer 扩展性更好的架构。那么,为了你所描述的未来,Transformer 到底出了什么问题?是因为注意力机制的计算成本、静态权重,还是训练和推理的分离,或者是以上所有原因?

Jerry: 最主要的一点又回到了我们之前讨论的:我们想做测试时训练(test-time training),而我认为 Transformer 无法以我想要的方式进行测试时训练。Transformer 是一个非常擅长记忆的模型。它对世界的所有理解都是从预训练数据中建立的。这一切都发生在实验室里,然后它以 KV cache 的形式建立记忆,但 Transformer 在测试时并没有进行有意义的学习,所有的学习都发生在实验室里。有一个很好的思想实验:如果 OpenAI 和 Anthropic 今天停止训练模型,如果他们说“好了,到此为止,我们要拆除训练集群了,你们去推理吧,我们有这个模型,你们拿去用”,你可以想想 Transformer 会有多大用处。每个人都知道这些模型是有局限性的。甚至还有所谓的新鲜度微调和知识截止日期这些概念,对吧?你需要不断重新训练模型以使其保持最新,拥有新的技能和能力。而这正是我们想要在线上、在测试时实现的目标,你不需要去做什么新鲜度微调。我认为 Transformer 的模型内部根本没有能够做到这一点的操作机制,这正是我们正在寻找的突破口。

主持人: 明白了。你们有一些大致的进展或者——

Jerry: 你们有一些想法。好的,酷。

主持人: 也许我们下次可以聊聊。

Jerry: 下次聊。

主持人: 实际上我们 AGI House 的团队非常关注那种受神经科学启发的不同架构。甚至我想起之前遇到了某位创始人,他也在解决架构上的数据效率问题。所以,当我们期待你们在不远的将来公开发布时,我们也许可以继续这个对话。我想在结束之前,我们还有几个问题。从 Core Automation 的网站来看,你们的一个很大重点是围绕企业应用那一部分的,你能从那个角度帮助阐述一下你们的愿景吗?

Jerry: 愿景非常简单。每个人都知道他们希望有一个在自己数据上训练的模型,但目前训练模型的过程既糟糕又诡异。微调(fine-tuning)过程并不是非常容易,而且公司也担心把自己的数据发给其他公司,没人愿意这么做。有时候他们就像被挟持了一样:要么你得把数据交出去才能得到一个在你数据上训练的好模型,要么就得不到。你该怎么选?我认为,测试时训练(test-time training)对这个问题提供了一个非常好的答案。你可以拥有属于自己的模型部署。没有其他人能看到它,没有其他人需要接触它。你把数据发送给那个模型,仅此而已。它可以部署在你自己的硬件上,然后它在你的数据上自我改进。它不断学习,它变成了真正属于你的模型,因为它了解你和你的数据。持续学习(continual learning)正以它本该有的方式解决个性化的问题。作为一家公司,你需要设想你有什么样的产品,最终如何将你的研究成果商业化,这就是我认为它真正有意义的地方。现在的说法是:“我们需要开源权重模型,这样我们就可以自己微调它们。” 但我不认为现实中真有人愿意去微调模型,你真正想要的是具备持续学习能力的模型。

主持人: 明白了。如果 Core Automation 取得了最狂野的成功,你设想中的未来是什么样的?

Jerry: 我想象的那个世界里,我们不再需要工作。这对某些人来说听起来可能像反乌托邦,但我大体上认为这正是我们未来的方向。工作是件好事,但同时,尽管计算机下棋非常厉害,人们还是会下棋;尽管汽车比我们快得多,人们还是会跑步。这感觉确实有点像一个没有责任的世界,但在某种程度上,它是一个充满超能力的世界。如果机器真的能为我们完成目前所有需要我们辛苦流汗、搬运重物、或者深入思考的工作;如果我们能在任何想要的时候、以任何想要的方式获得这种能力,这在某种程度上更像是一个充满行动力(agency)的世界。我们会更容易地去梦想,而这些梦想在现实世界中就会实现,因为 AI 为我们做到了。随之而来会有许多新的机遇,关于世界将如何运转、我们的体验会怎样、我们的关系会如何,很多事情都会截然不同。有时我开玩笑说——但这也不完全是个玩笑——未来看起来会像高中生活。因为在很多方面,高中就是一个还没有人需要工作、没有人有世俗责任的世界,人们只是学习事物、进行社交、试图弄懂这个世界。而 AI 可以一直扮演这位教导我们的老师,让我们有时间跟朋友待在一起。我不觉得那有什么可怕的。

主持人: 哇。我想这非常接近我们所说的 AGI 未来。你对这个时间表怎么看?我觉得你在这个领域算是非常——

Jerry: AGI 终究会到来。它绝对会来。当我说我们可能只剩下几年的工作需要做时,我不是在开玩笑。我不认为这种我们需要工作的状态会永远持续下去。问题是会有多快?我倾向于对这些事情保持相当乐观的态度。但现实是,技术的部署通常需要一段时间。AI 的进展感觉既快又慢。从某种意义上说,这七年来我们在模型的能力上取得了巨大的进步,在很多方面我已经觉得自己生活在未来了,我现在写代码主要是靠 vibe coding,出行主要靠自动驾驶。但与此同时,我们的生活看起来和过去相比只有一点点不同。但我绝对认为,在接下来的五年内,在某个时间点,工作方式可能会发生翻天覆地的转变,变得让人难以辨认。

主持人: 惊人的未来。非常期待那个未来。这也是我们在这里努力做的事情。但我多希望能有充足的时间继续这场对话,不过我们还有另一个环节等着你。所以,我们今天的谈话暂时到此结束。我期待着在未来的某个时候再次欢迎你回来,届时我们能看到模型架构的新进展。

Jerry: 我很乐意有一天告诉你们更多关于我们在 Core Automation 所做的事情。

主持人: 太棒了。这就是 Jerry,Core Automation 的 CEO,这个曾经教会机器思考的人,现在正在教一个实验室如何自我运转。大家可以在 coreautomation.com 了解他们的团队。让我们一起合作,看看能否帮他建立他所设想的那个未来,我绝对想成为其中的一部分。好的,非常感谢大家。