关于ZAKER Skills GEO服务 合作
36氪 12分钟前

VC 追着投的 RSI 究竟是什么?姚顺宇、施天麟与清华 / 上交的教授们给出了回答

文|王欣逸

编辑|张雨忻

RSI(递归式自我改进)火的一塌糊涂。

周六,上海西岸,汇聚了一批最聪明的人类大脑,以及试图让 AI 也获得聪明大脑能力的人。

大洋彼岸,数月没有露面、宣称 Gemini 3.8 Flash 是 "RSI 的一大步 " 的姚顺宇,正在电话那头等候;成立半年估值 46.5 亿美元、押注 AI 自进化的硅谷创业公司 Recursive Superintelligence,其联合创始人施天麟,也加入了这场讨论。

他们为了一个共同的命题而来:资本涌入的 RSI 赛道,正在发生着什么?

RSI,Recursive Self-Improvement,成了今年年中以来最热门的话题,它指的是 AI 能够自我改进自身,能主动从写代码、跑实验,到调整架构、优化权重,甚至自己给自己找新的目标。

在场绝大多数是研究员,来自各个大厂、高校与实验室,也有不少知名投资机构、FA、孵化器到场。我们也全程参加了这场长达五个小时的活动,一些畅想、一些争议,反复在会场出现。

大家正在畅想一个人类不用 in the loop 的终局,即人类无需介入模型自我改进的循环中,以及畅想关于大厂、实验室和创业公司如何探索、实现这一终局。

不同的声音也在出现——自进化是一个悲观的未来?最终会被模型厂商吞没?RSI 不做预训练、不应该是一个垂直模型……

关于如何定义、评估与验证 RSI,它会在什么时候实现等问题,我们整理了一些来自姚顺宇、施天麟等硅谷研究员以及来自清华、上交等高校的助理教授、研究员的观点,供大家参考:

1. 当 AI 公司去 Scale up(扩大)自己规模(如模型能力、客户规模等)的同时,不再需要 Scale up 团队规模时,RSI 会在这个时候发生。

2. RSI 不是一个单一事件,而是一个连续事件。

3. 从今年年初的一些迹象来看,RSI 是可以实现的。很大的原因是 Coding 和 Agent Model 都已经成熟,到了一个突破点。按照 Coding Agent 的方式,可以让 AI 去训练 AI,去实现 AI 自己的想法、改进 AI 自身,包括架构、数据集以及它本身的训练方法等等,从而推动 RSI 的实现。

4. RSI 和模型在自己生成数据上的微调,很难说清两者的区别是定性的还是定量的。在某种意义上说,模型自己生成数据,是 RSI 的婴儿形态。

5. 数据与环境是 RSI 落地的好生意。

6. 和 OpenAI、Anthropic 等大厂竞争,创业者的机会不在通用智能,在于基础知识之外的专业知识。

7. 不需要从头训练 RSI 模型,其基础性能难以超过通用大模型,也难以自我迭代出更强的能力。

8. Evaluate(评估)智能,应该关注它是如何学会这一能力,而非学会了什么。

9. Verification(验证)的终极形态不应该依赖人工,但在短期内,必须保留人参与其中,尤其是在任务的定义和质量把控上,仍需要人类专家做出高质量的测评。

10. RSI 的最终版可能是一个模型,能自己改进自己;但在现在的初步阶段,可以依靠外部辅助模型,以及收集反馈信号。

11. 大家脑海里想到的 RSI,可能是 RSI 的终局——整个 loop 里完全不需要任何人。但从实际上来看,我们会不会走到那一天,以及有没有必要真的追求到那一步,是还不确定的事。

以下是这场由 AGI House、红杉中国、Research AI+ 合办的主题为「当 AI 开始递归自我改进」活动的部分干货内容,经过摘编:

在此之前,先介绍一下几位嘉宾——

姚顺宇:Google DeepMind 主任资深科学家,专注做 Auto-Research 方向探索,博士毕业于斯坦福大学理论物理专业,此前任职于 Anthropic。

施天麟:Recursive Superintelligence 联合创始人,清华姚班校友,曾在 OpenAI 担任研究员,在斯坦福大学读博期间还退学联合创办过一家 AI 公司—— Cresta。

谷雨:NeoCognition 联合创始人,ApprenticeBench 一作

周煊赫:上海交通大学助理教授,Theseus Labs 创始人

孟繁青:Evolvent AI 联合创始人,RSI Bench Data 一作

刘子鸣:清华大学助理教授,元环智能创始人,专注做 AI for AI 方向。

穆尧:上海交通大学助理教授,SeeAct AI 创始人,做具身智能的 RSI 方向。

此外,其他嘉宾还有来自海内外其他高校、实验室的研究员、博士生。值得一提的是,主办方 AGI House 活跃于硅谷,是一个 AI 创业社区与孵化器,这也是他们首次在国内办活动。

那么,切入正题。

如何递归?如何改进?

Q:如何定义 RSI?

姚顺宇:RSI 可能不是一件事,而是一个连续事件。我们现在只能讨论的是,我们在这个连续事件上面的位置。

举个简单的例子,模型从好几年前就可以开始自己写代码了,它可以写代码这件事其实也加速了 research loop(研究闭环),也算 RSI 发生了一部分;后来模型可以主动去监控实验进程,并提出新的实验,这也可以算成是 RSI。

从效果上来说,大家脑海里想到的 RSI,可能是 RSI 的终局,整个 loop 里完全不需要任何人。但我们会不会走到那一天,以及有没有必要真的追求到那一步,是还不确定的事。

施天麟:从 RSI 的角度,模型本身必须要有对自己约束情况的觉察。它要知道自己在哪些地方有不足,以及当明确出现偏离的时候,能去自己去纠正。这是 RSI 本身、模型自我强化的一个重要能力。

当然,光模型本身是不够的,还需要通过一定的 harness 和应用场景来约束模型。

谷雨:RSI 是一个很大的题,我们今天在场的几个人,可能做的事情都完全不一样。

大家的共性,可能有以下三个类别:一是 AI 自己去找到提升的目标;二是 AI 不断地去让自己更接近这个目标,这可能是迭代的过程;三是这个目标背后对应的可能是很长久的任务。例如,让大模型去做大模型,它的目标可能就是更好的模型,其中 AI 需要自己建立预算、规划模型、总结方法,最终得到一个更新的模型。

孟繁青:我们现在经常会把 Self-improving(自我改进)、持续学习、RSI 几个词放在一起说。

从我的角度看,RSI 是在给定的一个环境、奖励或者奖励函数的情况下,模型在其中去持续迭代某一个东西。这个东西可以是各种各样的,比如架构、权重,它最终的目标就是在这个环境中拿到更高的奖励得分。

在真正意义上的 RSI 中,模型需要去优化自己、去提升自己的表现,而不是去优化某个产物,或者说优化另外一个模型。整个系统是没有除了自己以外的外部因素的,只有自己、环境,还有奖励。

周煊赫:从计算机的角度来说,Recursive(递归)这个词,应该递归到最本质的层面上。对于一个 AI 系统来说,最本质的层面是它的参数和架构设计;再往外一层,是 Harness 里面的各种代码和脚本;再往外,就是它交互的这个环境,各种各样的文件、工作区。

我们对 RSI 的定义,是先让其切到产业场景里,看当前的工作流有没有痛点、痛点在哪。发现痛点之后,它接下来要做的是检索解决方案。

RSI 的最终版可能是一个模型,能自己改进自己;但在现在的初步阶段,可以依靠外部辅助模型,以及收集反馈信号。

RSI 真的实现自我进化了吗

Q:如何 evaluate(评估)RSI 真的实现了自我改进,在场的各位也有一些关于 Benchmark 的工作,也请大家分享一下在做的评估方式。

谷雨:Evaluate 主要关注什么,以及为什么会在这个时间点比较重要,有两个关注的点:

一是 ecological value,生态效度,在 Benchmark 上做得好,不一定直接意味着它真的能把事情解决,直接对应实际的生产价值或者经济价值。我们想验证的是,让一个通用大模型,变成能真正在某个岗位上执行的成熟员工。因此我们要做的是,搭出一个贴近真实工作的环境。

二是,我们到底要 Evaluate 智能的什么?我在很多场合都引用过一个观点,智能指的不是你会多少东西,而是你是怎么学会这些的。

周煊赫:评估是一件很重要的事,特别是华人做 AI,在定了一个方向之后,大家快速就会把这个方向的天花板给卷起来。

现在的问题是,benchmark 本身不够好,哪怕一些知名的 benchmark 也有很多错题。面向 RSI 的 benchmark 应该长什么样?除了传统 Agent 的 reasoning、exploration 还有 planning 这三个能力以外,我们还需要思考 RSI 需要有什么样的新能力。我们也相信,未来不只需要 AI 自己迭代,真正高质量的 benchmark 还是需要去结合人力专家。

验证,是 RSI 持续演进的卡点

Q:如何定义 Verification(验证),或者可以给出一些你们的思考?

姚顺宇:关于 RSI 最难实现的是自我改进,还是证明自己真的改进了,我觉得是验证自己真正改进了。

过去很多人做过类似的事,当时叫 " 赛博批评 " ——就是一个 AI 出题、一个 AI 解题。这种做法最容易掉进局部最优:比如一个 AI 总出特别简单的题,另一个都能答上来;或者一个总出特别难的题,另一个永远答不上来。因此,它最难的地方在于,模型得能真正理解自己到底进步到什么程度了。相比解决问题,RSI 里最难的事肯定还是定义问题。

孟繁青:先不谈 Verification 本身设计得对不对,就算它都是正确的,也会带来一个很大的问题:可复现性。

现在环境越来越复杂,涉及到 CPU 型号、操作系统是 Mac 还是 Windows、内存大小,不同的物理平台会导致 gap 的存在。

除此之外,现在大多数 benchmark 都是每题给你一个 0 到 1 的绝对分数。但其实这些分数并没有很强的物理意义,绝对分数本身也说明不了什么。

我们公司的一个合作者,提出了另一套评分标准。它把层级分成 Agent-SOTA、Human-SOTA 等这些不同的 layer,每一层对应不同的 Artifact(产物)。在每一个新平台上,通过跑这些 Artifact 来确定模型的输出到底属于哪一层。这样就能避免刚才说的物理意义和硬件 Gap 导致的问题。

周煊赫:我很早之前看过清华一个团队的工作,他们在推理过程中,通过给权重加扰动噪声,验证不同的扰动方式,可以让模型推得更好。这其实就实现了我们追求的:边推理、边学习、边调整权重的能力。

从内部来看,我们现在已经设计了推理和记忆分离的模块,从记忆埋点模块有一些隐式的中间态传递,也可以通过外部手段做保护。

和大厂抢生态位的 RSI 初创们

Q:如何思考 RSI 的创业公司和模型厂商的边界?什么地方模型厂商有绝对优势,什么地方创业公司能做出不一样的点?

孟繁青:RSI 的概念很大,科研机构、创业公司、大厂,每个人做的其实都是里面不同的部分,从上往下是这样的:

最上游,像 Alphabet、OpenAI,或者 Kimi 这种公司,他们说的 RSI 基本上是纯粹的 RSI,就是模型去迭代它自己本身,包括整个架构,是在追求更高的智能。

再往下一层,比如一些传统 SaaS 公司,RSI 需要环境和验证。对于他们来说,能不能把自己原本的生态抽象出一套 Agent-native 的服务出来,方便上游的模型厂商通过 Agent 来调用,并提升 Agent 在该场景下的智力,这可能就是这些下游传统公司理解的 RSI。

再往下,一些初创公司的方向可能是:不去纯粹地用 RSI 去迭代基础模型本身,不花大价钱去训一个自己的基础模型,而是用 RSI 去迭代某些产物,如 Harness。

对于上游和初创公司,目标是比较明确的,要么提升模型本身,要么提升下游的表现;而对于底层的 SaaS 公司,他们对 RSI 的态度可能是,能不能在里面提供更多的环境。

周煊赫:尽管大家对数据的要求越来越高,我认为,现在的数据和环境仍然是一门好生意。

在一艘到处漏水的船上,靠用手去堵窟窿来解决这件事。一个大厂的手再多,也顾不过来。所以当模型落到千行百业时,得有一套自进化的范式,这个范式最核心的两个因素就是数据和环境。

数据侧,对于预算不足的小公司而言,他们需要一套轻量化的数据方案,再转化成用户自己的资产。

环境侧,在嘈杂环境执行任务,就算是再好的 Agent,任务执行也会大幅降分。怎么去很好地理解、把你这套方案和模型一起协同进化的范式,是非常重要的一件事。

谷雨:我觉得可以从两个角度来看:第一个角度是创业公司去服务模型厂,第二个角度是创业公司做的事情和模型厂互补。

关于服务模型厂,比如刚才周老师提到的卖数据、卖环境,这都是很好的生意。

关于和模型厂的互补,刚才繁青老师也提到,模型厂提供的是一种通用智力,就是模型的通用能力。我觉得我们或者说大部分出来创业的人,不应该和大厂拼通用智能,我们应该做的是通用智力之后的专门知识。

一些争议

Q:目前行业里关于 RSI 的讨论,哪些观点和定义是你们不认可、不理解的?

谷雨:我不是很能理解为什么国内的投资人,给 RSI 投了这么多钱?

刘子鸣:自进化是一个非常悲观的未来。

上一次的自进化,是从灵长类动物进化到人,这是一个相当漫长的过程。尽管现在 AI 看起来好像有大量的进展,但我想说自进化是一条低效的路线,它意味着我们被卡在低维。

打个比方,现在的大模型是一整个银河系,我们在银河系里面,所以觉得银河系已经是全部了。但如果顺着大模型的路径慢慢往外拓,你会发现大模型的外面其实是虚空。你只有先熵增,上升到宇宙的维度,然后再做熵减,才能发现,可能别的地方还有一片星系适合人类居住。

分久必合,合久必分。我们现在正处于合的阶段,只用设计一个模型就可以解决所有的问题,但是它的边界也慢慢暴露出来了,现在我们需要给不同的领域设计不同的模型。

孟繁青:有些人在做 RSI 的模型,我不太能理解这个词。

比如某一模型可以去完成一些垂域任务,这只是单纯把 RSI 的概念包到了垂域模型上;又比如强调做模型的方法是 RSI,这个也不是真正的 RSI,因为现在的模型厂的后训练也已经做到了高度自动化,这里的 RSI 的能力在训练时已经被模型厂商给内化了。

假设我们常规训练出一个模型,它在环境里反复迭代、不断提高奖励反馈,学习曲线上会呈现出 " 得分随训练时间推移上升 " 的斜率。RSI 模型的价值在于,这个斜率会更高。这一模型不应该是针对某一个垂域调出来的,而是具有通用性的。

周煊赫:关于做 RSI 的预训练模型,我是非常不相信的。

我们相信的是 RSI 路径是:一种是大厂正在做的,堆算力、自己找数据、构建出超大的图谱、出难题训练自己;另一种是,当 AI 进入千行百业的时候,由于大厂也缺失这些环境的数据,因此通用的模型在这类场景的解决能力也比较受限,我们相信还需要另一套 RSI 的范式。

下一个突破

Q:你最期待的 SI 范式突破是什么样的,或者说你们认为未来什么样的潜在范式突破,会对你们正在做的事情造成颠覆?

孟繁青:我比较期待看 RSI 如何改进 Infra 层。Infra 原本是面向人类使用者设计的,那之后会不会衍生出一些更面向 Agent 的方法?比如原本的 SaaS,它们现在已经在积极改进、提升自己的能力;但更底层的东西,比如各种各样的训练 infra,之后会不会出现一些纯智能类的 Agent 去介入?

谷雨:我关注的是实验学习的能力这一方面,尤其是在真实环境里面的实验学习。我们公司现在真正在做的事是:把一个 Agent 放进一家真实公司之后,怎么让它自己去摸清这家公司的规则和工作流。

我们公司现在比较押注的一条路线,是对比非参数和参数化这两种形式。

非参数的路线,就是现在很多人在做的上下文、记忆路线,其好处是不需要动模型权重,也不需要很多样本;坏处是不够鲁棒,因为更新记忆文档的优化算法并不稳定,其压缩能力和表达能力也不够强。而参数化的路线,其表达力非常高、压缩率很高,但它需要很多训练样本。

所以我们认为一个可能的未来方向是:通过非参数的形式,在在线过程中学到一些新知识,再让基座模型去生成更多数据,或者把这些知识压进参数里。

周煊赫:我们相信,RSI 会内生在模型本身的能力上。此前提到的跟生态环境不匹配的问题,本质上是模型能力不够强。如果未来模型能力上去了,可能自己就会把 RSI 跑闭环,具体来看,它需要几方面能力:

第一,主动感知环境的能力。模型能主动地、流式地、低成本地把环境里各种模态的数据输入进来,感知哪些是跟任务对齐的,做模态消歧。进一步的话,它甚至可以做到改造环境、适应环境。

第二,探索和创新的能力。它不应该被限制在人类的偏好对齐上,而是能够自主地探索出一些领导力、品味的能力,甚至关键信息的感知能力。

第三,在线持续学习的能力。一定不能只有后训练的模式,反向传播的显存开销远远大于推理显存的开销,所以如何做出一个轻量化、小样本的持续学习,也很关键。这一能力和安全密切相关,因此 AI 还需要满足对自己能力边界的可控和感知的能力。

欢迎关注~

欢迎交流~

本文来自微信公众号" 智能涌现 ",作者:王欣逸,36 氪经授权发布。

36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容