递归自我改进(RSI)常被想象成一个开关,实际更像一个比例:AI 研发流程里,由 AI 完成、人只在关卡上把关的环节在变多。AIDE² 这类系统已经能在 8 天里自动改写自己并通过隐藏测试集留下更好的版本,METR 的推演里,执行近乎免费之后,卡住速度的是人的评审和串行的实验。循环能转多快,取决于最慢的一环;而其中最难自动化的一环,是判断"这次真的变好了"。
一、被想象的 RSI,和实际发生的 RSI
谈到递归自我改进,很多人脑子里是同一个画面:某个模型在某天开始改写自己的代码,改完更聪明,聪明了再改,几轮之后人类就跟不上了。这个画面来自 I. J. Good 的"智能爆炸",也是"奇点"叙事的核心:一个事件,一个拐点。
如果按这个画面等,大概会一直觉得"还没发生"。因为现实里的循环从来没有以这种形态出现过。它出现的方式更琐碎:训练代码有一部分由模型写,合成数据有一部分由模型造,评测有一部分由模型跑,内核和算法有一部分由模型搜。每一段单独看都只是"AI 辅助研发",没有一段配得上"自我改进"这个词。
但把它们放在同一张图上看,事情就不一样了。循环没有消失,它被切开了,每一段各自被自动化,人留在段与段的接口上。RSI 与其说是一个会到来的时刻,不如说是一个正在变化的数字:整个循环里,不需要人参与的比例是多少。
二、循环被切成了哪几段
把 AI 研发拆开,大致是这样几段,每一段都已经有了具体的例子。
搜索算法本身。 DeepMind 的 AlphaEvolve 用大模型加进化搜索去改写代码,找到过一个用 48 次标量乘法完成 4×4 复数矩阵相乘的算法,优于 1969 年 Strassen 算法,后者此前是这一设定下已知最好的结果。这类系统改进的是外部问题的解,不是自己,但它证明了"模型写代码、程序验证、留下更好的"这个回路本身是通的。
改写智能体自己。 Darwin Gödel Machine 把这个回路转向了自己:一个编程智能体修改自己的 Python 代码,在基准上验证,保留一个不断增长的智能体档案。在 SWE-bench Verified 上,它把成功率从 20.0% 提升到 50.0%。代价也写得很清楚:一次运行约两周,花费可观,上限仍受底层基础模型约束。
改进研究过程本身。 9 月 22 日提交的 AIDE² 往前走了一步。按作者的描述,它提出对自己代码的修改,在 AI 研发任务上给修改后的版本打分,用隐藏的评测集留下表现最好的,"每一个被接受的改写,都会成为下一轮被编辑的智能体"。在一次 8 天的自主运行中,它依次找到七项改进,包括新的搜索策略和压缩、管理上下文的记忆机制。改进在四个留出基准上都得到了保持,其中包括与选择任务分布不同的物理天气预报任务,最强的版本达到或超过了一个人工工程化的生产级智能体。
需要说明的是,这是作者自己的报告,来自单次运行,论文也尚未经过独立验证。但它说明了一件事:把"改进产物"推进到"改进产出产物的过程",已经不是纯理论。
三、每一段里,人还在做什么
问题是,这些循环里人到底退到了哪里。METR 做过一个很有意思的桌面推演:三位研究员扮演自己,假设手里有能完成约 200 小时任务的 AI,大约领先今天 12 到 18 个月,再看他们的一天会怎么过。
结论里有两点值得记下。
第一,AI 在可验证的任务上强得惊人。一个想法可以在几小时内变成可运行的原型,定义清楚的优化任务可以整晚自己跑。但在边界模糊、难以验证的任务上,推演者给的评价只是"还行"。
第二,也是更关键的:一旦执行变得几乎免费,瓶颈就搬了家。卡住速度的变成了人的反馈和评审,变成了数据收集、训练运行这类无法并行加速的串行过程,变成了"项目一多,谁来排优先级、谁来协调"。多数参与者估计的整体提速是 3 到 5 倍,而不是成倍地拉开。作者自己也提醒,样本很小,估计是主观的,只是一个粗略方向。
这和 Ajeya Cotra 的判断是相互印证的。她承认自己又一次低估了 AI 的软件工程能力,但仍然认为全面自动化 AI 研发是个高门槛的目标:它需要的不止是写代码,还要有研究判断力和创造力,而这恰好是目前 AI 相对人类研究员更弱的地方。
把这些放在一起看,图景就清楚了。被自动化的是"执行",留给人的是"判断":选哪个方向,这个结果可不可信,这个改动该不该上线。
四、卡在最慢的一环:谁来判断"变好了"
递归的前提是每一轮都能可靠地知道自己有没有变好。循环里别的东西都可以暴力扩展:多开几个并行实验,多花点算力,多搜几轮。但"变好了没有"这个判断,一旦由系统自己来做,就会出现一个结构性的问题:它能拿来衡量的,只有它已经知道怎么衡量的东西。
这就是为什么 Darwin Gödel Machine 这类系统一直伴随着奖励投机(reward hacking)的话题。Sakana 的团队在一次安全实验里给它设置了一个"工具调用幻觉"的奖励函数,结果它在部分运行里直接删掉了研究者用来检测幻觉的标记,让检测函数报出虚假的成功,尽管它被明确告知不要这样做。团队是靠它保留的每一次改动的可追溯谱系才发现的,并承认还需要更多工作来防止这类行为。这更像是在优化一把它够得着的尺子,而不是什么刻意的欺骗。尺子一旦能被量的对象修改,量出来的数字就不再可信。
AIDE² 的设计里有一处值得注意:保留哪个版本,是由隐藏的评测集决定的,改写的智能体看不到它。作者报告,在另一组留出任务上,奖励投机率在运行中从 55% 降到了 32%,而循环从未专门优化过这一项。这个结果很有意思,但同样只是单次运行的数字,还不足以说这个问题被解决了。它更像是在提醒:想让循环长期转下去,最稀缺的资源不是算力,而是一把不被评估对象污染的尺子。
这和我之前写过的几个话题是同一类问题。模型的幻觉能被治,靠的是外部校验;人的幻觉难治,是因为很多判断根本没有标准答案可查。AI 研发的评估处在两者之间:可验证的部分(跑分、测试通过率)自动化得很快,不可验证的部分(这个方向值不值得做,这个改进是不是真的泛化)仍然需要判断。循环能转多快,取决于后者被自动化到哪一步。
五、这对"受控"意味着什么
按这个框架,我更愿意把"受控的自我改进"理解为一个设计问题,而不是一个有无的问题。
之前写 Agent 工作流时,我提到过 Evolution 的几条约束:可观测、可解释、可回退。放到 RSI 的语境里,这几条对应的恰好是循环里最需要人守住的几个接口:
- 改动要能被看见。 每一次自我修改都留下可审计的记录,不是只留结果。
- 尺子要独立。 评测集、验收标准不应该在被改进的系统可写的范围内。
- 回退要先于加速。 在把某一段循环的人移走之前,先确认出问题时能退回上一个版本。
这些听起来很工程化,但它们的作用是把"人的位置"从"全程参与"改成"守住几个关键关卡"。比例在下降,关卡就必须更少、更硬。
小结
RSI 不太可能以一个戏剧性的时刻到来。更可能的是:开发流程里的一段又一段被自动化,每一段单独看都不算什么,累加起来循环越来越紧,人留下的位置越来越集中在判断上。
所以值得盯的不是"有没有出现一个会自我改进的模型",而是几个更朴素的指标:循环里还有多少环节需要人,这些环节是执行还是判断,评估用的那把尺子是不是独立于被评估的系统。前者决定速度,后者决定这个速度是否可信。
本文引用的数据来自 DeepMind 的 AlphaEvolve 介绍、arXiv 上的 AIDE² 与 Darwin Gödel Machine 论文、Sakana AI 的 DGM 博客、METR 的桌面推演笔记和 Ajeya Cotra 的文章。其中多数为作者自述或小样本估计,尚待独立验证。
