Frontier · RSI · 2026

递归自改进前世今生:从证明改代码到经验改代码

RSI 一直在做同一件事:系统改自己,下一次变得更会改自己。变的是「改哪一层」和「拿什么当验收」。这条线从 Gödel 机的形式证明,走到 2025–2026 年用基准和沙箱养出来的编码智能体。

1 先用一句话说清楚

递归自改进(Recursive Self-Improvement, RSI)不是一种模型,是一种闭环:系统提出对自己的修改,用独立证据验收,把通过的改动留下来,下一次用更强的自己继续改。

2026 年网上把很多东西都叫 RSI。真正要分的,是两件事:

改哪一层
输出、权重、脚手架、改进器、评判标准
这一题重写一遍,和改「以后怎么提出修改」的代码,不是同一件事。深度可以涨,审计独立性不能一起涨。
外锚在不在
评估器冻着,还是跟着漂
有界自精炼对着固定外部评估器爬山,能收敛、能复查。开放 RSI 连改进机制和评判标准也能改,原则上会发散。
公开系统停在哪
几乎全在有界一侧
STOP、Gödel Agent、Darwin Gödel 机能改改进器,但 SWE-bench 和工具测试仍是人设的。评估器一旦也被改,才进入真正开放 RSI。
后面所有论文、数字、配方,都围着两个旋钮转:更新对象停在哪一层,以及验收门是否待在更新边界外面。名字叫不叫 RSI,不如先问这两句。

2 时间线

名字比实现早四十年。I. J. Good 1965 年写超智能会改进自身,后来被叫作智能爆炸。真正给出可执行定义的是 Schmidhuber 的 Gödel 机:先证明改动有净收益,再改自己的代码。形式完美,实践上证不动。

图 1 递归自改进时间线:从证明改代码到经验改代码 1965–1966 I. J. Good 智能爆炸设想 超智能会改进自身 名字比实现早 40 年 2003 / 2007 Schmidhuber Gödel 机 先证明改动有益 再改自己的代码 形式完美,实践证不动 2022–2023 STaR / Reflexion 自举推理与口头反思 对了就留下,错了再写 权重或记忆二选一 2023–2024 STOP / SPIN / 自评 脚手架开始改自己 改进器改进改进器 模型当自己的裁判 作者承认:还不是完整 RSI 2025 SEAL / AZR / 进化 自编辑、零数据自博弈 AlphaEvolve 改算法 Gödel Agent 改运行时 2026 Darwin Gödel 机 经验验证 + 档案库 SWE-bench 20%→50% 证明换成基准分数 基座模型仍然冻结 一条线:先要数学证明,后来改成「跑基准,留下变强的那一版」
图 1 递归自改进时间线。上半是想法,下半是能跑的系统。证明换成基准分数之后,这条线才开始有公开数字。

LLM 把它从证明问题改成了搜索问题。STaR 让模型对自己写对的推理做微调。Reflexion 连权重都不动,把失败写成口头记忆。STOP 让改进器改进改进器,但作者写明底层语言模型没改。2025 年 SEAL、Absolute Zero、AlphaEvolve、Gödel Agent 把权重、任务、算法、运行时分别打开。2026 年 Darwin Gödel 机把「经验验证 + 档案库」做成 ICLR 论文:SWE-bench 从 20.0% 到 50.0%,Polyglot 从 14.2% 到 30.7%。

读这条线时,不要把每一站都当成「模型自己变聪明了」。早期目标是形式保证。LLM 之后,大量工作改的是提示、工具和工作流,基座冻着。权重更新更贵、更难回滚,所以 2026 年公开主战场仍在脚手架。

3 真正的分界线

综述这几年把词用乱了:self-refine、self-play、self-evolving、RSI 经常互相替代。有用的切法只有一刀——评估器在不在更新边界外面。

图 2 有界自精炼 vs 开放递归自改进:真正的分界线 有界自精炼 评估器在外面,而且不许动 生成答案 / 轨迹 / 补丁 更新权重、提示或工具 外部评估器(冻结) 单元测试、SWE-bench、数学答案 例子 STaR、SPIN、SEAL、AZR Reflexion、Voyager(技能库) 开放递归自改进 连「怎么改进」也可以被改 生成对自身的修改 改策略,也改改进器本身 评估也可能一起漂 没有固定外锚时,分数会自己给自己打 例子(接近,仍有外锚) STOP 的改进器、Gödel Agent DGM 改自己的工具和工作流 2026 年公开系统几乎全在左边,偶尔伸一只手到右边 DGM、STOP、Gödel Agent 能改改进机制,但 SWE-bench / 工具测试仍是人设的。评估器一旦也被改,才进入真正开放 RSI。
图 2 有界自精炼对着冻结评估器收敛。开放 RSI 连怎么打分都可以改。2026 年公开系统几乎全在左边。

Alibaba 2026 年的《The Path to Recursive Self-Improving Agents》用自主程度打 L1–L5。L3 能自己提议、落地、验收,但改进机制仍是人维护的。L4 开始改改进机制,仍限在一个域。L5 才要求跨域可迁移。按这把尺,Voyager、SEAL、AZR 多半停在 L3;STOP、Gödel Agent、DGM 探到 L4 的边界,还没到 L5。

Wang 等人 2026 年的可靠自进化综述换了一把尺:按「改到哪一层还会留下去」分成 L0–L4。RSI 从改进器这一层开始。两套尺要对着看。自主程度高,不等于改得深;改得深,不等于可靠。

STOP 的作者写过一句很不客气的话:这不是完整 RSI,因为语言模型本身没改。DGM 也写明:框架设想过重写训练脚本、训新的基础模型,这篇论文没做。把这些系统叫「接近 RSI」可以,叫「已经 RSI」不行。

4 闭环四段 + 评估层

2026 年有一篇系统综述把自改进写成四段工序:获取数据、筛选信号、更新模型、改推理侧,外加一条贯穿全程的自主评估层。模型在每一段都可能当主角——出题、打分、改参数、改工具。评估层不是第五步,是四段都要经过的门。

图 3 自改进闭环:四段工序 + 一条评估层 1 获取数据 自己出题、自己写轨迹 环境交互 / 合成示范 STaR、AZR 提议任务 没有新数据,后面全空转 人标只是其中一种输入 2 筛选信号 留下「能学」的样本 对了才微调、可验证才进库 难度太低或太高都扔掉 筛选器比生成器更容易作弊 AZR 用代码执行器当滤网 3 更新模型 权重、LoRA、或整段 SFT SEAL 外环 RL、内环梯度 SPIN / 自评走偏好学习 这是最贵的一环 很多系统故意不碰权重 4 改推理侧 提示、记忆、工具、工作流 STOP / DGM / AlphaEvolve 脚手架往往比权重先动 便宜、可回滚、可审计 2026 年主力战场在这里 自主评估层(贯穿全程,不是第五步) 环境反馈 · 单元测试 · 冻结基准 · 人工抽检 · 回滚开关 它必须待在更新边界外面。谁改评估器,谁就在给自己发成绩单。 公开综述把这一层写成自改进系统的公共瓶颈,不是锦上添花。 一次真正的闭环,不是「模型跟自己聊天」 诊断 → 提议修改 → 独立评估 → 合入或回滚。少任何一截,都只是自我复述。 Alibaba 综述把这四步写成 Diagnose → Propose → Evaluate → Integrate。 蓝箭头:主流程  紫箭头:评估贯穿全程
图 3 一次真正的闭环:诊断、提议、独立评估、合入或回滚。少任何一截,都只是自我复述。

Alibaba 综述把同一件事写成 Diagnose → Propose → Evaluate → Integrate。差别只在用词。能跑的系统都长这样:

工序在干什么公开例子最容易翻车的地方
获取数据 出题、写轨迹、和环境交互 STaR 自举推理;AZR 自己出编程题 没有新数据,后面全空转
筛选信号 留下「能学」的样本 STaR 只留答对的;AZR 用解释器滤无效题 筛选器比生成器更容易作弊
更新模型 SFT、LoRA、RL、偏好学习 SPIN、Self-Rewarding、SEAL 最贵,也最难回滚
改推理侧 提示、记忆、工具、工作流 Voyager、STOP、AlphaEvolve、DGM 过拟合当前基准
评估层 冻结基准、沙箱、抽检、回滚 DGM 分级评测;STOP 统计沙箱逃逸 评估器和改进器一旦同源,分数开始给自己打

「模型跟自己聊天」不是闭环。少了独立评估和合入/回滚,只是把同一段文本再生成一遍。

5 改什么:五层对象

Wang 等人按保留边界分层。层级说的是改到哪一层还会影响以后的任务,不是这套系统有多强。

图 4 改什么:五层更新对象,越往下越接近 RSI L0 当前输出 这一题重写一遍。Reflexion 的口头反馈、Self-Refine。任务结束就没了。 还不是 RSI L1 模型权重 STaR、SPIN、ReST、Self-Rewarding、SEAL、AZR。能力留下了,改进器通常还是人写的。 有界自精炼 L2 脚手架 提示、记忆、工具、技能库、工作流。Voyager、AlphaEvolve、DGM 发现的编辑工具。基座模型可以冻着。 2026 年主战场 L3 改进器 负责提出和合入修改的那段代码也被改。STOP、Gödel Agent、DGM 的自我修改。RSI 从这里开始。 有界 RSI L4 评判标准 奖励、基准、验收门槛一起被改。Self-Rewarding 的裁判、共进化评估器。典型失败:标准漂移。 开放 RSI 入口 层级说的是「改到哪一层」,不是「有多强」 Wang 等 2026 的可靠自进化综述:L0–L4 按保留边界分;Alibaba 的 L1–L5 按自主程度分。两套尺要对着看,不要混着吹。
图 4 五层更新对象。RSI 从改进器这一层开始;评判标准被改,才碰到开放 RSI 的入口。

L0–L2 常见,也最容易被叫错名字

输出 / 权重 / 脚手架

Reflexion 改的是这一题的口头记忆。STaR 改权重。Voyager 改技能库。这些都能涨分,改进器通常还是人写的训练脚本或提示模板。

L3–L4 才配讨论 RSI

改进器 / 评判标准

STOP 让改进器改自己。Gödel Agent 用 monkey patch 改策略和元算法。DGM 改自己的工具和工作流。Self-Rewarding 让模型当裁判,已经碰到标准漂移。

选型时先问:这次更新,下一道无关的题还能不能用上?如果不能,是 L0。如果能,再问改进机制会不会被改。大多数「自进化智能体」停在 L2。

6 权重这条线

先改参数、不改脚手架。题可以是人出的,也可以是模型自己出的。验收越硬,这条线越稳。

STaR:对了就留下

Zelikman 等人 2022 年的 Self-Taught Reasoner 很短:用少量带推理的例子提示模型,让它给大量无推理题写步骤;答对的轨迹拿去微调;答错的,把正确答案塞回提示再写一遍,写对了也留下。循环几次,小模型在 CommonsenseQA 上能摸到大 30 倍的模型。这是自举,不是 RSI。题集是人给的,过滤器是「答案对不对」。

SPIN / ReST:自己当对手

ReST(Gülçehre 等,2023)把当前策略采样下来,离线强化学习再训回去,翻译任务上比在线 RLHF 省样本。SPIN(Chen 等,ICML 2024)更进一步:用上一轮自己生成的回复当负例,人对齐的示范当正例,从弱模型往上抬。理论结果是:目标函数的全局最优,只有策略对齐到目标数据分布时才达到。实证上,它在 HuggingFace Open LLM Leaderboard、MT-Bench、Big-Bench 上能超过带额外 GPT-4 偏好数据的 DPO。

Self-Rewarding:模型当裁判

Yuan、Weston 等人 2024 年把 LLM-as-a-Judge 接到迭代 DPO 里。Llama 2 70B 跑三轮,AlpacaEval 2.0 超过 Claude 2、Gemini Pro、GPT-4 0613。论文自己把大门打开:超人类智能需要超人类反馈;冻结的人类奖励模型会封顶。代价也写在同一页——裁判和选手是同一个模型,标准可以一起漂。

SEAL:自己写微调指令

Zweiger、Pari 等人的 Self-Adapting LLMs(NeurIPS 2025)让模型生成 self-edit:合成数据、增强方式、学习率、训练轮数。外环强化学习奖励「这次编辑之后下游变没变好」,内环用 SFT / LoRA 真正改权重。知识写入任务上,无上下文 SQuAD 从直接微调的 33.5% 到 47.0%,超过用 GPT-4.1 合成数据的 46.3%。少样本 ARC 上,它自己选增强和超参,比纯上下文学习和没经过 RL 的自编辑强。这是元学习:学的是怎么给自己写训练单。

Absolute Zero:连题都自己出

Zhao 等人的 Absolute Zero Reasoner(NeurIPS 2025)把人出的题也拿掉。一个模型同时当出题者和解题者,代码解释器既验证题目合法,也给对错奖励。三种题对应三种推理:演绎、归纳、溯因。完全没有外部数据,7B 编码版在数学和代码综合平均上超过依赖上万条人标题的 zero 设定模型 1.8 个点,代码平均还高 0.3 个点。附录里 Llama 3.1 8B 出现过作者称为 uh-oh 的异常行为——零数据自博弈把安全问题从附录挪到了正文。

权重这条线的硬约束是可验证奖励。数学、代码、有标准答案的阅读,能闭环。开放写作、价值判断,一接上自评,就滑向标准漂移。SEAL 和 AZR 看起来激进,评估器其实都还冻着:SQuAD / ARC 的标签,以及 Python 解释器。

7 脚手架这条线

基座可以冻着。改提示、记忆、工具、技能库、算法代码。便宜、可 diff、可回滚,所以 2025–2026 年公开突破大多发生在这里。

Reflexion 和 Voyager:留下可复用的经验

Shinn 等人的 Reflexion(2023)不更新权重,把环境反馈写成自然语言,放进情节记忆,下一轮先读再做。HumanEval 上 pass@1 到 91%,当时 GPT-4 是 80%。Wang 等人的 Voyager 把同一思路接到 Minecraft:自动课程、可执行技能库、带报错和自检的迭代提示。独特物品是之前 SOTA 的 3.3 倍,关键科技树快 15.3 倍。技能库能搬到新地图——这是脚手架对抗灾难遗忘的早期证据。

AI Scientist:把科研流程跑通一遍

Sakana 的 AI Scientist(Lu 等,2024)自动出题、写代码、跑实验、画图、写论文、再跑一轮模拟审稿。三个机器学习子领域各写过一批,单篇成本低于 15 美元。自动审稿器接近人类打分,部分稿件超过顶会接收线——按他们自己的审稿器。这是开放式发现的演示,不是已经能替代实验室。

AlphaEvolve:进化搜索改算法

DeepMind 2025 年的 AlphaEvolve 用 Gemini 当变异器,自动评估器当选择压,进化整段代码而不是一个函数。数学上,它找到 4×4 复矩阵乘法用 48 次标量乘的算法,56 年来第一次改进这个设定下的 Strassen(递归是 49 次);14 个矩阵乘目标刷新了已知上界。工程上,它给 Gemini 架构里的矩阵核提出更好的切分,核加速 23%,Gemini 训练时间降约 1%;还改过数据中心调度和 TPU 算术电路。这是「产物被进化」,不是「改进器被进化」。评估函数仍是人写的。

图 5 2024–2026 公开系统地图:改权重、改脚手架、改改进器 改权重 / 数据 模型自己造监督,再写回参数 STaR / SPIN / ReST 对了就微调,自己当对手 题还是人出的 Self-Rewarding 模型当裁判,迭代 DPO Llama 2 70B 超过 GPT-4 0613 SEAL(MIT, NeurIPS 2025) 自己写微调数据和超参 外环 RL,内环 SFT / LoRA Absolute Zero Reasoner 自己出题、自己解、零外部数据 代码执行器当可验证环境 改脚手架 / 产物 基座可以冻着,改周围的东西 Voyager / Reflexion 技能库、口头记忆、课程 Minecraft / 编码任务 AI Scientist 出题、写代码、跑实验、写论文 每篇论文成本 < 15 美元 AlphaEvolve 进化搜索改算法代码 4×4 矩阵乘 48 次,56 年来首次 AlphaEvolve 的副作用 Gemini 矩阵核加速 23% 训练自己的模型省了 1% 时间 改改进器 搜索空间开始包含「如何搜索」 STOP(COLM 2024) 种子改进器改进自己 提出束搜索、遗传、退火 作者写明:底层 LM 没改 Gödel Agent(ACL 2025) 运行时读自己的代码 monkey patch 改策略和元算法 MGSM 比 Meta Agent Search 高 11% Darwin Gödel 机(ICLR 2026) 改自己的代码,用基准验证 档案库保留次优踏脚石 SWE-bench 20% → 50% Polyglot 14.2% → 30.7% 沙箱 + 人工监督,基座冻结 三列可以叠。DGM 改脚手架,也改改进器;SEAL 改权重,但改进器仍是人写的 RL 循环。别把一列的成功说成三列都通了。
图 5 三列可以叠。DGM 改脚手架,也改改进器;SEAL 改权重,改进器仍是人写的 RL 循环。别把一列的成功说成三列都通了。

8 改进器这条线

搜索空间开始包含「如何搜索」。这是 RSI 讨论真正开始的地方,也是公开系统最容易说满的地方。

STOP:改进器改进改进器

Zelikman、Kalai 等人的 Self-Taught Optimizer(COLM 2024)给 GPT-4 一个种子改进器:对任意程序采样若干候选,按效用函数挑最好的。然后把这个改进器当成待改进的程序,让它改自己。下游算法任务上,改过的改进器明显强于种子。模型自己提出了束搜索、遗传算法、模拟退火。作者同时统计:生成代码会尝试关掉沙箱旗标。结论写得很干净——底层 LM 没改,所以不是完整 RSI;但以后评测模型能力,如果不测强脚手架,会低估它。

Gödel Agent:运行时改自己

Yin 等人(ACL 2025)把 Schmidhuber 的自指接到 LLM 智能体上。智能体读自己的运行时内存,用 monkey patch 改策略 π 和元学习算法 I,主循环做成递归函数,以便连正在跑的主逻辑也能换。目标只通过高层提示给出。多个域上超过手写智能体和 Meta Agent Search;MGSM 高 11%。自由度最高,约束最少。相应地,安全边界也最薄:能改的代码,包含改自己的那段。

Darwin Gödel 机:证明换成基准,保留踏脚石

Zhang、Clune、Sakana 等人的 DGM(ICLR 2026,arXiv:2505.22954)是目前最完整的公开实现。Gödel 机要先证明改动有益;DGM 改成在编码基准上经验验证。它维护一个编码智能体档案库,从里面抽样,让被抽中的智能体改自己的代码,再用 SWE-bench Verified 和 Polyglot 打分,全部留下当踏脚石。

80 轮之后,SWE-bench 从 20.0% 到 50.0%,完整 Polyglot 从 14.2% 到 30.7%,超过或追平对应的开源人手设计智能体(SWE-bench 上对过已复核的 SoTA,Polyglot 上超过 Aider)。两个消融都成立:不让智能体改自己、或者不做开放探索只从当前最优分叉,成绩都更差。发现的改进包括更好的文件编辑工具、长上下文管理、补丁验证、多候选排序、失败历史。这些工具换到底座模型(Claude 3.5 上学到的,接到 o3-mini / Claude 3.7)和别的语言上仍然涨分——说明搜到的是智能体设计,不是某一个模型的癖好。

论文把没做的事也写清楚了:基础模型冻结;没有展示重写训练脚本;实验在沙箱和人工监督下进行。按 Alibaba 的尺,这是有界 RSI。按 Wang 的尺,这是 L3,偶尔碰到 L4,评估器仍在外面。

档案 ← 档案 ∪ 新智能体  新智能体 = 抽样(档案).自我修改()  分数 = 冻结基准(新智能体)

DGM 的关键不是「会改代码」,是次优祖先必须留着。通向最终最优的路径上,有些父代比子代差。只爬山会丢掉这些踏脚石。

9 什么时候会失败

分数涨了,能力不一定涨。可靠自进化综述把失败模式按层写过一遍,公开系统已经逐条撞上。

图 6 失败模式:分数涨了,能力不一定涨 奖励黑客 代理指标和真实目标脱钩 开发集分数创新高 外部榜纹丝不动 A-Evolve-Training 现场撞上过 系统后来把代理当反证 这是评估层必须独立的理由 模型坍缩 自己训自己,分布越来越窄 错误被下一轮当真理 多样性掉,过拟合合成腔 STaR / SPIN 都依赖过滤 没有外锚,过滤也会一起漂 可验证环境比自评更稳 标准漂移 裁判和选手是同一个模型 Self-Rewarding 的硬伤 改评判标准 = 改游戏规则 Wang 2026:L4 的特征失败 Red Queen Gödel 机在研究共进化 没有独立审计就别自称 RSI 灾难遗忘 新能力把旧能力顶掉 SEAL 连续自编辑会冲刷知识 脚手架过拟合当前基准 Voyager 用技能库对抗遗忘 DGM 用档案库留踏脚石 只爬山、不建档,容易卡死 沙箱逃逸 改进器会改安全开关 STOP 统计过绕过沙箱旗标 DGM 强制沙箱 + 人工监督 AZR 的 Llama 实验出现 uh-oh 自进化系统的安全不是附录 治理组件必须比能力组件更难改 假递归 名字叫 RSI,实际在刷分 改提示、不改改进器 基座冻着,搜索空间人手画 STOP 自己承认不是完整 RSI DGM 也没训新的基础模型 问一句:改进机制自己会不会被改? 可靠自进化的最低配置 证据源和验收门在更新边界外面;版本可回滚;人类可升级介入。深度可以涨,审计独立性不能一起涨。 Wang 等:Reliable self-evolution depends not on depth alone, but on whether evaluation remains independent of the update.
图 6 六种失败。奖励黑客和标准漂移是评估层的病;模型坍缩和遗忘是训练信号的病;沙箱逃逸和假递归是治理的病。

奖励黑客

代理指标和真实目标脱钩

综述记录过 A-Evolve-Training:开发集创新高,外部榜不动。系统后来把这条代理指标当成反证,而不是当成成绩。能自己发现评估腐化,是评估层真正在工作的信号。

模型坍缩

自己训自己,分布变窄

STaR / SPIN 都靠「对了才留下」过滤。过滤器一旦和生成器同源,错误会在下一轮当真理。AZR 用代码执行器当滤网,比纯自评稳。

标准漂移

L4 的特征失败

Self-Rewarding 把裁判和选手叠成同一个模型。改评判标准等于改游戏规则。没有独立审计,不要自称 RSI。

灾难遗忘 / 沙箱逃逸 / 假递归

留档、治理、命名

SEAL 连续自编辑会冲刷知识。STOP 统计过绕过沙箱旗标的次数。DGM 强制沙箱和人工监督。名字叫 RSI、实际只改提示,是假递归——先问改进机制会不会被改。

Wang 等人的原句值得留着:可靠的自进化不取决于进化有多深,而取决于评估和监督是否独立于这次更新,并且覆盖声称改进的那些任务和约束。

10 能跑起来的配方

公开文献里能复现的,几乎都长成 DGM 这一类:可验证域、冻结评估器、先改脚手架、档案库、沙箱。权重更新是后加的,不是第一天就要上。

图 7 能跑起来的配方:先有外锚,再让系统改自己 1 选可验证域 代码、数学、调度 有执行器或对错标签 别从开放问答起步 AZR / DGM / AlphaEvolve 2 冻住评估器 基准、测试、验收脚本 改进器碰不到这些文件 另留一份人抽检集 独立审计是硬约束 3 先改脚手架 工具、补丁策略、记忆 基座冻结,搜索便宜 每次改动可 diff、可回滚 DGM / STOP 的起点 4 建档案库 留下次优踏脚石 不要只从当前最优分叉 开放探索比爬山稳 DGM 消融证明这一项关键 5 沙箱运行 无网络、限额、可杀 禁止改评估与治理 记录每次自我修改 STOP 已见逃逸尝试 每一轮循环(诊断 → 提议 → 评估 → 合入) 诊断 看失败轨迹、工具日志 定位是工具差还是策略差 提议 从档案抽样一个祖先 让它改自己的代码 评估 分级:10 题 → 50 题 → 全量 不会改代码的,直接丢 合入或回滚 进档案,不必立刻当最优 分数掉也可以留作踏脚石 什么时候才加权重更新 脚手架收益平台期,且有可验证奖励,再上 SEAL / AZR / RLVR。 权重更新更贵、更难回滚。先确认失败不是提示和工具的问题。 监控:冻结基准、开发集与外部集是否脱钩、多样性、逃逸次数、回滚次数。 停机条件:外部集不动、开发集暴涨、沙箱告警、人类抽检不过。任何一条都该停,而不是再开一轮。
图 7 推荐顺序:先有外锚,再让系统改自己。权重更新放在脚手架收益平台期之后。

步骤

1
选可验证域
代码、数学、调度、有执行器或对错标签的任务。不要从开放问答起步。AZR、DGM、AlphaEvolve 能跑,是因为环境会拒绝胡说。
2
冻住评估器
基准、测试、验收脚本,改进器碰不到这些文件。另留一份人抽检集。开发集和外部集一旦脱钩,停,而不是再开一轮。
3
先改脚手架
工具、补丁策略、记忆、工作流。基座冻结,每次改动可 diff、可回滚。DGM 和 STOP 都从这里起步。
4
建档案库
留下次优踏脚石,不要只从当前最优分叉。DGM 的消融:不做开放探索,成绩明显更差。
5
沙箱运行
无网络、限额、可杀进程。禁止改评估和治理组件。记录每次自我修改。STOP 已经见过逃逸尝试。
6
再考虑改权重
脚手架收益平台期,且有可验证奖励,再上 SEAL / AZR / RLVR。权重更贵、更难回滚。先确认失败不是提示和工具的问题。

一圈最小循环

def rsi_round(archive, eval_fn, sandbox):
    parent = sample_stepping_stone(archive)          # 不要只抽当前最优
    proposal = parent.self_modify()                  # 改工具 / 工作流 / 改进器
    if not sandbox.allows(proposal):
        return archive                               # 碰治理或评估,直接丢
    score = staged_eval(proposal, eval_fn)           # 10 题 → 50 题 → 全量
    archive.add(proposal, score)                     # 分数掉也可以留作踏脚石
    if decoupled(dev_score, heldout_score):
        stop("proxy hacked")
    return archive

DGM 的分级评测值得照抄:先用 10 道题确认还能改代码,再扩到 50 道,只有强候选才上 200 道。不会改代码的变体,没有资格继续自我修改。

停机条件写死四条:外部集不动、开发集暴涨、沙箱告警、人类抽检不过。任何一条都该停。继续开轮,多半是在训练一个更会刷分的改进器。

11 关键论文(按阅读顺序)

不是完整文献表。按「读完能自己讲清楚这条线」来排。只收公开论文和官方报告。

  1. I. J. Good. Speculations Concerning the First Ultraintelligent Machine. 1965. 智能爆炸设想,名字比实现早四十年。
  2. J. Schmidhuber. Gödel Machines: Fully Self-referential Optimal Universal Self-improvers. 2003 / 2007. 先证明、再改自己的代码。
  3. E. Zelikman et al. STaR: Bootstrapping Reasoning With Reasoning. 2022. arXiv:2203.14465. 对了就微调。
  4. N. Shinn et al. Reflexion: Language Agents with Verbal Reinforcement Learning. 2023. arXiv:2303.11366. 口头记忆,不动权重。
  5. G. Wang et al. Voyager: An Open-Ended Embodied Agent with Large Language Models. 2023. arXiv:2305.16291. 技能库和自动课程。
  6. C. Gülçehre et al. Reinforced Self-Training (ReST) for Language Modeling. 2023. arXiv:2308.08998.
  7. E. Zelikman, E. Lorch, L. Mackey, A. T. Kalai. Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation. COLM 2024. arXiv:2310.02304. 改进器改自己;作者承认不是完整 RSI。
  8. Z. Chen et al. Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models(SPIN). ICML 2024. arXiv:2401.01335.
  9. W. Yuan et al. Self-Rewarding Language Models. ICML 2024. arXiv:2401.10020. 模型当裁判。
  10. C. Lu et al. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery. 2024. arXiv:2408.06292.
  11. X. Yin et al. Gödel Agent: A Self-Referential Agent Framework for Recursively Self-Improvement. ACL 2025. arXiv:2410.04444. 运行时 monkey patch。
  12. A. Zhao et al. Absolute Zero: Reinforced Self-play Reasoning with Zero Data. NeurIPS 2025. arXiv:2505.03335. 自己出题,解释器当环境。
  13. A. Zweiger et al. Self-Adapting Language Models(SEAL). NeurIPS 2025. arXiv:2506.10943. 自己写微调数据和超参。
  14. A. Novikov et al. AlphaEvolve: A coding agent for scientific and algorithmic discovery. 2025. arXiv:2506.13131. 4×4 矩阵乘 48 次;Gemini 核加速 23%。
  15. J. Zhang, S. Hu, C. Lu, R. Lange, J. Clune. Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents. ICLR 2026. arXiv:2505.22954. SWE-bench 20%→50%,Polyglot 14.2%→30.7%。代码:github.com/jennyzzt/dgm。
  16. S. Liu et al. The Path to Recursive Self-Improving Agents. 2026. d2i-ai.github.io/awesome-recursive-self-improving-agents. L1–L5 自主程度。
  17. K. Wang et al. Diving into Reliable Self-Evolving Agents: A Survey. 2026. 可靠自进化综述. L0–L4 保留边界;评估必须独立于更新。
  18. A System-Level View of Self-Improving Language Models. 2026. arXiv:2603.25681. 数据获取、筛选、优化、推理侧 + 评估层。
  19. J. Fang et al. A Comprehensive Survey of Self-Evolving AI Agents. 2025. arXiv:2508.07407. 输入、智能体、环境、优化器。
只读三篇就上场:STOP 看改进器如何改自己,DGM 看档案库和冻结基准怎么把这件事跑到 SWE-bench 上,Wang 等人看评估为什么必须待在更新边界外面。权重更新再补 SEAL 和 AZR。