1 先用一句话说清楚
递归自改进(Recursive Self-Improvement, RSI)不是一种模型,是一种闭环:系统提出对自己的修改,用独立证据验收,把通过的改动留下来,下一次用更强的自己继续改。
2026 年网上把很多东西都叫 RSI。真正要分的,是两件事:
2 时间线
名字比实现早四十年。I. J. Good 1965 年写超智能会改进自身,后来被叫作智能爆炸。真正给出可执行定义的是 Schmidhuber 的 Gödel 机:先证明改动有净收益,再改自己的代码。形式完美,实践上证不动。
LLM 把它从证明问题改成了搜索问题。STaR 让模型对自己写对的推理做微调。Reflexion 连权重都不动,把失败写成口头记忆。STOP 让改进器改进改进器,但作者写明底层语言模型没改。2025 年 SEAL、Absolute Zero、AlphaEvolve、Gödel Agent 把权重、任务、算法、运行时分别打开。2026 年 Darwin Gödel 机把「经验验证 + 档案库」做成 ICLR 论文:SWE-bench 从 20.0% 到 50.0%,Polyglot 从 14.2% 到 30.7%。
读这条线时,不要把每一站都当成「模型自己变聪明了」。早期目标是形式保证。LLM 之后,大量工作改的是提示、工具和工作流,基座冻着。权重更新更贵、更难回滚,所以 2026 年公开主战场仍在脚手架。
3 真正的分界线
综述这几年把词用乱了:self-refine、self-play、self-evolving、RSI 经常互相替代。有用的切法只有一刀——评估器在不在更新边界外面。
Alibaba 2026 年的《The Path to Recursive Self-Improving Agents》用自主程度打 L1–L5。L3 能自己提议、落地、验收,但改进机制仍是人维护的。L4 开始改改进机制,仍限在一个域。L5 才要求跨域可迁移。按这把尺,Voyager、SEAL、AZR 多半停在 L3;STOP、Gödel Agent、DGM 探到 L4 的边界,还没到 L5。
Wang 等人 2026 年的可靠自进化综述换了一把尺:按「改到哪一层还会留下去」分成 L0–L4。RSI 从改进器这一层开始。两套尺要对着看。自主程度高,不等于改得深;改得深,不等于可靠。
4 闭环四段 + 评估层
2026 年有一篇系统综述把自改进写成四段工序:获取数据、筛选信号、更新模型、改推理侧,外加一条贯穿全程的自主评估层。模型在每一段都可能当主角——出题、打分、改参数、改工具。评估层不是第五步,是四段都要经过的门。
Alibaba 综述把同一件事写成 Diagnose → Propose → Evaluate → Integrate。差别只在用词。能跑的系统都长这样:
| 工序 | 在干什么 | 公开例子 | 最容易翻车的地方 |
|---|---|---|---|
| 获取数据 | 出题、写轨迹、和环境交互 | STaR 自举推理;AZR 自己出编程题 | 没有新数据,后面全空转 |
| 筛选信号 | 留下「能学」的样本 | STaR 只留答对的;AZR 用解释器滤无效题 | 筛选器比生成器更容易作弊 |
| 更新模型 | SFT、LoRA、RL、偏好学习 | SPIN、Self-Rewarding、SEAL | 最贵,也最难回滚 |
| 改推理侧 | 提示、记忆、工具、工作流 | Voyager、STOP、AlphaEvolve、DGM | 过拟合当前基准 |
| 评估层 | 冻结基准、沙箱、抽检、回滚 | DGM 分级评测;STOP 统计沙箱逃逸 | 评估器和改进器一旦同源,分数开始给自己打 |
「模型跟自己聊天」不是闭环。少了独立评估和合入/回滚,只是把同一段文本再生成一遍。
5 改什么:五层对象
Wang 等人按保留边界分层。层级说的是改到哪一层还会影响以后的任务,不是这套系统有多强。
L0–L2 常见,也最容易被叫错名字
Reflexion 改的是这一题的口头记忆。STaR 改权重。Voyager 改技能库。这些都能涨分,改进器通常还是人写的训练脚本或提示模板。
L3–L4 才配讨论 RSI
STOP 让改进器改自己。Gödel Agent 用 monkey patch 改策略和元算法。DGM 改自己的工具和工作流。Self-Rewarding 让模型当裁判,已经碰到标准漂移。
6 权重这条线
先改参数、不改脚手架。题可以是人出的,也可以是模型自己出的。验收越硬,这条线越稳。
STaR:对了就留下
Zelikman 等人 2022 年的 Self-Taught Reasoner 很短:用少量带推理的例子提示模型,让它给大量无推理题写步骤;答对的轨迹拿去微调;答错的,把正确答案塞回提示再写一遍,写对了也留下。循环几次,小模型在 CommonsenseQA 上能摸到大 30 倍的模型。这是自举,不是 RSI。题集是人给的,过滤器是「答案对不对」。
SPIN / ReST:自己当对手
ReST(Gülçehre 等,2023)把当前策略采样下来,离线强化学习再训回去,翻译任务上比在线 RLHF 省样本。SPIN(Chen 等,ICML 2024)更进一步:用上一轮自己生成的回复当负例,人对齐的示范当正例,从弱模型往上抬。理论结果是:目标函数的全局最优,只有策略对齐到目标数据分布时才达到。实证上,它在 HuggingFace Open LLM Leaderboard、MT-Bench、Big-Bench 上能超过带额外 GPT-4 偏好数据的 DPO。
Self-Rewarding:模型当裁判
Yuan、Weston 等人 2024 年把 LLM-as-a-Judge 接到迭代 DPO 里。Llama 2 70B 跑三轮,AlpacaEval 2.0 超过 Claude 2、Gemini Pro、GPT-4 0613。论文自己把大门打开:超人类智能需要超人类反馈;冻结的人类奖励模型会封顶。代价也写在同一页——裁判和选手是同一个模型,标准可以一起漂。
SEAL:自己写微调指令
Zweiger、Pari 等人的 Self-Adapting LLMs(NeurIPS 2025)让模型生成 self-edit:合成数据、增强方式、学习率、训练轮数。外环强化学习奖励「这次编辑之后下游变没变好」,内环用 SFT / LoRA 真正改权重。知识写入任务上,无上下文 SQuAD 从直接微调的 33.5% 到 47.0%,超过用 GPT-4.1 合成数据的 46.3%。少样本 ARC 上,它自己选增强和超参,比纯上下文学习和没经过 RL 的自编辑强。这是元学习:学的是怎么给自己写训练单。
Absolute Zero:连题都自己出
Zhao 等人的 Absolute Zero Reasoner(NeurIPS 2025)把人出的题也拿掉。一个模型同时当出题者和解题者,代码解释器既验证题目合法,也给对错奖励。三种题对应三种推理:演绎、归纳、溯因。完全没有外部数据,7B 编码版在数学和代码综合平均上超过依赖上万条人标题的 zero 设定模型 1.8 个点,代码平均还高 0.3 个点。附录里 Llama 3.1 8B 出现过作者称为 uh-oh 的异常行为——零数据自博弈把安全问题从附录挪到了正文。
7 脚手架这条线
基座可以冻着。改提示、记忆、工具、技能库、算法代码。便宜、可 diff、可回滚,所以 2025–2026 年公开突破大多发生在这里。
Reflexion 和 Voyager:留下可复用的经验
Shinn 等人的 Reflexion(2023)不更新权重,把环境反馈写成自然语言,放进情节记忆,下一轮先读再做。HumanEval 上 pass@1 到 91%,当时 GPT-4 是 80%。Wang 等人的 Voyager 把同一思路接到 Minecraft:自动课程、可执行技能库、带报错和自检的迭代提示。独特物品是之前 SOTA 的 3.3 倍,关键科技树快 15.3 倍。技能库能搬到新地图——这是脚手架对抗灾难遗忘的早期证据。
AI Scientist:把科研流程跑通一遍
Sakana 的 AI Scientist(Lu 等,2024)自动出题、写代码、跑实验、画图、写论文、再跑一轮模拟审稿。三个机器学习子领域各写过一批,单篇成本低于 15 美元。自动审稿器接近人类打分,部分稿件超过顶会接收线——按他们自己的审稿器。这是开放式发现的演示,不是已经能替代实验室。
AlphaEvolve:进化搜索改算法
DeepMind 2025 年的 AlphaEvolve 用 Gemini 当变异器,自动评估器当选择压,进化整段代码而不是一个函数。数学上,它找到 4×4 复矩阵乘法用 48 次标量乘的算法,56 年来第一次改进这个设定下的 Strassen(递归是 49 次);14 个矩阵乘目标刷新了已知上界。工程上,它给 Gemini 架构里的矩阵核提出更好的切分,核加速 23%,Gemini 训练时间降约 1%;还改过数据中心调度和 TPU 算术电路。这是「产物被进化」,不是「改进器被进化」。评估函数仍是人写的。
8 改进器这条线
搜索空间开始包含「如何搜索」。这是 RSI 讨论真正开始的地方,也是公开系统最容易说满的地方。
STOP:改进器改进改进器
Zelikman、Kalai 等人的 Self-Taught Optimizer(COLM 2024)给 GPT-4 一个种子改进器:对任意程序采样若干候选,按效用函数挑最好的。然后把这个改进器当成待改进的程序,让它改自己。下游算法任务上,改过的改进器明显强于种子。模型自己提出了束搜索、遗传算法、模拟退火。作者同时统计:生成代码会尝试关掉沙箱旗标。结论写得很干净——底层 LM 没改,所以不是完整 RSI;但以后评测模型能力,如果不测强脚手架,会低估它。
Gödel Agent:运行时改自己
Yin 等人(ACL 2025)把 Schmidhuber 的自指接到 LLM 智能体上。智能体读自己的运行时内存,用 monkey patch 改策略 π 和元学习算法 I,主循环做成递归函数,以便连正在跑的主逻辑也能换。目标只通过高层提示给出。多个域上超过手写智能体和 Meta Agent Search;MGSM 高 11%。自由度最高,约束最少。相应地,安全边界也最薄:能改的代码,包含改自己的那段。
Darwin Gödel 机:证明换成基准,保留踏脚石
Zhang、Clune、Sakana 等人的 DGM(ICLR 2026,arXiv:2505.22954)是目前最完整的公开实现。Gödel 机要先证明改动有益;DGM 改成在编码基准上经验验证。它维护一个编码智能体档案库,从里面抽样,让被抽中的智能体改自己的代码,再用 SWE-bench Verified 和 Polyglot 打分,全部留下当踏脚石。
80 轮之后,SWE-bench 从 20.0% 到 50.0%,完整 Polyglot 从 14.2% 到 30.7%,超过或追平对应的开源人手设计智能体(SWE-bench 上对过已复核的 SoTA,Polyglot 上超过 Aider)。两个消融都成立:不让智能体改自己、或者不做开放探索只从当前最优分叉,成绩都更差。发现的改进包括更好的文件编辑工具、长上下文管理、补丁验证、多候选排序、失败历史。这些工具换到底座模型(Claude 3.5 上学到的,接到 o3-mini / Claude 3.7)和别的语言上仍然涨分——说明搜到的是智能体设计,不是某一个模型的癖好。
论文把没做的事也写清楚了:基础模型冻结;没有展示重写训练脚本;实验在沙箱和人工监督下进行。按 Alibaba 的尺,这是有界 RSI。按 Wang 的尺,这是 L3,偶尔碰到 L4,评估器仍在外面。
DGM 的关键不是「会改代码」,是次优祖先必须留着。通向最终最优的路径上,有些父代比子代差。只爬山会丢掉这些踏脚石。
9 什么时候会失败
分数涨了,能力不一定涨。可靠自进化综述把失败模式按层写过一遍,公开系统已经逐条撞上。
奖励黑客
综述记录过 A-Evolve-Training:开发集创新高,外部榜不动。系统后来把这条代理指标当成反证,而不是当成成绩。能自己发现评估腐化,是评估层真正在工作的信号。
模型坍缩
STaR / SPIN 都靠「对了才留下」过滤。过滤器一旦和生成器同源,错误会在下一轮当真理。AZR 用代码执行器当滤网,比纯自评稳。
标准漂移
Self-Rewarding 把裁判和选手叠成同一个模型。改评判标准等于改游戏规则。没有独立审计,不要自称 RSI。
灾难遗忘 / 沙箱逃逸 / 假递归
SEAL 连续自编辑会冲刷知识。STOP 统计过绕过沙箱旗标的次数。DGM 强制沙箱和人工监督。名字叫 RSI、实际只改提示,是假递归——先问改进机制会不会被改。
10 能跑起来的配方
公开文献里能复现的,几乎都长成 DGM 这一类:可验证域、冻结评估器、先改脚手架、档案库、沙箱。权重更新是后加的,不是第一天就要上。
步骤
一圈最小循环
def rsi_round(archive, eval_fn, sandbox):
parent = sample_stepping_stone(archive) # 不要只抽当前最优
proposal = parent.self_modify() # 改工具 / 工作流 / 改进器
if not sandbox.allows(proposal):
return archive # 碰治理或评估,直接丢
score = staged_eval(proposal, eval_fn) # 10 题 → 50 题 → 全量
archive.add(proposal, score) # 分数掉也可以留作踏脚石
if decoupled(dev_score, heldout_score):
stop("proxy hacked")
return archive
DGM 的分级评测值得照抄:先用 10 道题确认还能改代码,再扩到 50 道,只有强候选才上 200 道。不会改代码的变体,没有资格继续自我修改。
11 关键论文(按阅读顺序)
不是完整文献表。按「读完能自己讲清楚这条线」来排。只收公开论文和官方报告。
- I. J. Good. Speculations Concerning the First Ultraintelligent Machine. 1965. 智能爆炸设想,名字比实现早四十年。
- J. Schmidhuber. Gödel Machines: Fully Self-referential Optimal Universal Self-improvers. 2003 / 2007. 先证明、再改自己的代码。
- E. Zelikman et al. STaR: Bootstrapping Reasoning With Reasoning. 2022. arXiv:2203.14465. 对了就微调。
- N. Shinn et al. Reflexion: Language Agents with Verbal Reinforcement Learning. 2023. arXiv:2303.11366. 口头记忆,不动权重。
- G. Wang et al. Voyager: An Open-Ended Embodied Agent with Large Language Models. 2023. arXiv:2305.16291. 技能库和自动课程。
- C. Gülçehre et al. Reinforced Self-Training (ReST) for Language Modeling. 2023. arXiv:2308.08998.
- E. Zelikman, E. Lorch, L. Mackey, A. T. Kalai. Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation. COLM 2024. arXiv:2310.02304. 改进器改自己;作者承认不是完整 RSI。
- Z. Chen et al. Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models(SPIN). ICML 2024. arXiv:2401.01335.
- W. Yuan et al. Self-Rewarding Language Models. ICML 2024. arXiv:2401.10020. 模型当裁判。
- C. Lu et al. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery. 2024. arXiv:2408.06292.
- X. Yin et al. Gödel Agent: A Self-Referential Agent Framework for Recursively Self-Improvement. ACL 2025. arXiv:2410.04444. 运行时 monkey patch。
- A. Zhao et al. Absolute Zero: Reinforced Self-play Reasoning with Zero Data. NeurIPS 2025. arXiv:2505.03335. 自己出题,解释器当环境。
- A. Zweiger et al. Self-Adapting Language Models(SEAL). NeurIPS 2025. arXiv:2506.10943. 自己写微调数据和超参。
- A. Novikov et al. AlphaEvolve: A coding agent for scientific and algorithmic discovery. 2025. arXiv:2506.13131. 4×4 矩阵乘 48 次;Gemini 核加速 23%。
- J. Zhang, S. Hu, C. Lu, R. Lange, J. Clune. Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents. ICLR 2026. arXiv:2505.22954. SWE-bench 20%→50%,Polyglot 14.2%→30.7%。代码:github.com/jennyzzt/dgm。
- S. Liu et al. The Path to Recursive Self-Improving Agents. 2026. d2i-ai.github.io/awesome-recursive-self-improving-agents. L1–L5 自主程度。
- K. Wang et al. Diving into Reliable Self-Evolving Agents: A Survey. 2026. 可靠自进化综述. L0–L4 保留边界;评估必须独立于更新。
- A System-Level View of Self-Improving Language Models. 2026. arXiv:2603.25681. 数据获取、筛选、优化、推理侧 + 评估层。
- J. Fang et al. A Comprehensive Survey of Self-Evolving AI Agents. 2025. arXiv:2508.07407. 输入、智能体、环境、优化器。