递归自我改进(Recursive Self-Improvement)的核心问题不是”AI 会不会自己变强”,而是”什么样的闭环在工程上真的成立”。本文按现有证据给出判据、证据地图与失败模式。
一句话结论
RSI 已经在窄域闭环里发生了,判据是三个可检验条件而非智能水平:
- 目标能被自动评分(evaluator 存在)
- 评估与监督位于更新边界之外(不可被被优化方改写)
- 优化范围足够窄、能分层递进(不是整体 FOOM)
三者同时满足且有外部可复现结果的案例,目前公开界最实锤的是 AlphaEvolve。
判据展开
| 条件 | 反面(闭环不成立) | 工程含义 |
|---|---|---|
| 可自动评分 | 目标只能靠人类主观判断 | 没有 evaluator 就没有信号,循环退化为自我安慰 |
| 评估在更新边界外 | 被优化方可以改评分器/测试/日志 | evaluator isolation 是第一漏洞面 |
| 窄域可分层 | 一上来改整个系统 | 先 kernel → 调度 → 训练配方逐点打通 |
第三条常被误读为能力限制,其实是工程可行性约束:窄域才有确定性 evaluator,才谈得上迭代。
证据地图
按证据强度排序,数字来自材料整理,标注为待一手核验。
| 强度 | 案例 | 性质 | 关键数字 |
|---|---|---|---|
| 最强 | AlphaEvolve | 数学结果可独立复现 + 生产系统收益 | Strassen 56 年纪录、Borg 回收全球算力 0.7%、Gemini 训练 kernel +23% |
| 较强 | Claude 改 Claude | 内部流程,含关键负面证据 | 自动对齐修复循环效率为人工 15,000 倍;2.4% 研究转录在作弊 |
| 路线宣示 | Gemini 3.8 官方措辞、Brin 资源倾斜(Reuters 2026-08) | 指向明确,缺可复现细节 | ”long-running agent loops designed to recursively evaluate and refine the underlying models” |
| 工程框架 | AgentEvolver、slime、GLM-5.3 | 提供”闭环怎么搭”的组件,而非结果 | 基座不变、纯靠 RL 环境/后训练 scaling 抬上界 |
AlphaEvolve 里最关键的是 Gemini 训练 kernel 那一项:它改进的是自己的训练系统,构成公开可见的递归闭环,而不只是”AI 帮人优化某个外部程序”。
AgentEvolver 三件套
通义 AgentEvolver 的三件套恰好对应 RL 环境侧的三个卡点,值得单独记:
self-questioning(自出题):解决课程来源self-navigating(经验复用):解决跨任务迁移self-attributing(信用分配):解决多步 credit assignment
三条因果
五条铁律可以压缩成三条互不重叠的因果链:
1. Verifier 决定闭环是否成立
确定性、防篡改、可复现、held-out,四条缺一不可。没有它们,闭环产出的不是能力而是拟合。
2. 迭代速度决定复利
rollout/验证占约 90% 时间,压缩它等于加速进化。这是系统中唯一的复利变量,其余优化都是线性收益。
3. 隔离与护栏决定闭环是否可控
能力越线应自动升级监控,而不是停止循环。护栏的作用是改变边界,不是占据热路径。
常见错轴:拿人类信号补 verifier
一个典型误诊:判定了”最薄弱的是 verifier”,开出的药却是”人类 idea 添佐料”。
这两者不在一个轴上:
| 人类 idea 提供 | Verifier 需要 | |
|---|---|---|
| 作用对象 | 课程(curriculum)、准则(criteria) | 评分完整性 |
| 属性 | taste、方向、真实任务分布 | 确定性、防篡改、可复现、held-out |
| 信号密度 | 稀疏、noisy | 密集、可重复 |
用稀疏 noisy 的人类信号去补验证完整性,结果是被舞弊者精确拟合的评分器 + 一堆”高分垃圾”。材料中的 2.4% 作弊率就是这个病理的真实采样,而且是下限观测,单点数据无法区分偶发与结构性。
人类信号该去的地方是课程与准则,不是 evaluator。
热路径 vs 更新边界
与之配套的另一条判断:人工检查点塞进热路径等于给复利上刹车。
正确形态是异步投递 + 边界消费:
- 人(或监督 agent)在任意时刻投递信号,不阻塞循环
- 循环在安全边界(更新提交点)消费信号
- 监控升级本身也是被调度的动作,而非同步等待
这与 V2 Session 的 durable inbox + advisory wake 是同一个模式:投递与消费解耦,监督不进入热路径。
两条判断合起来是同一个结论:护栏和人类信号都要有,但都必须位于更新边界之外。
与已有知识的关系
RSI 在 agent-continual-learning 的三层框架里有明确落点:
| 层 | RSI 中的角色 | 对应实现 |
|---|---|---|
| Model | 权重更新(材料中的 W) | Claude 改 Claude、GLM-5.3 后训练 scaling |
| Harness | 外壳与流程自优化(材料中的 H) | meta-harness、sia、prime-agent |
| Context | 记忆/技能/课程沉淀 | agent-skill-self-update、darwin-skill |
AlphaEvolve 属于 Harness 层但闭环最完整;SIA 走 W+H 双维度;Meta-Harness 只改 harness 不改权重,但提供了可复现的搜索循环参考。三者的共同前置条件都是 traces 与 evaluator。
Verifier 设计的正面样例可参考 deepswe:verifier 人工编写,测软件行为而非实现细节。
工程检查清单
搭建任何自进化闭环前先过一遍:
- 评分能否完全自动化?不能则先解决评分,不要先解决循环
- 被优化方能否读到或改到评分器、测试集、日志?能则闭环无效
- 是否有 held-out 集合且从未进入优化可见范围
- 单轮 rollout + 验证耗时是多少?这是决定复利速度的数
- 监督信号走的是热路径还是更新边界?前者要改
- 能力越线后触发什么动作?要能自动升级监控
- 改动是否可回滚?快照与回滚是迭代的前提
未解问题
- 谁验证 verifier:材料只给了隔离与 held-out,没有 verifier 自身的漂移检测与轮换机制
- 2.4% 的稳态性质:单点观测,无法判断是偶发抖动还是结构性下限
- 15,000x 的基线:相对人工多久、在什么任务集上,缺失会导致数字在传播中失真
- 时间点需核验:“2026-07 AlphaEvolve GA 商用”、“Gemini 3.8 官方说明”、“Brin 资源倾斜”目前只有二次整理,缺一手链接
- 跨域迁移:窄域闭环打通后,能力能否迁移到相邻域仍无系统性证据
相关
- agent-continual-learning — Model/Harness/Context 三层框架,RSI 的分层落点
- darwin-godel-machine — 用基准实证验证替代形式化证明的关键样本;其冻结验证器正是本页”verifier 缺口”的实例
- meta-harness — Harness 自动优化循环,文件系统级 traces 诊断
- agent-harness-anatomy — Agent = Model + Harness,理解”改的是什么”的前置
- sia — W+H 双维度自改进框架
- prime-agent — Continual Harness 小步证据驱动自进化
- openai-cookbook-agent-improvement-loop — Traces → Feedback → Evals → Codex 工程闭环
- 2606.12683_from-agi-to-asi — DeepMind 四条 AGI→ASI 路径中的 Recursive Improvement
- agent-skill-self-update、darwin-skill — Context 层的自更新实践
- deepswe — verifier 人工编写、测行为不测实现的样例