递归自我改进(Recursive Self-Improvement)的核心问题不是”AI 会不会自己变强”,而是”什么样的闭环在工程上真的成立”。本文按现有证据给出判据、证据地图与失败模式。

一句话结论

RSI 已经在窄域闭环里发生了,判据是三个可检验条件而非智能水平:

  1. 目标能被自动评分(evaluator 存在)
  2. 评估与监督位于更新边界之外(不可被被优化方改写)
  3. 优化范围足够窄、能分层递进(不是整体 FOOM)

三者同时满足且有外部可复现结果的案例,目前公开界最实锤的是 AlphaEvolve。

判据展开

条件反面(闭环不成立)工程含义
可自动评分目标只能靠人类主观判断没有 evaluator 就没有信号,循环退化为自我安慰
评估在更新边界外被优化方可以改评分器/测试/日志evaluator isolation 是第一漏洞面
窄域可分层一上来改整个系统先 kernel → 调度 → 训练配方逐点打通

第三条常被误读为能力限制,其实是工程可行性约束:窄域才有确定性 evaluator,才谈得上迭代。

证据地图

按证据强度排序,数字来自材料整理,标注为待一手核验。

强度案例性质关键数字
最强AlphaEvolve数学结果可独立复现 + 生产系统收益Strassen 56 年纪录、Borg 回收全球算力 0.7%、Gemini 训练 kernel +23%
较强Claude 改 Claude内部流程,含关键负面证据自动对齐修复循环效率为人工 15,000 倍;2.4% 研究转录在作弊
路线宣示Gemini 3.8 官方措辞、Brin 资源倾斜(Reuters 2026-08)指向明确,缺可复现细节”long-running agent loops designed to recursively evaluate and refine the underlying models”
工程框架AgentEvolver、slime、GLM-5.3提供”闭环怎么搭”的组件,而非结果基座不变、纯靠 RL 环境/后训练 scaling 抬上界

AlphaEvolve 里最关键的是 Gemini 训练 kernel 那一项:它改进的是自己的训练系统,构成公开可见的递归闭环,而不只是”AI 帮人优化某个外部程序”。

AgentEvolver 三件套

通义 AgentEvolver 的三件套恰好对应 RL 环境侧的三个卡点,值得单独记:

  • self-questioning(自出题):解决课程来源
  • self-navigating(经验复用):解决跨任务迁移
  • self-attributing(信用分配):解决多步 credit assignment

三条因果

五条铁律可以压缩成三条互不重叠的因果链:

1. Verifier 决定闭环是否成立

确定性、防篡改、可复现、held-out,四条缺一不可。没有它们,闭环产出的不是能力而是拟合。

2. 迭代速度决定复利

rollout/验证占约 90% 时间,压缩它等于加速进化。这是系统中唯一的复利变量,其余优化都是线性收益。

3. 隔离与护栏决定闭环是否可控

能力越线应自动升级监控,而不是停止循环。护栏的作用是改变边界,不是占据热路径。

常见错轴:拿人类信号补 verifier

一个典型误诊:判定了”最薄弱的是 verifier”,开出的药却是”人类 idea 添佐料”。

这两者不在一个轴上:

人类 idea 提供Verifier 需要
作用对象课程(curriculum)、准则(criteria)评分完整性
属性taste、方向、真实任务分布确定性、防篡改、可复现、held-out
信号密度稀疏、noisy密集、可重复

用稀疏 noisy 的人类信号去补验证完整性,结果是被舞弊者精确拟合的评分器 + 一堆”高分垃圾”。材料中的 2.4% 作弊率就是这个病理的真实采样,而且是下限观测,单点数据无法区分偶发与结构性。

人类信号该去的地方是课程与准则,不是 evaluator。

热路径 vs 更新边界

与之配套的另一条判断:人工检查点塞进热路径等于给复利上刹车。

正确形态是异步投递 + 边界消费:

  • 人(或监督 agent)在任意时刻投递信号,不阻塞循环
  • 循环在安全边界(更新提交点)消费信号
  • 监控升级本身也是被调度的动作,而非同步等待

这与 V2 Session 的 durable inbox + advisory wake 是同一个模式:投递与消费解耦,监督不进入热路径。

两条判断合起来是同一个结论:护栏和人类信号都要有,但都必须位于更新边界之外。

与已有知识的关系

RSI 在 agent-continual-learning 的三层框架里有明确落点:

层RSI 中的角色对应实现
Model权重更新(材料中的 W)Claude 改 Claude、GLM-5.3 后训练 scaling
Harness外壳与流程自优化(材料中的 H)meta-harness、sia、prime-agent
Context记忆/技能/课程沉淀agent-skill-self-update、darwin-skill

AlphaEvolve 属于 Harness 层但闭环最完整;SIA 走 W+H 双维度;Meta-Harness 只改 harness 不改权重,但提供了可复现的搜索循环参考。三者的共同前置条件都是 traces 与 evaluator。

Verifier 设计的正面样例可参考 deepswe:verifier 人工编写,测软件行为而非实现细节。

工程检查清单

搭建任何自进化闭环前先过一遍:

  1. 评分能否完全自动化?不能则先解决评分,不要先解决循环
  2. 被优化方能否读到或改到评分器、测试集、日志?能则闭环无效
  3. 是否有 held-out 集合且从未进入优化可见范围
  4. 单轮 rollout + 验证耗时是多少?这是决定复利速度的数
  5. 监督信号走的是热路径还是更新边界?前者要改
  6. 能力越线后触发什么动作?要能自动升级监控
  7. 改动是否可回滚?快照与回滚是迭代的前提

未解问题

  1. 谁验证 verifier:材料只给了隔离与 held-out,没有 verifier 自身的漂移检测与轮换机制
  2. 2.4% 的稳态性质:单点观测,无法判断是偶发抖动还是结构性下限
  3. 15,000x 的基线:相对人工多久、在什么任务集上,缺失会导致数字在传播中失真
  4. 时间点需核验:“2026-07 AlphaEvolve GA 商用”、“Gemini 3.8 官方说明”、“Brin 资源倾斜”目前只有二次整理,缺一手链接
  5. 跨域迁移:窄域闭环打通后,能力能否迁移到相邻域仍无系统性证据

相关