SIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.

1.7k stars | Python | MIT | 2026 | arXiv: 2605.27276

SIA(Self-Improving AI)通过协调三类 Agent 循环更新 Harness 和模型权重,实现自主性能提升。论文报告 LawBench +56.6%、GPU Kernel 运行时 -91.9%、单细胞 RNA 去噪 +502%。

核心架构:三 Agent 循环

Meta-Agent
  → 读取任务描述,生成初始 Target Agent

Target Agent(任务专属)
  → 执行任务,记录行为和结果

Feedback/Improvement Agent
  → 分析执行日志,识别改进点,更新 Target Agent

每一代迭代后,Target Agent 能力提升,进入下一轮循环。

两种改进维度(W+H)

  • Harness 更新(H):更新 Agent 的工具调用、提示词、工作流程
  • 权重更新(W):微调模型本身的权重(W+H 组合效果最优)

基准测试结果

基准任务SIA 结果提升
LawBench中文法律罪名预测70.1% Top-1超越 SOTA(45%)56.6%
MLE-Bench HardKaggle ML 竞赛流水线#1 排名-
AlphaFold-3 TriMul TritonGPU Kernel 优化14x 加速运行时 -91.9%
scRNA-seq Denoising单细胞 RNA 去噪0.289 MSE+502%

安装

# Claude Agent SDK(仅 Claude 模型)
pip install 'sia-agent[claude]'
export ANTHROPIC_API_KEY="..."
 
# OpenHands(多 Provider:Gemini/OpenAI/Anthropic)
pip install 'sia-agent[openhands]'

内置任务

gpqa / lawbench / longcot-chess / spaceship-titanic

与 Agent 自进化的关系

SIA 是 Agent 自进化(Self-evolution)方向的具体实现:Meta-Agent 负责「如何改进改进的方式」,是元学习在 Agent 工程中的落地。与 Darwin Skill 的侧重不同——Darwin 改进 Skill 文本,SIA 改进完整 Agent(Harness + 权重)。

相关页面