一句话定位:2026 年 3 月以 Karpathy autoresearch 为起点爆发的「AI 自主做科研」开源工具链,8 款代表项目覆盖从极简实验循环到端到端论文生成的全谱系。

五大技术流派

流派代表项目核心哲学
极简单任务派Karpathy autoresearchAI 收敛到最机械的实验迭代,人类把控方向
泛化迭代派uditgoenka autoresearchKarpathy Loop 泛化到任何可量化任务
全流程端到端派AutoResearchClaw, The AI ScientistAI 是完整「虚拟研究员」,人仅提供 idea
进化记忆派EvoScientist双记忆库解决「无法积累经验」的核心瓶颈
工具链赋能派ARIS, Dr. Claw, OrchestraAI 做「科研副驾驶」,可插拔按需组合

项目速览

Karpathy autoresearch

  • GitHub: karpathy/autoresearch,~630 行 Python,MIT
  • 三文件架构:prepare.py(不可变评估)、train.py(Agent 沙盒)、program.md(自然语言指令)
  • 指标:val_bpb(validation bits per byte),词表无关
  • 循环:读源码 → 改 train.py → 训练 5 min → 评估 → 保留/回滚,~12 exp/h,一夜 ~100 exp
  • 实绩:2 天 700 实验,Time-to-GPT-2 从 2.02h → 1.80h(↓11%)
  • 短板:场景极度单一(仅 LLM 训练),无文献/论文能力

uditgoenka autoresearch

  • GitHub: uditgoenka/autoresearch,⭐ 2.3k,MIT,Claude Code 插件
  • 8 条铁律:原子修改、机械验证、自动回滚、Git-as-memory 等
  • 9 命令集:/autoresearch、/autoresearch:security、/autoresearch:debug、/autoresearch:predict(5 角色辩论)等
  • Guard 回归防护 + Crash Recovery 机制
  • 与 Karpathy 区别:场景从 ML 训练扩展到任意可量化任务

AutoResearchClaw

  • GitHub: aiming-lab/AutoResearchClaw
  • 8 相位 23 阶段流水线:研究定义 → 文献检索 → 知识综合 → 假设生成(辩论)→ 实验设计执行 → 分析决策 → 论文撰写 → 引用验证
  • 多视角辩论 + 4 层引用校验(anti-fabrication guard)
  • 输出 NeurIPS/ICML 模板 LaTeX 论文
  • 短板:算力要求较高(8G+ 显存),创新深度依赖基座模型

EvoScientist

  • arXiv 2603.08127(2026-03-09)
  • 三 Agent:RA(idea 生成)+ EA(实验执行)+ EMA(经验蒸馏)
  • 双记忆模块:Ideation Memory(高质量/失败方向)+ Experimentation Memory(有效策略/最佳代码)
  • 评估:6 篇论文投 ICAIS 2025,6 投 6 中,超 7 个 SOTA
  • 短板:架构复杂,算力存储要求高

ARIS(Auto-Research-In-Sleep)

  • GitHub: wanshuiyin/Auto-claude-code-research-in-sleep
  • 每个 skill 就是一个 SKILL.md,任何 LLM agent 可读取执行
  • executor + reviewer 对抗式协作,克服单模型盲区
  • 兼容 Claude Code / Codex CLI / Cursor / Trae / Windsurf
  • 短板:无自主实验执行能力

The AI Scientist(Sakana AI)

  • GitHub: SakanaAI/AI-Scientist-v2
  • 里程碑:v2 生成的论文通过 ICLR 2025 workshop 同行评审,平均分 6.33,超过 55% 人类论文(团队主动撤稿)
  • Nature 发表:首个通过顶会同行评审的 AI 科研系统
  • 短板:部署极高(GPU 集群 + 64G 内存),算力成本极高

全流程能力评分(10 分制)

项目文献调研假设生成实验执行结果分析论文撰写同行评审
autoresearch0310800
AutoResearchClaw988898
EvoScientist9109989
ARIS754689
The AI Scientist10109101010
uditgoenka autoresearch058700

选型建议

  • 有 GPU 做 ML 调参 → Karpathy autoresearch
  • 快速出论文初稿 → AutoResearchClaw
  • 长期深耕单领域 → EvoScientist
  • 给现有 agent 加科研技能 → ARIS
  • 无代码基础 / 多项目管理 → Dr. Claw
  • 任意可量化任务自主优化 → uditgoenka autoresearch
  • 顶级机构高严谨性研究 → The AI Scientist

组合使用

  • autoresearch(跑实验)+ ARIS(文献综述)+ Research-Claw(日常管理)
  • uditgoenka autoresearch(代码迭代)+ ARIS(科研特定能力)互补短板

Open Problems

  • 实验可复现性:多 GPU / 长训练场景如何公平比较?
  • 学术诚信:AI 生成论文的伦理规范仍需社区共识
  • 记忆污染:错误经验如何清洗?遗忘机制需更好设计
  • 互操作标准:各家 skill 格式仍不统一(Markdown-as-Protocol 方向正确但未收敛)
  • Agent 锁定风险:强绑定特定 agent 的可移植性问题

相关