一句话定位:给 AI agent 一个真实的 LLM 训练环境,让它夜间自主改代码、跑实验、看指标,人类早上醒来看结果。

GitHub: https://github.com/karpathy/autoresearch Stars: 74,560 | Language: Python | License: MIT

为什么值得关注

  • Karpathy 本人项目,2026 年 3 月发布,引爆「AI 自主做科研」赛道
  • 极简设计(~630 行),却展示了 AI 自主实验迭代的完整范式
  • 实绩:2 天 700 实验,Time-to-GPT-2 从 2.02h → 1.80h(↓11%);Shopify CEO 一夜 37 实验 ↓19%

核心特性

  • 三文件架构:prepare.py(不可变评估)、train.py(Agent 沙盒)、program.md(自然语言指令)
  • 固定 5 分钟时间预算:每次实验 wall clock 5 分钟,~12 exp/h,一夜 ~100 exp
  • 单一指标:val_bpb(validation bits per byte),词表无关,公平比较不同架构
  • 棘轮机制:改进则保留 commit,退步则 git reset,只进不退
  • 评估与实验完全隔离:prepare.py 不可改,杜绝 AI 作弊

实验循环

Human ──→ program.md (自然语言指令)
              │
              ▼
         AI Agent (Claude / Codex)
              │
         读 + 改 train.py → git commit
              │
              ▼
         GPU 训练 5 min → eval val_bpb
              │
         ┌────┴────┐
       improve?   no → git reset
         │
       keep → results.tsv → 下一轮

技术栈

  • Python 3.10+,uv 包管理
  • 单 NVIDIA GPU(测试于 H100)
  • 基于 nanochat(简化版单 GPU LLM 训练)
  • 无分布式训练,无复杂配置

适用场景

  • 有 GPU 的 ML 研究者,想自动化超参/架构搜索
  • 夜间无人值守的实验迭代
  • 验证「AI 自主做科研」范式的起点

局限性

  • 场景极度单一:仅 LLM 训练(nanochat)
  • 无文献调研、论文撰写能力
  • 无多 Agent 协作
  • 需要 NVIDIA GPU(社区有 MacOS/AMD/Windows fork)
  • 强依赖 Claude/Codex API

生态系统

个人评价

设计哲学极度克制:只做一件事(ML 实验迭代),把它做到极简。prepare.py 不可改这个设计尤其聪明——既防止 AI 作弊,又强制人类明确定义「什么是成功」。program.md 作为人机接口的设计也值得借鉴:人类用自然语言定义研究方向,AI 负责机械执行。