Skill 自动进化系统 —— 评估、改进、测试、只保留有改进的修改。受 Karpathy autoresearch 启发。

为什么值得关注

Agent Skill 生态在快速扩张(Claude Code、Codex、OpenClaw 等),当 Skill 数量超过手动维护能力时,需要系统化的质量管理。传统审查只检查结构格式,达尔文.skill 同时评估结构质量和实际效果,用棘轮机制确保只保留改进。

核心特性

  • 双重评估:静态结构分析(60分)+ 实际运行效果(40分),总分100
  • 棘轮机制:分数只升不降,退步自动 git revert,不积累局部退化
  • 独立评分:子 agent 独立评分,避免「自己改自己评」的偏差
  • 人在回路:每个 Skill 优化完后暂停,展示 diff + 分数变化,等用户确认
  • 8 维评估体系:覆盖结构完整度、触发精准度、步骤可执行性、实测表现等

技术栈

  • 基于 SKILL.md 格式(Claude Code / Codex / OpenClaw 等通用)
  • HTML(标签/文档层)
  • Git 作为版本管理和回滚机制
  • 子 agent 架构实现独立评分

适用场景

  • 管理大量 Skill(10+)需要系统化质量保障时
  • 想持续优化现有 Skill 但不确定改动是否有效时
  • 团队协作中需要 Skill 质量不随时间退化时

局限性

  • 仅支持 SKILL.md 格式的 Skill 优化
  • 评估依赖子 agent 能力,评分标准可能有波动
  • 新项目(2026-04 创建),生态和社区尚在早期

生态系统

  • 直接灵感来源:Karpathy 的 autoresearch
  • 目标平台:Claude Code、Codex、OpenClaw、Trae、CodeBuddy
  • 作者相关:花叔 (bookai.top, huasheng.ai)

项目数据

指标值
Stars1,293
Forks152
LicenseMIT
创建时间2026-04-13
语言HTML

个人评价

思路清晰,把 autoresearch 的「只保留可测量改进」理念迁移到 Skill 质量管理,解决了 Skill 生态扩张后的维护痛点。8 维评估体系和棘轮机制设计合理。作为新项目增长迅速(一周 1.2k star),值得关注后续发展。