Agent Harness 工程化综述,提出 ETCLOVG 七层分类体系,映射 170+ 开源项目,核心论断:任务可靠性取决于 Harness 层质量而非底层模型,OpenReview。
核心论断
生产中 LLM Agent 的任务执行可靠性,取决于包裹模型的基础设施层(Agent Harness)工程质量,而非底层模型本身。
围绕三个核心主张展开:
- Agent Harness 是独立的系统层,其工程质量驱动了现实世界可靠性的大部分
- ETCLOVG 七层分类体系:比此前六组件框架扩展了 Observability 和 Governance 为独立架构关注点
- 170+ 开源项目映射到分类体系,暴露生态模式、覆盖空白和新兴设计原则
工程演进三阶段
Prompt Engineering → Context Engineering → Harness Engineering
每个阶段都是对上一个阶段能力边界的突破。
ETCLOVG 七层分类体系
| 层 | 英文 | 职责 |
|---|---|---|
| E | Execution Environment | 执行环境:沙箱、容器、权限隔离 |
| T | Tool Interface | 工具接口:外部工具调用、API 集成 |
| C | Context Management | 上下文管理:记忆、压缩、检索 |
| L | Lifecycle / Orchestration | 生命周期/编排:多步任务规划、子 Agent 调度 |
| O | Observability | 可观测性:日志、追踪、指标(新增独立层) |
| V | Verification | 验证:输出验证、安全检查 |
| G | Governance | 治理:权限、审计、合规(新增独立层) |
三大工程权衡
- Cost-Quality-Speed Trilemma:成本/质量/速度三角
- Capability-Control Tradeoff:能力越强越难控制
- Harness Coupling Problem:Harness 与具体 Agent 实现耦合度管理
来自生产实践的工程原则
综合 OpenAI、Anthropic、LangChain 的生产部署经验,填补从业者知识与研究词汇之间的鸿沟。
与已有 wiki 内容的关系
- agent-harness-anatomy 来自 LangChain 视角的六组件框架,本论文将其扩展为 ETCLOVG 七层,并补充 Observability 和 Governance
- openclaw-acp-protocol、openclaw-sessions-tools 对应 ETCLOVG 中的 L(Orchestration)层
- tokenjuice 对应 C(Context Management)层
- claude-code-permissions 对应 G(Governance)+ E(Execution Environment)层
- 2605.10912_wildclaw-bench 是 V(Verification)层的基准测试实践
资源
- OpenReview:https://openreview.net/forum?id=3hXEPbG0dh
- PDF:https://openreview.net/pdf?id=3hXEPbG0dh
- 代码/项目列表:暂未公开