系统综述代码作为 Agent Harness 基础设施的统一视角,将 Code 定位为 Agent 推理/行动/环境建模的执行基底,而非仅仅是生成目标。涵盖 Harness 接口、机制与多 Agent 编排三层结构,梳理从编程助手到 DevOps 的跨领域应用。
核心观点
LLM 在代码理解/生成上的能力不断提升,但在 Agent 系统中,代码的角色已超越”待生成的输出”,正在成为 Agent 推理、行动和环境建模的操作基底。
代码作为 Harness 接口的三大特性:
- 可执行(Executable):模型输出可转化为可形式验证的操作
- 可检查(Inspectable):中间计算以结构化 trace 暴露,Harness 可读取、存储、响应
- 有状态(Stateful):不断演进的程序跨步骤持久化表示任务进展
自主性的瓶颈不仅是基础模型的推理能力,也在于将模型输出连接到长期动作和持久状态的系统可靠性。
三层结构框架
Layer 1:Harness 接口(Interface)
Code 如何连接 Agent 与推理、行动、环境建模:
- Program-aided reasoning:外化中间计算为可执行代码
- 具身 Agent 中代码作为可执行策略
- 代码库 / 执行 trace / 测试 / 运行时反馈作为环境状态结构化表示
代码范围(广义但不模糊):程序/脚本/形式规范/证明脚本/API Schema/工具定义/测试/代码库/模拟器/配置文件,以及 trace 和日志(当其由可执行系统产生或消费时)。
Layer 2:Harness 机制(Mechanisms)
长视野执行的关键机制:
- 规划(Planning):代码驱动的任务分解与执行
- 记忆(Memory):持久化状态管理
- 工具使用(Tool Use):代码作为工具调用接口
- 反馈控制与优化(Feedback-driven Control):使 Harness 可靠且自适应
Layer 3:多 Agent 编排(Scaling)
从单 Agent 到多 Agent 场景:
- 共享代码制品支持多 Agent 协调
- 代码级 Review 与验证机制
- 跨 Agent 的状态同步
应用领域覆盖
- 编程助手(Coding Assistants)
- GUI/OS 自动化
- 具身 Agent(Embodied Agents)
- 科学发现(Scientific Discovery)
- 个性化与推荐
- DevOps
- 企业工作流
关联
- agent-harness-anatomy — Agent Harness 解剖:Harness 层的定义与组件
- meta-harness — Stanford meta-harness:Harness 自动优化框架
- opensources/openclaw — OpenClaw 是典型的 Code-as-Harness 实践
- papers/agents-last-exam — ALE 基准在 GCUA Agent 配置中体现了完整 Harness 五层能力