系统综述代码作为 Agent Harness 基础设施的统一视角,将 Code 定位为 Agent 推理/行动/环境建模的执行基底,而非仅仅是生成目标。涵盖 Harness 接口、机制与多 Agent 编排三层结构,梳理从编程助手到 DevOps 的跨领域应用。

核心观点

LLM 在代码理解/生成上的能力不断提升,但在 Agent 系统中,代码的角色已超越”待生成的输出”,正在成为 Agent 推理、行动和环境建模的操作基底。

代码作为 Harness 接口的三大特性:

  • 可执行(Executable):模型输出可转化为可形式验证的操作
  • 可检查(Inspectable):中间计算以结构化 trace 暴露,Harness 可读取、存储、响应
  • 有状态(Stateful):不断演进的程序跨步骤持久化表示任务进展

自主性的瓶颈不仅是基础模型的推理能力,也在于将模型输出连接到长期动作和持久状态的系统可靠性。

三层结构框架

Layer 1:Harness 接口(Interface)

Code 如何连接 Agent 与推理、行动、环境建模:

  • Program-aided reasoning:外化中间计算为可执行代码
  • 具身 Agent 中代码作为可执行策略
  • 代码库 / 执行 trace / 测试 / 运行时反馈作为环境状态结构化表示

代码范围(广义但不模糊):程序/脚本/形式规范/证明脚本/API Schema/工具定义/测试/代码库/模拟器/配置文件,以及 trace 和日志(当其由可执行系统产生或消费时)。

Layer 2:Harness 机制(Mechanisms)

长视野执行的关键机制:

  • 规划(Planning):代码驱动的任务分解与执行
  • 记忆(Memory):持久化状态管理
  • 工具使用(Tool Use):代码作为工具调用接口
  • 反馈控制与优化(Feedback-driven Control):使 Harness 可靠且自适应

Layer 3:多 Agent 编排(Scaling)

从单 Agent 到多 Agent 场景:

  • 共享代码制品支持多 Agent 协调
  • 代码级 Review 与验证机制
  • 跨 Agent 的状态同步

应用领域覆盖

  • 编程助手(Coding Assistants)
  • GUI/OS 自动化
  • 具身 Agent(Embodied Agents)
  • 科学发现(Scientific Discovery)
  • 个性化与推荐
  • DevOps
  • 企业工作流

关联

  • agent-harness-anatomy — Agent Harness 解剖:Harness 层的定义与组件
  • meta-harness — Stanford meta-harness:Harness 自动优化框架
  • opensources/openclaw — OpenClaw 是典型的 Code-as-Harness 实践
  • papers/agents-last-exam — ALE 基准在 GCUA Agent 配置中体现了完整 Harness 五层能力

资源