论文:WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation 作者:Shuangrui Ding et al. (Shanghai AI Laboratory / CUHK / Fudan / USTC) 发布:2026-05-11 | arXiv:2605.10912

核心问题

现有 Agent 基准的四大缺陷:

  1. 合成沙箱而非真实运行时(WebArena、OSWorld 等)
  2. 短时域任务(< 1 分钟完成)
  3. Mock API 替代真实工具调用
  4. 仅检查最终答案,不审计轨迹和副作用

WildClawBench 同时解决这四个问题。

基准设计

规模与结构

  • 60 个任务,人工编写,双语(36 英文 + 24 中文),26 个多模态任务
  • 6 个类别:生产力流程 / 代码智能 / 社交互动 / 搜索检索 / 创意合成 / 安全对齐
  • 时间预算:300–1200 秒/任务,均值 881 秒
  • 实际耗时:Claude Opus 4.6 下平均 8.5 分钟、26 次工具调用

支持的 Harness

  • openclaw(默认)
  • Claude Code
  • Codex
  • Hermes Agent

每个 Harness 打包为独立 Docker 镜像,固定 OS、Python 工具链、预装二进制(browser、ffmpeg、git 等)。

评分策略(三层混合)

  1. 规则检查:文件存在性、格式、数值精度、字符串匹配、工作区清洁度
  2. 环境状态审计:邮件/日历/聊天 API 的操作日志,安全任务的危险操作拒绝验证
  3. LLM/VLM 裁判:叙事报告、生成图像、视频片段等无法精确匹配的输出

数据构建流程(4 阶段)

  1. 任务编写:8 名研究员 × 2 周,要求长时域 + 多工具编排 + 可验证副作用
  2. 参考答案构建:人工专家预先构建 grading point
  3. 任务过滤:模型得分差 ≥ 0.2(避免天花板/地板效应)+ 人工审核
  4. 迭代精炼:修订 prompt、rubric、grader,增强干扰项

实验结果

主要发现(19 个前沿模型,OpenClaw harness)

模型总分
Claude Opus 4.762.2%
其余所有模型< 60%
最低分19.3%
分数跨度43 个百分点

关键结论

  • Harness 影响巨大:同一模型换 Harness 最多差 18 分(MiMo V2 Pro: Claude Code vs Hermes Agent)
  • 多模态任务更难:GPT 5.4 多模态 40.2% vs 纯文本 58.0%;Claude Opus 4.7 多模态 58.5% vs 纯文本 65.0%
  • 时间预算和可用 Skill 也影响得分
  • 结论:Scaffold、工具使用、轨迹、产出物都是被评测系统的一部分,不是实现细节

与其他基准对比

基准跨模态可审计原生运行时双语可复现验证方式
SWE-bench✗△△✗✓Exec
WebArena△△✗✗✓State
OSWorld✓✓△✗✓Hybrid
Claw-Eval✓✓△✓✓Hybrid
WildClawBench✓✓✓✓✓Hybrid

六类任务详解

  • 生产力流程(10):arXiv 摘要聚合、PDF 批量分类、LaTeX 表格提取、邮件排期
  • 代码智能(12):无文档代码库理解、SAM3 推理脚本、视觉谜题、benchmark 复现
  • 社交互动(6):多轮多方邮件/聊天协调,时区冲突、权限约束
  • 搜索检索(11):学术合作路径追踪、本地/网络信息矛盾消解、受限产品搜索
  • 创意合成(11):足球比赛报告+剪辑、产品海报生成、英中视频配音、论文转海报
  • 安全对齐(10):提示注入检测、git 历史凭证泄露、恶意 Skill 注入抵抗、危险命令拒绝

相关链接