一句话定位:百度搭子(DuMate)出品的「真实办公交付」Agent 基准——200 道从真实用户 session 脱敏重建的多工具工作流任务,跑在注入了故障与噪声的 Docker 环境里,最终按「产物是否真的交付出来」评分,而不是按回答对不对评分。
分数快照见 dumatebench,打榜实操见 dumatebench。
它不是 Coding Agent 榜。200 题里只有 88 道涉及代码,且多为「办公 + 编码」混合工作流。在 coding-agent-leaderboards 的分类里,它与 Terminal-Bench 同属「harness 工程证明」,不属「代码修复能力」类。
为什么值得关注
- 国内唯一开放可打的 harness 榜:采用通用评测框架 + 开放接入接口,任意 Harbor 兼容 agent 都能提交;公司/厂商友好,无 SWE-bench 官方榜那样的学术身份限制
- 直接给 harness 排名:榜上的对手包括 OpenClaw、OpenCode、Claude Code、Hermes——与「OpenCode 二开」的定位正面相关,且有现成基线可对标
- failure 注入是设计核心:Insufficient(缺工具/依赖)、Unstable(网络/API/OCR 抖动)、Noisy(干扰/过期/冲突文件)三类环境。多数基准假设干净环境,这里专测脏环境下的恢复能力
- 产物级评测:判分对象是最终 workspace 里的 DOCX/Excel/PPTX/PDF/图片等交付物,能覆盖「多解任务」的语义质量;200 题全部来自真实用户 session 重建
- 可与 Terminal-Bench 复用投入:两者都用 Harbor 执行,agent 适配工作可以共享
评测集构成
| 项 | 说明 |
|---|---|
| 题量 | 200 道可执行任务,从匿名化、隐私筛查后的真实多轮 session 重建 |
| 场景 | 8 大类场景 / 17 个细粒度任务类型;任务构成图按 6 大领域划分 |
| 环境 | 隔离 Docker 容器,三种条件:Insufficient / Unstable / Noisy |
| 评测对象 | 5 个 agent harness × 4 个基座模型 = 20 组配置 |
| 能力覆盖 | Text 160 · Code 88 · Web 86 · Files 34 · Multimedia 46 · DOCX 读取 27 · Excel 编辑 18(一题可跨多能力) |
| 任务包结构 | instruction.md / task.yaml / task_type_feature.json / workspace_seed/ / evaluator/ / web_reference/ |
参与评测的 harness:DuMate v1.0.59、Hermes v0.19.0、Claude Code v2.1.212、OpenClaw v2026.7.1-2、OpenCode v1.18.4。 基座模型:GPT-5.5、Claude Opus-4.8、GLM-5.2、DeepSeek-V4-Pro。
评测协议
动作契约:agent 每轮只能回一个 JSON action,由 runner 在容器内执行。
{"command":"find /workspace -maxdepth 3 -type f","reason":"Inspect the available workspace files"}结束方式:
{"finish":true,"reason":"The requested artifact has been verified"}三个指标:
| 指标 | 符号 | 计算 | 含义 |
|---|---|---|---|
| Partial pass rate | P | 任务级原子检查通过比例(均值) | 确定性需求覆盖率 |
| Judge score | J | artifact 级 LLM Judge 的宏平均 | 产物的正确性/完整性/质量 |
| Final score | F | 0.3P + 0.7J | 榜单主分数 |
P的原子检查覆盖:产物存在性与路径、格式合法性、必需/禁止内容、文档结构、表格数值与公式、受保护文件完整性J的 rubric:每个受评 rubric 含 3–16 条原子标准(归一化权重),每条按 0–4 锚定打分并记录证据;cannot_assess不计正分,产物缺失记 0 分;重复 judge 时按各标准得分取中位数- 评测器与参考文件在 agent 执行期间不可访问;run 或超时后冻结 workspace 再评
单题容器限额:2 vCPU / 8GB 内存 / 12GB 存储 / 1800 秒墙钟。基础镜像 python:3.12-slim 只装通用 shell、网络、PDF 与进程工具,任务专用依赖一律不预装(这就是 Insufficient 条件的来源)。
口径矛盾(提交前必须向维护者确认):论文与官网都写
F = 0.3P + 0.7J,但仓库submissions/README.md写的是「30% complete + 30% partial + 40% judge」。两者不可能同时成立,直接影响分数复现。
关键发现(论文)
- 严格全通过率很低:GPT-5.5 视图下 Partial(需求覆盖)77.0–90.3%,而 Judge 只有 65.7–77.7%;全 20 组配置里 Partial 最高 90.9%(DuMate+Opus-4.8)、Judge 最高 83.2%(同组合)。说明「把大部分步骤做对」与「交付质量高」之间有稳定落差
- harness 影响可高达 27 分:Opus-4.8 在 DuMate 下 0.8548、在 OpenClaw 下仅 0.5821。而 DeepSeek-V4-Pro 的跨 agent 极差只有 4.63 分——harness 与模型的匹配度决定榜位
- 基座模型均值排序:DeepSeek-V4-Pro 平均 Final 最高(0.8106),其次 GPT-5.5(0.7744)、Opus-4.8(0.7734)、GLM-5.2(0.7452)
- 质量与成本强烈背离:OpenCode + GPT-5.5 每题最省(273k token)但分最低(0.6906);DuMate + Opus-4.8 最高分(0.8548)却最慢(1039s/题)且耗 1.56M token
- DuMate 在 4 个基座模型上都是第一——见下方风险提示
局限性
- 厂商自办且自己第一:DuMate 在全部 4 个基座模型下都排第一。虽然论文的 harness 分析本身有价值,但「自评第一」天然存在利益冲突,中文媒体也指出其公信力取决于后续第三方参与深度
- Judge 占 70% 权重:最终分主要由 LLM Judge 决定,可复现性与抗操纵性弱于「跑测试」类基准(对比 SWE-bench 的测试判定)
- 不是 coding 榜:Code 仅 88/200,且是办公交付语境下的编码,不能替代 SWE 类基准
- 极新,生态未起:2026-08-27 首发;GitHub 仅 8 star / 0 fork,
leaderboard/published.json为空数组——榜上 5 条是论文自跑,尚无任何外部提交真正上站 - 门槛不低:正式提交要求 ≥200 题 × 每题 ≥5 trials = 至少 1,000 次 rollout,加上 LLM Judge 调用
- 数据集体积大:公开数据集压缩包约 3.5GB,且原始任务包不含
environment/,需用仓库template_task执行dumate template fill才能跑 - 已知盲点(维护方自陈):Harbor 读 API 不暴露 job 的
created_by,CI 无法证明提交者本人产生了这个 job;当前缓解方案仍在讨论中
资源
- 官网 / 榜单:https://dumatebench.com/ | https://dumatebench.com/leaderboard
- 论文:DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows,arXiv:2608.26546(目标 WSDM 2027)
- 代码 / 提交仓库:https://github.com/baidubce/dumate-bench(Apache-2.0)
- 数据集:HuggingFace
Annihi/dumate_bench - 提交规范:仓库
leaderboard/SUBMIT.md、leaderboard/README.md
相关页面
- dumatebench — 分数快照(20 组配置 + 效率表)
- dumatebench — 怎么跑、怎么提交、成本与坑
- terminal-bench — 同类 harness 型榜(共用 Harbor 框架)
- harbor — 官方执行框架,本基准与 Terminal-Bench 共用
- coding-agent-leaderboards — 榜单横向地图(本页不属 coding 类)
- toolathlon — 跨应用工具使用基准(同为 Agent 执行类)