评测集定义与方法论见 vibe-code-bench。本页只放分数:各模型”从零构建完整 Web 应用”的能力强度。
排行榜(v1.1 canonical,数据更新于 2026-08-12,本页抓取于 2026-08-13)
共 79 个模型配置,全部使用 OpenHands harness。前 20:
| # | 模型 | Accuracy | ±stderr | 成本/测试 | 厂商 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5 | 90.35% | 2.10 | $41.71 | Anthropic |
| 2 | Claude Opus 5 | 88.40% | 3.00 | $33.88 | Anthropic |
| 3 | Kimi K3 | 84.96% | 2.69 | $17.59 | Moonshot AI |
| 4 | Claude Opus 4.8 | 82.72% | 3.08 | $26.88 | Anthropic |
| 5 | Claude Sonnet 5 | 81.33% | 3.05 | $38.08 | Anthropic |
| 6 | GPT-5.6 Sol | 80.50% | 3.72 | $33.40 | OpenAI |
| 7 | Meta muse_spark 1.2 | 79.10% | 3.31 | $1.53 | Meta |
| 8 | Claude Opus 4.8(Claude Code harness) | 77.48% | 3.74 | $6.86 | Anthropic |
| 9 | GPT-5.6 Luna | 77.06% | 3.07 | $0.73 | OpenAI |
| 10 | Grok 4.6 | 76.24% | 3.82 | $4.88 | SpaceXAI |
| 11 | DeepSeek-V4-Flash | 74.74% | 3.44 | $0.20 | DeepSeek |
| 12 | Meta muse_spark 1.1 | 72.16% | 3.33 | $0.92 | Meta |
| 13 | Claude Opus 4.7 | 71.00% | 4.51 | $21.41 | Anthropic |
| 14 | GPT-5.5 | 69.85% | 4.54 | $16.66 | OpenAI |
| 15 | Grok 4.5 | 69.00% | 4.48 | $4.10 | SpaceXAI |
| 16 | GPT-5.6 Terra | 67.84% | 5.10 | $4.33 | OpenAI |
| 17 | GPT-5.4(2026-03-05) | 67.42% | 4.84 | $10.69 | OpenAI |
| 18 | GPT-5.5 Factory | 67.39% | 4.75 | $5.93 | OpenAI |
| 19 | Qwen3.8-Max | 64.70% | 5.36 | $8.24 | Alibaba |
| 20 | Gemini 3.6 Flash | 64.00% | 4.29 | $3.04 |
(其后:GLM-5.2 63.96%、GPT-5.3-Codex 61.77%、Claude Opus 4.6 57.57% 等,共 79 条)
分数观察
- frontier 已过 high-80s:v1(2026-02)17 个模型只有 8 个过 20%、榜首 41.31%;v1.1 榜首 90.35%,半年翻倍
- Kimi K3 是第一个进入第一梯队的开源权重模型(第 3),弥合了此前 20+ 分的开源/闭源差距;但其余开源模型仍明显落后
- 排名不可迁移:SWE-bench Verified / Terminal-Bench 上的相对顺序在本榜不成立
- 没有模型稳定满分:头部模型仍有低分 outlier,可靠的端到端应用开发仍是开放问题
- 成本差 200x:榜首 Claude Fable 5 0.20/测试