评测集定义与方法论见 vibe-code-bench。本页只放分数:各模型”从零构建完整 Web 应用”的能力强度。

排行榜(v1.1 canonical,数据更新于 2026-08-12,本页抓取于 2026-08-13)

共 79 个模型配置,全部使用 OpenHands harness。前 20:

#模型Accuracy±stderr成本/测试厂商
1Claude Fable 590.35%2.10$41.71Anthropic
2Claude Opus 588.40%3.00$33.88Anthropic
3Kimi K384.96%2.69$17.59Moonshot AI
4Claude Opus 4.882.72%3.08$26.88Anthropic
5Claude Sonnet 581.33%3.05$38.08Anthropic
6GPT-5.6 Sol80.50%3.72$33.40OpenAI
7Meta muse_spark 1.279.10%3.31$1.53Meta
8Claude Opus 4.8(Claude Code harness)77.48%3.74$6.86Anthropic
9GPT-5.6 Luna77.06%3.07$0.73OpenAI
10Grok 4.676.24%3.82$4.88SpaceXAI
11DeepSeek-V4-Flash74.74%3.44$0.20DeepSeek
12Meta muse_spark 1.172.16%3.33$0.92Meta
13Claude Opus 4.771.00%4.51$21.41Anthropic
14GPT-5.569.85%4.54$16.66OpenAI
15Grok 4.569.00%4.48$4.10SpaceXAI
16GPT-5.6 Terra67.84%5.10$4.33OpenAI
17GPT-5.4(2026-03-05)67.42%4.84$10.69OpenAI
18GPT-5.5 Factory67.39%4.75$5.93OpenAI
19Qwen3.8-Max64.70%5.36$8.24Alibaba
20Gemini 3.6 Flash64.00%4.29$3.04Google

(其后:GLM-5.2 63.96%、GPT-5.3-Codex 61.77%、Claude Opus 4.6 57.57% 等,共 79 条)

分数观察

  1. frontier 已过 high-80s:v1(2026-02)17 个模型只有 8 个过 20%、榜首 41.31%;v1.1 榜首 90.35%,半年翻倍
  2. Kimi K3 是第一个进入第一梯队的开源权重模型(第 3),弥合了此前 20+ 分的开源/闭源差距;但其余开源模型仍明显落后
  3. 排名不可迁移:SWE-bench Verified / Terminal-Bench 上的相对顺序在本榜不成立
  4. 没有模型稳定满分:头部模型仍有低分 outlier,可靠的端到端应用开发仍是开放问题
  5. 成本差 200x:榜首 Claude Fable 5 0.20/测试