一句话定位:评测模型”从零到一构建完整 Web 应用”能力的 agentic 编码基准——不是解算法题、修 bug,而是给一份自然语言产品 spec,看模型能否在真实开发环境里交付一个可通过点击测试的可用应用。
为什么值得关注
- 瞄准 AI coding 最值钱的场景:从自然语言规格直接产出完整应用(zero-to-one),而非 SWE-bench/Terminal-Bench 那类孤立编程问题
- 评测方式是 point-and-click 端到端测试:用 browser-use 自主 web agent 像真实用户一样操作生成的应用并逐步验证
- 已发表同行评审论文(ACM CAIS ‘26,arXiv:2603.04601),方法论透明
- 版本迭代快、头部模型重跑,是观察 frontier 模型 app-building 能力进展的好窗口(v1 榜首 41.31% → v1.1 榜首 90.35%,半年翻倍)
评测集构成
| 项 | 说明 |
|---|---|
| 任务形态 | 每个任务 = 一份应用 spec(非技术自然语言、一页以内、MVP 导向、不指定技术栈)+ 配套测试套件 |
| Spec 来源 | LLM 生成初稿,灵感来自真实咨询案例/自由职业开发任务/创业应用模式;经专业 PM 和工程师多轮评审 |
| 测试 | 每份 spec 配 20-60 条自动化测试,覆盖核心功能/边界/关键用户流;每条测试经工程师三重验证(能测对、好的实现能过、坏的实现会挂) |
| 示例任务 | ”Zeeter”(类 Twitter 微博客:注册登录/发帖/关注/点赞评论/搜索/探索页)、Breathing Exercise App(较简单的对照任务) |
| 数据可见性 | 专有(Proprietary):非公开数据集,Vals AI 与行业专家构建;访问计划逐步开放(需在官网填表申请) |
评测环境与方法
- Harness:基于 browser-use 生态的修改版 OpenHands agentic coding 框架,Docker-in-Docker 隔离容器,模型拥有完整终端权限(装依赖/构建/起服务)
- 配套服务:自托管 Supabase(认证/数据库/文件存储)、Stripe 测试模式(支付)、MailHog(邮件)、web 浏览;API key 全部预配置
- 预算:每个应用最多 5 小时 / 1000 轮
- 工具:提供 30+ 工具(Supabase 状态管理、浏览自己跑起来的应用、web 搜索等),但实际使用高度集中——前 4 名:文件编辑、bash、SQL 执行、浏览器(实现后自测)
- 评分:Browser Use agent 执行自然语言测试(点按操作),每条测试由多个 substep 组成;单个应用得分 = 至少 90% substep 成功的测试占比;总分 = 各应用得分平均。评测成本约 $10-20/应用
- 校准:专业工程师按同标准人工抽测子集做对齐研究
排行榜
模型分数见 vibe-code-bench(v1.1 canonical 数据快照,榜首 Claude Fable 5 90.35%)。
关键发现(任务行为)
常见失败模式(人工检查 trajectory 归纳):
- 安装依赖命令首次尝试频繁失败(好模型 2-3 次内修复,差模型反复浪费轮次)
- Docker 网络配置:前端拿不到 Supabase/后端 endpoint(正解是 .env 或 build.args,
env_file只管运行时变量,很多模型卡死在此) - 超时:差模型改文件改到时间耗尽,结束时应用不可用
- 过早放弃:轮次还很多就调用 finish 提交
- 指令遵循:忘掉初始 prompt 的关键要求
v1 → v1.1 变更(2026-02-24 发布)
- 数据:认证 spec 标准化;明确评测用邮箱避免碰撞;部分 feature 的 spec 描述更清晰;Stripe 测试支付信息说明改进
- 评测:Browser Use evaluator 新增工具(更好处理 date picker 等控件)、改进等待能力、支持评测中使用 csv/jpg/png/pdf 等文件
- 所有模型用 v1.1 harness 和数据从零重跑
注:官网 v1.1 发布段落写 “February 24, 2025”,但结合”v1 时代(2026-02)榜首 41.31%“的描述,年份应为 2026,疑为笔误。
局限性
- 数据集不公开,第三方无法复现;访问需申请
- 单 harness(OpenHands)定榜,模型分数与 harness 绑定(Claude Code harness 单列一条,分数明显更低)
- 评测成本 $10-20/应用 + 模型调用费,重跑门槛高
- UI 测试由 LLM evaluator 执行,存在评测器自身误差(官方以人工抽测做对齐校准)
资源
- 官方榜单页:https://www.vals.ai/benchmarks/vibe-code(含 Pareto 曲线、应用示例托管、评测过程回放、trajectory 分析)
- 论文:Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development(ACM CAIS ‘26),https://arxiv.org/abs/2603.04601
- Zeeter spec 与评分 rubric 在官网页面内链接;示例应用托管(GPT-5.2 / Codex / Opus 4.6 / Sonnet 4.6 / Kimi K2.5 Thinking 各版本)
相关页面
- vibe-code-bench — 本基准榜单快照
- swe-bench-verified — SWE-bench Verified:修真实仓库 bug 的事实标准基准(本基准排名与其不迁移)
- 2605.10912_wildclaw-bench — WildClawBench:真实长时域 Agent 基准(另一种评测形态)
- browser-use — 本基准 UI 测试所用的自主 web agent
- meta-harness — Terminal-Bench 相关的 Harness 优化框架(本基准致谢 Terminal-Bench 团队)
- terminal-bench — Terminal-Bench:终端环境任务基准(本基准观察到与其排名不迁移)
- 2606.05405_agents-last-exam — Agents’ Last Exam:另一个长视野 Agent 基准
- humanitys-last-exam — HLE:知识前沿闭卷考(同系列评测集)
- codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
- dsbench-fullstack — DeepSeek 内部全栈测试集(能力维度与本基准最接近的内部私有基准)
- toolathlon — Toolathlon:跨应用长程工具使用基准(同系列评测集)
- deepswe — DeepSWE:原创长时域 SWE 基准(同为对抗榜饱和的新一代设计)