一句话定位:DeepSeek 内部使用的全栈开发测试集,随 V4-Flash 正式版(2026-07-31)发布材料进入公众视野——任务、样本量、评分器均未公开,属于”厂商私有基准”,读它的价值在于观察 DeepSeek 的后训练方向,而不是当外部排名依据。
基本情况
| 项 | 说明 |
|---|---|
| 性质 | DeepSeek 内部测试集(非公开),官方注释原文:“DSBench-FullStack 是内部使用的全栈开发测试集” |
| 首次出现 | 2026-07-31 DeepSeek-V4-Flash 正式版 API 更新日志(api-docs.deepseek.com);2026-08-13 V4-Pro-0813 发布再次引用 |
| 测试协议(DeepSeek 自家模型) | DeepSeek Harness 极简模式(agent 框架),reasoning effort = max,top_p=0.95,temperature=1.0 |
| 未公开内容 | 任务数量、题目来源、验证器/评分器、运行轨迹——第三方无法复现或独立验证 |
| 姊妹测试集 | DSBench-Hard:内部困难 Coding Agent 测试集,常与 FullStack 同表发布 |
排行榜
已知分数见 dsbench-fullstack(均为 DeepSeek 发布材料口径:Opus 4.8 71.6 > V4-Flash 68.7;V4-Pro 正式版 71.1)。
怎么读这个分数
- 不是外部排名依据:第三方评论的共识——“未公开任务、样本量和评分器,适合内部回归,不适合外部排名”。不能复现的基准只能当参考信号
- 但也不是纯自夸:对比表里 Opus 4.8(71.6)压过了自家 V4-Flash(68.7),且 V4-Pro 承认落后 Fable 5 约 6 分——DeepSeek 用自家 harness 测竞品并如实发布落后结果,这在厂商私有基准里算坦诚
- 真正的价值是方向信号:为全栈开发单独立内部测试集(还配一个 Hard 版),说明 DeepSeek 后训练在重点堆”从零搭全栈应用”能力——这与 V4 系列主打 agent/工程能力的产品策略一致
- 同 harness 比较才有意义:所有分数都在 DeepSeek Harness 极简模式下跑,横向可比;拿它和其他 harness 下的 SWE-bench 分数对比没有意义
同名注意:学术界另有一个 DSBench
学术基准 DSBench(How Far Are Data Science Agents from Becoming Data Science Experts?,OpenReview/ICLR 系)与本页完全无关:那个是数据科学 agent 基准,含 466 个数据分析任务 + 74 个数据建模任务,来自真实企业与 Kaggle 竞赛,测长上下文/多模态数据科学工作流。看到”DSBench”先分清语境。
局限性
- 完全不可复现:无题目、无验证器、无轨迹,外部既不能跑也不能审计
- 样本量未知,分数方差/显著性无从评估
- 厂商内部基准普遍存在”对着自家测试集训练”的过拟合风险(即使无主观故意)
- 只出现在 DeepSeek 发布材料里,无独立第三方复测
资源
- DeepSeek API 更新日志(DSBench-FullStack 首次出处):https://api-docs.deepseek.com/zh-cn/updates/
- DeepSeek-V4-Flash 官方博客:https://deepseek.ai/blog/deepseek-v4-flash-ga-agent-benchmarks
- 学术 DSBench(同名区分):https://openreview.net/forum?id=DSsSPr0RZJ
相关页面
- dsbench-fullstack — 本测试集已知分数快照
- vibe-code-bench — 从零建全栈应用基准(公开可复现的”外部对照”,测的能力维度最接近)
- swe-bench-verified — 修真实仓库 bug 基准(DeepSeek 同表发布的公开基准之一)
- terminal-bench — 终端环境任务基准(V4-Flash 同表 82.7)
- toolathlon — Toolathlon:跨应用长程工具使用基准(V4-Flash 同表 70.3 的公开原版)
- deepswe — DeepSWE:V4-Flash 同表 54.4 的公开原版(mini-swe-agent 口径 53%)
- llm-vram-usage-calculation — DeepSeek-V4-Flash 284B/13B 显存计算页(同模型)