测试集性质与读法指南见 dsbench-fullstack。本页只放分数(均为 DeepSeek 发布材料口径,DeepSeek Harness 极简模式 + reasoning max + top_p 0.95 + temp 1.0)。
V4-Flash 正式版对比表(2026-07-31)
| 模型 | DSBench-FullStack | DSBench-Hard |
|---|---|---|
| Claude Opus 4.8 | 71.6 | 71.7 |
| DeepSeek-V4-Flash-0731 | 68.7 | 59.6 |
| GLM-5.2 | 61.8 | 54.5 |
| DeepSeek-V4-Pro-Preview | 41.8 | 31.1 |
| DeepSeek-V4-Flash-Preview | 37.0 | 25.8 |
V4-Pro 正式版(2026-08-13)
DSBench-FullStack 71.1、DSBench-Hard 67.2(较预览版 ~33 翻倍)。第三方解读:V4-Pro 在 FullStack 上仍比 Claude Fable 5 低约 6 个百分点。
分数观察
- 不是外部排名依据:未公开任务/样本量/评分器,第三方无法复现——只能当参考信号
- 但也不是纯自夸:对比表里 Opus 4.8(71.6)压过自家 V4-Flash(68.7),V4-Pro 也承认落后 Fable 5 约 6 分——用自家 harness 测竞品并如实发布落后结果,在厂商私有基准里算坦诚
- 同 harness 比较才有意义:所有分数都在 DeepSeek Harness 极简模式下跑;拿它和其他 harness 下的 SWE-bench 分数对比没有意义