测试集性质与读法指南见 dsbench-fullstack。本页只放分数(均为 DeepSeek 发布材料口径,DeepSeek Harness 极简模式 + reasoning max + top_p 0.95 + temp 1.0)。

V4-Flash 正式版对比表(2026-07-31)

模型DSBench-FullStackDSBench-Hard
Claude Opus 4.871.671.7
DeepSeek-V4-Flash-073168.759.6
GLM-5.261.854.5
DeepSeek-V4-Pro-Preview41.831.1
DeepSeek-V4-Flash-Preview37.025.8

V4-Pro 正式版(2026-08-13)

DSBench-FullStack 71.1、DSBench-Hard 67.2(较预览版 ~33 翻倍)。第三方解读:V4-Pro 在 FullStack 上仍比 Claude Fable 5 低约 6 个百分点。

分数观察

  1. 不是外部排名依据:未公开任务/样本量/评分器,第三方无法复现——只能当参考信号
  2. 但也不是纯自夸:对比表里 Opus 4.8(71.6)压过自家 V4-Flash(68.7),V4-Pro 也承认落后 Fable 5 约 6 分——用自家 harness 测竞品并如实发布落后结果,在厂商私有基准里算坦诚
  3. 同 harness 比较才有意义:所有分数都在 DeepSeek Harness 极简模式下跑;拿它和其他 harness 下的 SWE-bench 分数对比没有意义