评测集定义与方法论见 deepswe。本页只放分数:各模型长时域软件工程能力强度。

榜单(v1.1,当日更新 2026-08-13,每模型取最佳 effort,统一 mini-swe-agent)

#模型 [effort]Pass@1成本/任务输出 token步数
1Claude Opus 5 [max]74% ±4$11.84118k99
2GPT-5.6 Sol [max]73% ±3$8.3960k61
3Claude Fable 5 [max]70% ±4$21.63119k88
4GPT-5.6 Terra [max]70% ±3$3.9672k76
5Kimi K3 [max]69% ±5$4.6581k98
6GPT-5.6 Luna [max]67% ±4$0.6173k102
7GPT-5.5 [xhigh]67% ±6$7.2346k82
8Grok 4.6 [xhigh]67% ±2$5.5071k87
9DeepSeek V4 Pro [max]63% ±6$0.06106k155
10Claude Opus 4.8 [max]59% ±2$13.22135k120
11-15Qwen3.8-Max 57% · Muse Spark 1.2 55% · Sonnet 5 54% · Grok 4.5 54% · DeepSeek V4 Flash 53%($0.10)
16-23Muse Spark 1.1 53% · GPT-5.4 52% · Gemini 3.6 Flash 49% · GLM-5.2 44% · Gemini 3.5 Flash 37% · Kimi K2.7 Code 31% · Sonnet 4.6 30% · Gemini 3.1 Pro 12%

分数观察

  1. 成本差 360x:榜首档 Opus 5 0.06/任务(后者 155 步最长轨迹换极低成本);GPT-5.6 Luna 以 $0.61 拿 67% 是效率甜点
  2. 效率与质量不同榜:成本视图下 GPT-5.6 Luna/Gemini 3.1 Pro/Sonnet 4.6/Kimi K2.7 Code 落在”最便宜但低分”区——官网散点图才是这个榜的正确读法
  3. Claude Sonnet 5 的 268 步 $26.40:分数中上但最贵最磨叽,agent 风格差异巨大
  4. Gemini 3.1 Pro 仅 12% 明显异常(其余 Gemini 系 37-49%),跨基准排名不迁移又一例
  5. 脚注:Fable 5 有 73/2260 trials 因”美国政府指令中止访问”未完成(按已完成 trials 计)——评测史少见的外部干预记录
  6. 口径对照:DeepSeek 自家材料里 V4-Flash DeepSWE 54.4(自家 harness)vs 本榜 53%(mini-swe-agent),基本一致
  7. v1→v1.1:10 个双版本配置复测显示分数变化 ≤9 分、头部顺序不变