评测体系与子基准家族见 superclue。本页只放分数:中文大模型综合能力强度。
主榜(2026-07 期,2026-08-06 发布,12 款国产模型,0-100 加权综合分)
| # | 模型 | 综合总分 |
|---|---|---|
| 1 | Qwen3.8-Max | 71.48 |
| 2 | Kimi K3 | 70.68(智能体编程单项第一 75.79) |
| 3 | 豆包 Doubao-Seed-2.1-pro | 65.95 |
| 4 | DeepSeek-V4-Flash | 65.6 |
| 5 | DeepSeek-V4-Pro | 64.4 |
(参考:2026-04 期 DeepSeek-V4-Pro 70.98 登顶、V4-Flash 68.82 第二——两期之间榜首易主,月榜波动不小)
专项榜快照
| 专项 | 榜首 | 分数 | 日期 |
|---|---|---|---|
| XClaw 龙虾产品测评(智能体产品,10 款) | 百度文心助手(任务模式) | 97.62(记忆维度满分) | 2026-08 |
| 中文原生图像编辑(19 模型) | GPT-Image-1.5 | 87.03(国内第一:腾讯混元 83.00) | 2026-03 |
分数观察
- 加权综合分是机构自有口径:与英文基准分数不可比,也不与自家历史版本跨期硬比(维度权重会调,如 2026-07 智能体编程升至 25%)
- 月榜波动大:题库每两月 100% 轮换 + 参测配置差异,同模型不同期分数差异未必代表能力变化
- 参测以国产模型为主:海外模型覆盖有限,定位是中文场景国产横评而非全球榜
- 厂商发布会引用频繁,注意期数与维度版本