一句话定位:国内影响力最大的第三方中文大模型综合测评体系(CLUE 组织出品)——月度发布中文通用模型综合榜,题库每两个月 100% 替换且全部原创防污染,另有一大族中文专项子基准(法律/金融/医疗/软件工程/长文本/安全……)。

为什么值得关注

  • 中文向补位:本系列前九个评测集全是英文向,中文能力(指令遵循、中文幻觉、中文场景 SWE)只能靠这类本土基准衡量
  • 三条立身主张:①”Live”更新零污染——题库定期(每两个月)100% 替换、全部原创;②测评方式与真实用户交互一致,任务贴近落地场景;③独立第三方、不研发自家模型
  • 月度节奏 + 快速跟进新形态:除通用榜外还有智能体产品榜(XClaw 龙虾产品测评)、图像编辑榜等专项,跟进行业热点快
  • 被国内主流媒体广泛引用(千问/DeepSeek/豆包每次发版几乎都有 SuperCLUE 数字)

主榜评测体系(SuperCLUE 通用基准)

2026-07 版六维加权(本期升级:传统代码生成→智能体编程):

维度权重
智能体编程25%
数学推理18%
科学推理16%
精确指令遵循16%
幻觉控制16%
智能体任务规划9%

排行榜

月度榜单见 superclue(2026-07 期:Qwen3.8-Max 71.48 登顶、Kimi K3 70.68 第二;另含 XClaw 智能体产品榜与图像编辑榜快照)。

子基准家族(站点公开列表节选)

  • 通用/推理:SuperCLUE-Hard(困难版)、-Reasoning(高阶推理)、-CoT(链式推理)、-Science(科学推理)、MathCLUE/Math24o/Math6o(高中奥数)
  • 工程/代码:SuperCLUE-SWE(中文软件工程,含 Claude Code 中文场景)、-WebCoding(Web 开发)、-Code3(等级化代码)
  • 领域:-Law(法律)、-Fin(金融)、-MedAssist(医疗助手)、-Auto(汽车)、-ICabin(智能座舱)、-Industry(工业)、-Mkt/-AdsVU(广告营销/视频理解)
  • 能力专项:-LongContext/-Long/-200K(长文本/超长上下文)、-RAG、-Agent、-CPIF(精准指令遵循)、-Faith/-Fact(忠实性/事实性幻觉)、-Safety/-DSPSafeBench(安全/对抗)、-TTS、-OnDevice(端侧)、-AISearch、-Role(角色扮演)、-Writing(创意写作)
  • 产品测评线:XClaw 龙虾产品测评(智能体产品:文心助手 97.62 居首)、中文原生图像编辑测评(2026-03:GPT-Image-1.5 总榜第一 87.03、腾讯混元国内第一 83.00)

怎么读这个榜(与系列内英文基准的差异)

  1. 分数是 0-100 加权综合分,机构自有口径,与英文基准分数不可比、也不与自家历史版本跨期硬比(维度权重会调,如 2026-07 智能体编程升至 25%)
  2. 题库不公开:原创题+定期全换是防污染卖点,但外部无法审计题目与判分细节;无论文,方法论透明度低于学术基准
  3. 参测以国产模型为主:海外模型覆盖有限,定位是”中文场景国产模型横评”而非全球榜
  4. 厂商发布会引用频繁,但注意期数与维度版本(同模型不同期分数差异可能来自题库更换或权重调整)

局限性

  • 非公开题库 + 无公开判分器,不可复现
  • 加权总分掩盖单项差异,读报告需看分维度
  • 月榜波动大(题库轮换 + 参测配置差异)

资源

相关页面