登记表格式,记录常用模型的权重规模、架构与官方权重大小;新模型直接按行追加两张表 + 备注。显存怎么算、为什么这么算见 llm-vram-usage-calculation。

主表

模型厂商开源时间架构总参数激活参数上下文BF16 理论权重官方权重精度官方权重大小
DeepSeek-V4-ProDeepSeek2026-04MoE1.6T49B1M3.2 TBFP4 专家 + FP8 非专家(QAT)≈850 GB
DeepSeek-V4-FlashDeepSeek2026-04(0731 正式版)MoE284B13B1M568 GBFP4 专家 + FP8 非专家(QAT)≈150-162 GB
Kimi K3月之暗面2026-07-27MoE + 原生视觉2.8T104B1M5.6 TBMXFP4 权重 / MXFP8 激活(QAT)≈1.5 TB

BF16 理论权重 = 总参数 × 2B,仅作”如果全精度要多大”的参照;三家旗舰官方发布即低比特 QAT 权重,实际下载大小看最后一列。

架构细表

模型层数hidden注意力专家 routed/topk/sharedexpert 中间维度词表其他
V4-Pro617168MLA + CSA(4x)/HCA(128x),index topk 1024384 / 6 / 13072129,280q_lora 1536,o_groups 16
V4-Flash434096MLA + CSA(4x)/HCA(128x),index topk 512256 / 6 / 12048129,280q_lora 1024,o_groups 8
Kimi K393 + 1 dense716869×KDA 线性注意力 + 24×Gated MLA896 / 16 / 23072160K视觉 MoonViT-V2 401M;SiTU-GLU;Attention Residuals

备注

DeepSeek-V4-Pro

  • 专家参数 ≈1.55T(3×7168×3072×384×61),占总量 ~97%;非专家 ≈24B(FP8)
  • 官方权重建算:1.55T×0.53B(MXFP4 含 scale)+ 24B×1B ≈ 850 GB
  • KV cache:层配比 1 全量 + 29 CSA + 31 HCA,1M 上下文 BF16 ≈10 GB,与 Flash 同量级

DeepSeek-V4-Flash

  • 完整显存推导见 llm-vram-usage-calculation
  • GGUF 实测:AD-BF16 原样重打包 162.1 GB、AD-MXFP4 154.5 GB;专家已 4bit QAT,再往下压(<3bit)质量陡降

Kimi K3

  • 全球首个开源 3T 级模型;Stable LatentMoE:896 专家激活 16 + 2 shared
  • KDA 混合线性注意力:1M 上下文 KV cache 压缩 75%、解码速度最高 6.3x;KDA Prefix-Cache 编程场景缓存命中率 >90%
  • 视觉编码器 MoonViT-V2 401M 参数,原生图文视频理解
  • 社区量化:Unsloth GGUF(UD-Q8_K_XL / UD-Q4_K_XL 等),昇腾 950 / SGLang / vLLM Day-0 适配

登记约定(后续追加模型时)

  • 主表必填:总参数 / 激活参数(MoE)/ 上下文 / 官方权重精度与大小;BF16 理论值按 总参数×2B 速算
  • 架构细表尽量从官方 config.json / 模型卡取数,注明注意力类型与专家配置
  • 权重大小优先实测(GGUF/safetensors 目录大小),无实测给公式估算并标注 ≈

关联

资源