模型结构解剖 后端 · ATOM 3 个模型

LLM 模型结构手册

每个模型一份解剖文档:完整结构图、逐个模块的张量形状、 从 checkpoint 分片头部实读的参数账、以及它在 ATOM 里究竟落在哪几个文件上。 面向的是要动这段代码的人——不是模型卡,也不是论文摘要。

4已收录模型
2模型家族
16结构图
ATOM推理后端

GLM 家族

点开任意一张卡片进入该模型的解剖页

这三者中只有两种结构:GLM-5.2 与旗舰 GLM-5.3 的 config 逐字段相同, 共用 deepseek_v2.py;GLM-5.3-Flash 是另一套完全不同的东西。


MiniMax 家族

另一条稀疏路线:GQA + 块级 top-k

和 GLM 那一系的 MLA + DSA 走的是完全不同的取舍:注意力本体仍是普通 GQA, 索引器只打分不带 value,top-k 的粒度是 128 个 token 一块而不是单 token。


横向对照

三个模型的骨架放在一起看

GLM-5.2GLM-5.3GLM-5.3-FlashMiniMax-M3
architecturesGlmMoeDsaForCausalLMGlmMoeDsaForCausalLMGlm5NextForConditionalGenerationMiniMaxM3SparseForConditionalGeneration
model_typeglm_moe_dsaglm_moe_dsaglm5_nextminimax_m3_vl
总参数753.3 B753.3 B321.3 B427.0 B
单 token 激活41.25 B41.25 B17.38 B24.73 B
层数78 + 1 MTP78 + 1 MTP45 + 1 MTP60(无 MTP)
hidden_size6144614440966144
注意力MLA + DSAMLA + DSA34 KDA + 11 MLAGQA 64:4 + MSA
位置编码RoPE θ=8e6RoPE θ=8e6NoPE(无)部分 RoPE θ=5e6
残差单路单路mHC 四路单路
专家256 top-8 + 1256 top-8 + 1288 top-8 + 1128 top-4 + 1
稀疏索引IndexShare 21/78IndexShare 21/78k-pool 4 token/行128-token 块 top-16
KV cache87.8 KiB/token87.8 KiB/token12.4 KiB/token134.25 KiB/token
ATOM 实现deepseek_v2.pydeepseek_v2.pyglm5_next.pyminimax_m3.py
多模态原生(ATOM 只 serve 文本)原生(ATOM 只 serve 文本)

KV cache 一列按 BF16 计:GLM-5.2/5.3 是 78 层 × 576; GLM-5.3-Flash 只有 11 个 MLA 层承担,代价是 34 个 KDA 层各持一份每请求的递推状态; MiniMax-M3 是 60 层 × 2×4×128 的主 KV(120 KiB)再加 57 层单头 index K(14.25 KiB)。


这些文档怎么来的

每一份都由 skills/models.md 驱动生成

新增一个模型

skills/models.md 里写明模型、后端与输出路径,然后交给 Claude Code 执行:

# 模型
-glm5.3

# 框架后端
-atom

# 输出路径
-LLM/models/GLM

产物是一份自包含的 HTML(无外部依赖,深浅色自适应)。 生成后把它加进本页的卡片网格即可。

每份文档一定包含

  • 完整模型栈图 + 单层展开图,每个模块标注张量形状
  • 从 safetensors 分片头部实读的权重形状与参数账
  • 核心机制的专门图示(稀疏索引、残差结构、注意力变体)
  • KV cache 与状态缓存的显存账
  • 该模型在 ATOM 里的落点,以及一条读码路线

数字一律来自 checkpoint 与源码实读,不引用模型卡上的标称值。