Reference · Tensor shapes
Kimi K3 核心公式与张量 shape 速查
生产 checkpoint 维度以 vLLM f4b161d7 的 Kimi K3 支持为实现证据。T 是当前调度轮 packed token 数;B 是 plain decode 请求数;主干宽度 d=7168。
整机
| 项 | 值 | 说明 |
|---|---|---|
| 层数 | 93 | 69 KDA + 24 Gated MLA;23×(3 KDA + 1 MLA) + final MLA |
| AttnRes | block size 12,8 blocks | embedding 是额外深度来源;最后 block 不满 12 层 |
| MoE | 896 routed,top-16,2 shared | routed latent 3584;expert intermediate 3072 |
KDA
| 张量 | 全局逻辑 shape | TP=8 本地 shape |
|---|---|---|
| 输入/输出 | [T,7168] | [T,7168] |
| Q/K/V/G² | [T,96,128] | [T,12,128] |
| F_a | [T,128] | [T,128] replicated |
| β / decay | [T,96] / [T,96,128] | [T,12] / [T,12,128] |
| recurrent state | [96,128,128] | [12,128,128] |
| Conv4 history | [3×96×128,3]=[36864,3] | [4608,3] |
| o_proj 输入 | [T,12288] | head-sharded,projection 后归并 |
S̄ = Diag(α_t) S_(t-1)
S_t = S̄ + β_t k_t (v_t - S̄^T k_t)^T
õ_t = S_t^T q_t
y_t = W_o[Sigmoid(g²_t) ⊙ RMSNorm(õ_t)]
Gated MLA
| 张量/维度 | shape 或值 | 生命周期 |
|---|---|---|
| q LoRA latent | [T,1536] | 当前 forward |
| KV latent c | [T,576] | 逐 token 写入请求 cache |
| Q | [T,96,192] | 当前 forward;NoPE,RoPE dim=0 |
| prefill K/V | [T,96,192] / [T,96,128] | 临时展开 |
| decode q_latent | [B,96,576] | BMM1 临时量 |
| decode latent_out | [B,96,576] | latent MQA 临时量 |
| full-rank gate | [T,96,128] | 当前 forward |
[q_c;c] = X W_QKVA [T,1536+576]
q = RMSNorm(q_c) W_QB [T,96,192]
decode:
q_latent,h = q_h W_UK,h^T [576]
o_latent,h = Softmax(q_latent,h C^T) C [576]
o_h = o_latent,h W_UV,h [128]
Block AttnRes
sources [T,R,7168]
score[t,r] = q_l^T RMSNorm(sources[t,r])
a[t,:] = Softmax(score[t,:]) [R]
h_l[t] = Σ_r a[t,r] sources[t,r] [7168]
R 是深度来源数,不是序列长度。vLLM forward buffer 为 [T,8,7168];attention 前和 MLP 前各有独立 score projection。它在当前 forward 内存在,不跨生成 token 持久化。
Stable LatentMoE
| 步骤 | shape |
|---|---|
| router logits / top ids | [T,896] FP32 / [T,16] |
| routed down | [T,7168]→[T,3584] |
| 逻辑 dispatch | [T×16,3584] |
| expert gate/up | 各 [T×16,3072] |
| combine / up | [T,3584]→[T,7168] |
| shared path | 两个 shared expert 合并为 intermediate 6144,输出 [T,7168] |
SiTU(g,u) = [4 tanh(g/4) sigmoid(g)] ⊙ [25 tanh(u/25)]
Y = Y_shared + W_up RMSNorm(Combine(Top16Experts(W_down X)))
传统架构对照
| K3 模块 | 传统基线 | 主要收益 | 主要代价 |
|---|---|---|---|
| KDA | MHA/GQA KV cache | decode 历史 state 对长度 O(1) | 历史有损压缩;递推、恢复、回滚复杂 |
| Gated MLA | 每头完整 K/V | 只缓存每 token 576 维 latent | 仍随长度 O(T);需 up-projection/权重吸收 |
| Block AttnRes | 单一加法 residual stream | 每层可选择深度来源 | 深度 buffer、softmax、读取和通信 |
| Stable LatentMoE | 全宽 routed expert | expert 输入输出及 dispatch 宽度减半 | 新增 down/up 投影与稳定化机制 |
完整推导见第一课;端到端时间线见第二课。实现证据固定到 vLLM f4b161d7。