Reference · Tensor shapes

Kimi K3 核心公式与张量 shape 速查

生产 checkpoint 维度以 vLLM f4b161d7 的 Kimi K3 支持为实现证据。T 是当前调度轮 packed token 数;B 是 plain decode 请求数;主干宽度 d=7168

整机

说明
层数9369 KDA + 24 Gated MLA;23×(3 KDA + 1 MLA) + final MLA
AttnResblock size 12,8 blocksembedding 是额外深度来源;最后 block 不满 12 层
MoE896 routed,top-16,2 sharedrouted latent 3584;expert intermediate 3072

KDA

张量全局逻辑 shapeTP=8 本地 shape
输入/输出[T,7168][T,7168]
Q/K/V/G²[T,96,128][T,12,128]
F_a[T,128][T,128] replicated
β / decay[T,96] / [T,96,128][T,12] / [T,12,128]
recurrent state[96,128,128][12,128,128]
Conv4 history[3×96×128,3]=[36864,3][4608,3]
o_proj 输入[T,12288]head-sharded,projection 后归并
S̄ = Diag(α_t) S_(t-1) S_t = S̄ + β_t k_t (v_t - S̄^T k_t)^T õ_t = S_t^T q_t y_t = W_o[Sigmoid(g²_t) ⊙ RMSNorm(õ_t)]

Gated MLA

张量/维度shape 或值生命周期
q LoRA latent[T,1536]当前 forward
KV latent c[T,576]逐 token 写入请求 cache
Q[T,96,192]当前 forward;NoPE,RoPE dim=0
prefill K/V[T,96,192] / [T,96,128]临时展开
decode q_latent[B,96,576]BMM1 临时量
decode latent_out[B,96,576]latent MQA 临时量
full-rank gate[T,96,128]当前 forward
[q_c;c] = X W_QKVA [T,1536+576] q = RMSNorm(q_c) W_QB [T,96,192] decode: q_latent,h = q_h W_UK,h^T [576] o_latent,h = Softmax(q_latent,h C^T) C [576] o_h = o_latent,h W_UV,h [128]

Block AttnRes

sources [T,R,7168] score[t,r] = q_l^T RMSNorm(sources[t,r]) a[t,:] = Softmax(score[t,:]) [R] h_l[t] = Σ_r a[t,r] sources[t,r] [7168]

R 是深度来源数,不是序列长度。vLLM forward buffer 为 [T,8,7168];attention 前和 MLP 前各有独立 score projection。它在当前 forward 内存在,不跨生成 token 持久化。

Stable LatentMoE

步骤shape
router logits / top ids[T,896] FP32 / [T,16]
routed down[T,7168]→[T,3584]
逻辑 dispatch[T×16,3584]
expert gate/up[T×16,3072]
combine / up[T,3584]→[T,7168]
shared path两个 shared expert 合并为 intermediate 6144,输出 [T,7168]
SiTU(g,u) = [4 tanh(g/4) sigmoid(g)] ⊙ [25 tanh(u/25)] Y = Y_shared + W_up RMSNorm(Combine(Top16Experts(W_down X)))

传统架构对照

K3 模块传统基线主要收益主要代价
KDAMHA/GQA KV cachedecode 历史 state 对长度 O(1)历史有损压缩;递推、恢复、回滚复杂
Gated MLA每头完整 K/V只缓存每 token 576 维 latent仍随长度 O(T);需 up-projection/权重吸收
Block AttnRes单一加法 residual stream每层可选择深度来源深度 buffer、softmax、读取和通信
Stable LatentMoE全宽 routed expertexpert 输入输出及 dispatch 宽度减半新增 down/up 投影与稳定化机制

完整推导见第一课;端到端时间线见第二课。实现证据固定到 vLLM f4b161d7