Reference
Kimi K3 架构速查
这页只收录第一课需要反复调用的事实和接口判断。官方已确认的内容与推理实现建议分开。
已公开模型事实
规模2.8T 总参数;104B 激活参数;93 层。
混合注意力69 层 KDA + 24 层 Gated MLA;每个 block 为 3:1,末端另有 Gated MLA。
稀疏 MoE896 个 routed experts,每 token 选 16 个;另有 2 个 shared experts。
上下文1,048,576 tokens;原生视觉入口为 MoonViT-V2。
缓存契约
| 层类型 | 每 token 后保留的状态 | 可否直接按 Paged KV 处理 |
|---|---|---|
| KDA | 每头递归矩阵 S ∈ R^(d_k×d_v),以及实现所需的 chunk 边界元数据 | 否:更像 state cache;可做 state-aware prefix cache |
| Gated MLA | 压缩 latent c_t = W_c x_t,按需重建 K/V | 是:latent 序列可分页、复用、换出 |
| AttnRes | 块级/层级表示,取决于 full 或 block 形式 | 不是 token KV;属于深度方向的 activation state |
实现检查表
- cache key 必须包含模型版本、权重/量化版本、层类型和位置语义。
- prefill 输出要产生可继续 decode 的 KDA state 与 MLA latent;decode 只追加新 token 的状态。
- prefix 命中时,KDA 复用的是“正确边界上的 state”,MLA 复用的是 latent pages;二者不能混用。
- 回收时先记录逻辑长度、chunk 边界、page table、dtype 和设备;否则恢复后 attention 结果会静默错误。
来源:Kimi K3 Technical Report、官方仓库。具体 page size、layout 和 transport 仍需以目标推理引擎实现验证。