Reference

Kimi K3 架构速查

这页只收录第一课需要反复调用的事实和接口判断。官方已确认的内容与推理实现建议分开。

已公开模型事实

规模2.8T 总参数;104B 激活参数;93 层。
混合注意力69 层 KDA + 24 层 Gated MLA;每个 block 为 3:1,末端另有 Gated MLA。
稀疏 MoE896 个 routed experts,每 token 选 16 个;另有 2 个 shared experts。
上下文1,048,576 tokens;原生视觉入口为 MoonViT-V2。

缓存契约

层类型每 token 后保留的状态可否直接按 Paged KV 处理
KDA每头递归矩阵 S ∈ R^(d_k×d_v),以及实现所需的 chunk 边界元数据否:更像 state cache;可做 state-aware prefix cache
Gated MLA压缩 latent c_t = W_c x_t,按需重建 K/V是:latent 序列可分页、复用、换出
AttnRes块级/层级表示,取决于 full 或 block 形式不是 token KV;属于深度方向的 activation state

实现检查表

  1. cache key 必须包含模型版本、权重/量化版本、层类型和位置语义。
  2. prefill 输出要产生可继续 decode 的 KDA state 与 MLA latent;decode 只追加新 token 的状态。
  3. prefix 命中时,KDA 复用的是“正确边界上的 state”,MLA 复用的是 latent pages;二者不能混用。
  4. 回收时先记录逻辑长度、chunk 边界、page table、dtype 和设备;否则恢复后 attention 结果会静默错误。

来源:Kimi K3 Technical Report官方仓库。具体 page size、layout 和 transport 仍需以目标推理引擎实现验证。