GentleCold's Blog
  • 首页
  • Teach
  • 归档
  • 分类
  • 标签
  • 友链
  • 关于

FlexKV源码与技术点:把LLM推理的KV Cache扩展到CPU、SSD和远端

版本说明:本文以2026-09-04拉取的taco-project/FlexKV主分支提交016c2903b93a1002e1c50eaf17fb9a537e970b34为实现基线。FlexKV仍在快速演进,文中的功能和配置应以实际安装版本、GPU/驱动和推理框架版本为准。 1. 先说结论 FlexKV是一个面向大模型推理的KV Cache Store和多级缓存管理系统。它把原本只能放在GPU显
2026-09-08
笔记
#KV Cache #LLM Inference #RDMA #SGLang #FlexKV #vLLM #GDS

vLLM KV Connector 深入解析:Kimi K3 混合注意力之后,缓存协议改了什么

版本说明:本文按 2026-09-04 的 vLLM upstream main 整理,基线 commit 为 ae2d1ca。本地源码 checkout 是 f4b161d7,用于交叉验证 Kimi K3 的实现和较早的调用路径,不代表当前 main 的全部行为。KV connector API 仍由源码标记为 experimental,生产部署应以实际安装版本为准。 1. 先说结论 先把问题
2026-09-04
笔记
#KV Cache #VLLM #Disaggregated Serving #Kimi K3 #NIXL #Hybrid Attention #KV Connector

Mooncake Serving Platform源码与工程深度解析:把KV Cache变成可调度的分布式资源

版本说明:本文基于2026-09-04访问的kvcache-ai/Mooncake主线 commit e58ad953及其官方文档、源码和性能页面撰写。Mooncake仍在快速演进,文中的类名、配置项和集成方式不应视为跨版本稳定API。 1. 先说结论 Mooncake不是一个“把KV Cache存到Redis里”的小工具,也不只是Prefill/Decode(P/D)分离的传输插件。它更像是L
2026-09-04
笔记
#KV Cache #LLM Inference #RDMA #SGLang #Mooncake #vLLM #Distributed Systems

DeepSeek-V4架构详解:CSA/HCA、mHC与1M上下文推理

资料范围:截至 2026-09-04。本文以 DeepSeek 官方发布公告、官方技术报告和 DeepSeek-V4-Pro/Flash 的公开推理代码为一手依据。V4 的代码和权重仍可能更新,文中的配置值应以文章引用的仓库版本为准。 先说结论 DeepSeek-V4 不是靠一个孤立的“新 Attention”解决 1M 上下文,而是把几条成本曲线一起压低: 1. 注意力层交错使用 CSA
2026-09-04
论文阅读
#DeepSeek #Attention #MoE #DeepSeek-V4 #Transformer #推理优化

Cache-aware Prefill-Decode Disaggregation(CPD)解析:让长上下文的冷请求不再阻塞热请求

版本说明:本文基于 Together AI 官方博客《Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving》整理。原文发表于 2026-03-04,本文于 2026-08-26 撰写。Together AI 的 CPD 具体实现、路由器接口、缓存一致性协议和生产配置
2026-08-26
笔记
#KV Cache #LLM #推理系统 #PD 分离 #RDMA

NVIDIA TensorIR深入解析:从张量计算图到CUDA Tile IR

1. 先说结论 版本说明:本文分析的是NVIDIA TensorIR v0.1.0,该版本于2026-08-17发布。资料主要来自TensorIR官方README、Release Notes、Dialect定义、编译pipeline、Python DSL、runtime和测试代码,以及CUDA Tile IR官方文档。TensorIR处于Early Release阶段,API、性能和硬件支持仍可能
2026-08-18
笔记
#NVIDIA #TensorIR #MLIR #CUDA Tile #GPU Compiler

深入理解 DeepSeek Harness 与 Programmatic Tool Calling

版本说明:本文写于 2026-08-17。DeepSeek Harness 官方仓库目前仍标记为 developer preview,命令、配置和插件接口可能发生不兼容变化。本文以官方公开的 README、架构文档和用户指南为准;Programmatic Tool Calling(下文简称 PTC)以 Anthropic 的公开定义作为主要参考。文中的 PTC 代码是概念示例,不是 DeepSee
2026-08-17
笔记
#Agent #LLM #DeepSeek #Tool Calling #Programmatic Tool Calling

Kimi K3模型架构详解:KDA、Attention Residuals与Stable LatentMoE如何协同

版本说明:本文基于Moonshot AI官方Kimi K3技术报告、官方仓库3cb39df(报告更新于2026-08-06)、官方技术博客和部署文档整理;张量shape与prefill/decode执行路径额外对照vLLM main提交f4b161d7(2026-08-18)。架构、训练和系统数据来自官方报告;标记为“vLLM实现”的内容是当前后端与checkpoint支持,不等于模型数学只允许这
2026-08-15
笔记
#KV Cache #LLM #MoE #MLA #Kimi K3 #Moonshot AI #KDA #Attention Residuals

GB300与NVL72详解:从Blackwell Ultra芯片到72 GPU液冷机架

1. 先说结论 版本说明:本文按 2026-08-15 访问的 NVIDIA 官方 GB300 NVL72、Blackwell Architecture、NVLink、NVLink-C2C 和 ConnectX 资料整理。用户所说的“NV72”通常是 NVL72 的简称;NVIDIA 的正式产品名是 GB300 NVL72。如果这里的 NV72 指的是别的厂商内部型号,需要以具体型号为准。 先把
2026-08-15
笔记
#GPU Cluster #NVIDIA #Blackwell #GB300 #NVL72 #AI Infrastructure #Inference

FastAFD详解:在Blackwell NVL72上拆分Attention与FFN的MoE推理系统

版本说明:本文基于Hao AI Lab于2026-07-06发布的FastAFD技术文章,以及2026-07-08的开源仓库commit 3c71619整理。GB200 NVL72上的1.35-1.45倍结果来自作者实测;Vera Rubin + LPX/LPU部分是建立在若干假设上的预测,不是硬件实测。本文没有本地复现多节点GB200实验。 1. 先说结论 FastAFD解决的是一个很具体、但
2026-07-14
笔记
#LLM Inference #NVLink #CUDA Graph #MoE #FastAFD #Blackwell #DeepEP #DeepGEMM
123…11

搜索

Hexo Fluid
载入运行时间...
总访问量 次 总访客数 人