DeepSeek Engram 详解:把静态知识从计算里拆出来 资料说明:本文于 2026-09-22 核对 DeepSeek-AI 与北京大学的论文 Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models,v2,该版修订于 2026-07-12。代码以 Engram 官方仓库的提交 fb7f84a 为准。文中区分论文实验、演示代码和工程估 2026-09-22 论文阅读 #LLM #推理系统 #DeepSeek #Engram #Conditional Memory #MoE
DeepSeek-V4.1-Flash 架构详解:CED、CSA2 与 890 字节 KV Cache 资料说明:本文以 DeepSeek-AI 发布的 DeepSeek_V41_Tech_Report.pdf 为主资料,模型仓库为 deepseek-ai/DeepSeek-V4.1-Flash。报告的主题是“Pushing the Limits of KV Cache Compression”,发布时间以仓库页面和报告版本为准。 先说结论 DeepSeek-V4.1-Flash 的变化集中在一件 2026-09-11 论文阅读 #KV Cache #DeepSeek #MoE #DeepSeek-V4.1 #Flash #CSA2 #CED #多模态
SGLang Runtime 源码深度解析:一次请求如何穿过调度、KV Cache 与 GPU 版本说明:本文基于 2026-09-11 拉取的 SGLang upstream main,固定 commit 为 a4ff5634b82546679704c42c984d7f950203922e。源码更新很快,文中的函数名和调用关系只对这个 commit 负责。示例默认讨论生成模型、单个 scheduler、常规 CUDA 路径;LoRA、speculative decoding、DP atte 2026-09-11 笔记 #KV Cache #LLM Inference #CUDA #SGLang #Scheduler #RadixAttention #HiCache
FlexKV源码与技术点:把LLM推理的KV Cache扩展到CPU、SSD和远端 版本说明:本文以2026-09-04拉取的taco-project/FlexKV主分支提交016c2903b93a1002e1c50eaf17fb9a537e970b34为实现基线。FlexKV仍在快速演进,文中的功能和配置应以实际安装版本、GPU/驱动和推理框架版本为准。 1. 先说结论 FlexKV是一个面向大模型推理的KV Cache Store和多级缓存管理系统。它把原本只能放在GPU显 2026-09-08 笔记 #KV Cache #LLM Inference #RDMA #SGLang #FlexKV #vLLM #GDS
vLLM KV Connector 深入解析:Kimi K3 混合注意力之后,缓存协议改了什么 版本说明:本文按 2026-09-04 的 vLLM upstream main 整理,基线 commit 为 ae2d1ca。本地源码 checkout 是 f4b161d7,用于交叉验证 Kimi K3 的实现和较早的调用路径,不代表当前 main 的全部行为。KV connector API 仍由源码标记为 experimental,生产部署应以实际安装版本为准。 1. 先说结论 先把问题 2026-09-04 笔记 #KV Cache #VLLM #Disaggregated Serving #Kimi K3 #NIXL #Hybrid Attention #KV Connector
Mooncake Serving Platform源码与工程深度解析:把KV Cache变成可调度的分布式资源 版本说明:本文基于2026-09-04访问的kvcache-ai/Mooncake主线 commit e58ad953及其官方文档、源码和性能页面撰写。Mooncake仍在快速演进,文中的类名、配置项和集成方式不应视为跨版本稳定API。 1. 先说结论 Mooncake不是一个“把KV Cache存到Redis里”的小工具,也不只是Prefill/Decode(P/D)分离的传输插件。它更像是L 2026-09-04 笔记 #KV Cache #LLM Inference #RDMA #SGLang #Mooncake #vLLM #Distributed Systems
DeepSeek-V4架构详解:CSA/HCA、mHC与1M上下文推理 资料范围:截至 2026-09-04。本文以 DeepSeek 官方发布公告、官方技术报告和 DeepSeek-V4-Pro/Flash 的公开推理代码为一手依据。V4 的代码和权重仍可能更新,文中的配置值应以文章引用的仓库版本为准。 先说结论 DeepSeek-V4 不是靠一个孤立的“新 Attention”解决 1M 上下文,而是把几条成本曲线一起压低: 1. 注意力层交错使用 CSA 2026-09-04 论文阅读 #DeepSeek #Attention #MoE #DeepSeek-V4 #Transformer #推理优化
Cache-aware Prefill-Decode Disaggregation(CPD)解析:让长上下文的冷请求不再阻塞热请求 版本说明:本文基于 Together AI 官方博客《Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving》整理。原文发表于 2026-03-04,本文于 2026-08-26 撰写。Together AI 的 CPD 具体实现、路由器接口、缓存一致性协议和生产配置 2026-08-26 笔记 #KV Cache #LLM #推理系统 #PD 分离 #RDMA
NVIDIA TensorIR深入解析:从张量计算图到CUDA Tile IR 1. 先说结论 版本说明:本文分析的是NVIDIA TensorIR v0.1.0,该版本于2026-08-17发布。资料主要来自TensorIR官方README、Release Notes、Dialect定义、编译pipeline、Python DSL、runtime和测试代码,以及CUDA Tile IR官方文档。TensorIR处于Early Release阶段,API、性能和硬件支持仍可能 2026-08-18 笔记 #NVIDIA #TensorIR #MLIR #CUDA Tile #GPU Compiler
深入理解 DeepSeek Harness 与 Programmatic Tool Calling 版本说明:本文写于 2026-08-17。DeepSeek Harness 官方仓库目前仍标记为 developer preview,命令、配置和插件接口可能发生不兼容变化。本文以官方公开的 README、架构文档和用户指南为准;Programmatic Tool Calling(下文简称 PTC)以 Anthropic 的公开定义作为主要参考。文中的 PTC 代码是概念示例,不是 DeepSee 2026-08-17 笔记 #Agent #LLM #DeepSeek #Tool Calling #Programmatic Tool Calling