GentleCold's Blog
  • 首页
  • Teach
  • 归档
  • 分类
  • 标签
  • 友链
  • 关于

DeepSeek-V4.1-Flash 架构详解:CED、CSA2 与 890 字节 KV Cache

资料说明:本文以 DeepSeek-AI 发布的 DeepSeek_V41_Tech_Report.pdf 为主资料,模型仓库为 deepseek-ai/DeepSeek-V4.1-Flash。报告的主题是“Pushing the Limits of KV Cache Compression”,发布时间以仓库页面和报告版本为准。 先说结论 DeepSeek-V4.1-Flash 的变化集中在一件
2026-09-11
论文阅读
#KV Cache #DeepSeek #MoE #DeepSeek-V4.1 #Flash #CSA2 #CED #多模态

SGLang Runtime 源码深度解析:一次请求如何穿过调度、KV Cache 与 GPU

版本说明:本文基于 2026-09-11 拉取的 SGLang upstream main,固定 commit 为 a4ff5634b82546679704c42c984d7f950203922e。源码更新很快,文中的函数名和调用关系只对这个 commit 负责。示例默认讨论生成模型、单个 scheduler、常规 CUDA 路径;LoRA、speculative decoding、DP atte
2026-09-11
笔记
#KV Cache #LLM Inference #CUDA #SGLang #Scheduler #RadixAttention #HiCache

FlexKV源码与技术点:把LLM推理的KV Cache扩展到CPU、SSD和远端

版本说明:本文以2026-09-04拉取的taco-project/FlexKV主分支提交016c2903b93a1002e1c50eaf17fb9a537e970b34为实现基线。FlexKV仍在快速演进,文中的功能和配置应以实际安装版本、GPU/驱动和推理框架版本为准。 1. 先说结论 FlexKV是一个面向大模型推理的KV Cache Store和多级缓存管理系统。它把原本只能放在GPU显
2026-09-08
笔记
#KV Cache #LLM Inference #RDMA #SGLang #FlexKV #vLLM #GDS

vLLM KV Connector 深入解析:Kimi K3 混合注意力之后,缓存协议改了什么

版本说明:本文按 2026-09-04 的 vLLM upstream main 整理,基线 commit 为 ae2d1ca。本地源码 checkout 是 f4b161d7,用于交叉验证 Kimi K3 的实现和较早的调用路径,不代表当前 main 的全部行为。KV connector API 仍由源码标记为 experimental,生产部署应以实际安装版本为准。 1. 先说结论 先把问题
2026-09-04
笔记
#KV Cache #VLLM #Disaggregated Serving #Kimi K3 #NIXL #Hybrid Attention #KV Connector

Mooncake Serving Platform源码与工程深度解析:把KV Cache变成可调度的分布式资源

版本说明:本文基于2026-09-04访问的kvcache-ai/Mooncake主线 commit e58ad953及其官方文档、源码和性能页面撰写。Mooncake仍在快速演进,文中的类名、配置项和集成方式不应视为跨版本稳定API。 1. 先说结论 Mooncake不是一个“把KV Cache存到Redis里”的小工具,也不只是Prefill/Decode(P/D)分离的传输插件。它更像是L
2026-09-04
笔记
#KV Cache #LLM Inference #RDMA #SGLang #Mooncake #vLLM #Distributed Systems

DeepSeek-V4架构详解:CSA/HCA、mHC与1M上下文推理

资料范围:截至 2026-09-04。本文以 DeepSeek 官方发布公告、官方技术报告和 DeepSeek-V4-Pro/Flash 的公开推理代码为一手依据。V4 的代码和权重仍可能更新,文中的配置值应以文章引用的仓库版本为准。 先说结论 DeepSeek-V4 不是靠一个孤立的“新 Attention”解决 1M 上下文,而是把几条成本曲线一起压低: 1. 注意力层交错使用 CSA
2026-09-04
论文阅读
#DeepSeek #Attention #MoE #DeepSeek-V4 #Transformer #推理优化

Cache-aware Prefill-Decode Disaggregation(CPD)解析:让长上下文的冷请求不再阻塞热请求

版本说明:本文基于 Together AI 官方博客《Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving》整理。原文发表于 2026-03-04,本文于 2026-08-26 撰写。Together AI 的 CPD 具体实现、路由器接口、缓存一致性协议和生产配置
2026-08-26
笔记
#KV Cache #LLM #推理系统 #PD 分离 #RDMA

NVIDIA TensorIR深入解析:从张量计算图到CUDA Tile IR

1. 先说结论 版本说明:本文分析的是NVIDIA TensorIR v0.1.0,该版本于2026-08-17发布。资料主要来自TensorIR官方README、Release Notes、Dialect定义、编译pipeline、Python DSL、runtime和测试代码,以及CUDA Tile IR官方文档。TensorIR处于Early Release阶段,API、性能和硬件支持仍可能
2026-08-18
笔记
#NVIDIA #TensorIR #MLIR #CUDA Tile #GPU Compiler

深入理解 DeepSeek Harness 与 Programmatic Tool Calling

版本说明:本文写于 2026-08-17。DeepSeek Harness 官方仓库目前仍标记为 developer preview,命令、配置和插件接口可能发生不兼容变化。本文以官方公开的 README、架构文档和用户指南为准;Programmatic Tool Calling(下文简称 PTC)以 Anthropic 的公开定义作为主要参考。文中的 PTC 代码是概念示例,不是 DeepSee
2026-08-17
笔记
#Agent #LLM #DeepSeek #Tool Calling #Programmatic Tool Calling

Kimi K3模型架构详解:KDA、Attention Residuals与Stable LatentMoE如何协同

版本说明:本文基于Moonshot AI官方Kimi K3技术报告、官方仓库3cb39df(报告更新于2026-08-06)、官方技术博客和部署文档整理;张量shape与prefill/decode执行路径额外对照vLLM main提交f4b161d7(2026-08-18)。架构、训练和系统数据来自官方报告;标记为“vLLM实现”的内容是当前后端与checkpoint支持,不等于模型数学只允许这
2026-08-15
笔记
#KV Cache #LLM #MoE #MLA #Kimi K3 #Moonshot AI #KDA #Attention Residuals
123…11

搜索

Hexo Fluid
载入运行时间...
总访问量 次 总访客数 人