GentleCold's Blog
  • 首页
  • Teach
  • 归档
  • 分类
  • 标签
  • 友链
  • 关于

Cache-aware Prefill-Decode Disaggregation(CPD)解析:让长上下文的冷请求不再阻塞热请求

版本说明:本文基于 Together AI 官方博客《Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving》整理。原文发表于 2026-03-04,本文于 2026-08-26 撰写。Together AI 的 CPD 具体实现、路由器接口、缓存一致性协议和生产配置
2026-08-26
笔记
#KV Cache #LLM #推理系统 #PD 分离 #RDMA

NVIDIA TensorIR深入解析:从张量计算图到CUDA Tile IR

1. 先说结论 版本说明:本文分析的是NVIDIA TensorIR v0.1.0,该版本于2026-08-17发布。资料主要来自TensorIR官方README、Release Notes、Dialect定义、编译pipeline、Python DSL、runtime和测试代码,以及CUDA Tile IR官方文档。TensorIR处于Early Release阶段,API、性能和硬件支持仍可能
2026-08-18
笔记
#NVIDIA #TensorIR #MLIR #CUDA Tile #GPU Compiler

深入理解 DeepSeek Harness 与 Programmatic Tool Calling

版本说明:本文写于 2026-08-17。DeepSeek Harness 官方仓库目前仍标记为 developer preview,命令、配置和插件接口可能发生不兼容变化。本文以官方公开的 README、架构文档和用户指南为准;Programmatic Tool Calling(下文简称 PTC)以 Anthropic 的公开定义作为主要参考。文中的 PTC 代码是概念示例,不是 DeepSee
2026-08-17
笔记
#Agent #LLM #DeepSeek #Tool Calling #Programmatic Tool Calling

Kimi K3模型架构详解:KDA、Attention Residuals与Stable LatentMoE如何协同

版本说明:本文基于Moonshot AI官方Kimi K3技术报告、官方仓库3cb39df(报告更新于2026-08-06)、官方技术博客和部署文档整理;张量shape与prefill/decode执行路径额外对照vLLM main提交f4b161d7(2026-08-18)。架构、训练和系统数据来自官方报告;标记为“vLLM实现”的内容是当前后端与checkpoint支持,不等于模型数学只允许这
2026-08-15
笔记
#KV Cache #LLM #MoE #MLA #Kimi K3 #Moonshot AI #KDA #Attention Residuals

GB300与NVL72详解:从Blackwell Ultra芯片到72 GPU液冷机架

1. 先说结论 版本说明:本文按 2026-08-15 访问的 NVIDIA 官方 GB300 NVL72、Blackwell Architecture、NVLink、NVLink-C2C 和 ConnectX 资料整理。用户所说的“NV72”通常是 NVL72 的简称;NVIDIA 的正式产品名是 GB300 NVL72。如果这里的 NV72 指的是别的厂商内部型号,需要以具体型号为准。 先把
2026-08-15
笔记
#GPU Cluster #NVIDIA #Blackwell #GB300 #NVL72 #AI Infrastructure #Inference

FastAFD详解:在Blackwell NVL72上拆分Attention与FFN的MoE推理系统

版本说明:本文基于Hao AI Lab于2026-07-06发布的FastAFD技术文章,以及2026-07-08的开源仓库commit 3c71619整理。GB200 NVL72上的1.35-1.45倍结果来自作者实测;Vera Rubin + LPX/LPU部分是建立在若干假设上的预测,不是硬件实测。本文没有本地复现多节点GB200实验。 1. 先说结论 FastAFD解决的是一个很具体、但
2026-07-14
笔记
#LLM Inference #NVLink #CUDA Graph #MoE #FastAFD #Blackwell #DeepEP #DeepGEMM

CacheWise论文详解:面向LLM Coding Agent的KV Cache调度与预测淘汰

版本说明:本文基于2026-06-15提交的arXiv v1论文《CacheWise: Understanding Workloads and Optimizing KVCache Management for Efficiently Serving LLM Coding Agents》、作者公开的CATraces仓库181c435以及cachewise-project/vllm的cachewis
2026-07-13
笔记
#KV Cache #LLM Inference #VLLM #CacheWise #Coding Agent #Scheduling

vLLM Model Runner V2源码拆解:稳定状态、GPU输入准备与异步采样

版本说明:本文以2026-07-13拉取的vllm-project/vllm主分支源码4c81772为当前实现基线,以MRV2首次公开时的v0.18.0源码bcf2be9和2026-03-24官方博客为历史基线。MRV2仍在快速演进,文中的源码链接均固定到commit。官方性能数字来自发布博客,本文没有在本地复测GB200结果。 1 先说结论 Model Runner V2,简称MRV2,不是v
2026-07-13
笔记
#LLM Inference #VLLM #CUDA #Speculative Decoding #Triton #Model Runner

TokenSpeed推理引擎剖析:面向Agentic Workload的调度、缓存与Kernel系统

本文基于2026-07-10拉取的lightseekorg/tokenspeed主分支源码c2a4cd6、官方文档、LightSeek发布文以及PyTorch官方博客整理。TokenSpeed还处在快速演进阶段,文中实现细节以该commit为准;尤其是调度、PD分离、MLA kernel和模型recipe后续都可能继续变化。 1 先说结论 TokenSpeed不是“又一个OpenAI兼容服务壳子
2026-07-10
笔记
#KV Cache #LLM #推理系统 #CUDA #MoE #TokenSpeed

DeepSeek 技术栈详解:从模型架构到 WideEP、DSpark、DFlash、DeepGEMM

0. 先说结论 DeepSeek 相关技术栈不能只理解成“一个模型”。它更像一整套围绕 MoE 大模型训练与推理 做出来的系统工程: * 模型层:DeepSeek-V3 / V3.2 的核心是 MLA、DeepSeekMoE、辅助损失无关的负载均衡、MTP、DSA。 * 通信层:DeepEP 负责 MoE expert parallelism 里的 token dispatch / comb
2026-07-03
笔记
#推理系统 #CUDA #DeepSeek #大模型 #MoE #Speculative Decoding
123…10

搜索

Hexo Fluid
载入运行时间...
总访问量 次 总访客数 人