<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>大模型推理 on Hellokitty&#39;s Blog</title>
    <link>https://yangyang233333.github.io/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86/</link>
    <description>Recent content in 大模型推理 on Hellokitty&#39;s Blog</description>
    <generator>Hugo</generator>
    <language>zh-CN</language>
    <lastBuildDate>Wed, 26 Aug 2026 13:50:00 +0800</lastBuildDate>
    <atom:link href="https://yangyang233333.github.io/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>NVIDIA Dynamo 源码阅读（二）：分布式运行时如何组织服务与请求</title>
      <link>https://yangyang233333.github.io/posts/nvidia-dynamo-runtime-source-reading/</link>
      <pubDate>Wed, 26 Aug 2026 13:50:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/nvidia-dynamo-runtime-source-reading/</guid>
      <description>深入 lib/runtime，分析 Namespace、Component、Endpoint、服务发现和网络流水线如何组成 Dynamo 的请求平面。</description>
    </item>
    <item>
      <title>NVIDIA Dynamo 源码阅读（三）：KV-aware Router 如何选择 Worker</title>
      <link>https://yangyang233333.github.io/posts/nvidia-dynamo-kv-aware-router-source-reading/</link>
      <pubDate>Wed, 26 Aug 2026 13:50:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/nvidia-dynamo-kv-aware-router-source-reading/</guid>
      <description>从 token 分块哈希、KV 事件、Radix Tree、负载估计和选择策略出发，拆解 Dynamo KV-aware Router。</description>
    </item>
    <item>
      <title>NVIDIA Dynamo 源码阅读（四）：Prefill/Decode 分离与 KV 传输</title>
      <link>https://yangyang233333.github.io/posts/nvidia-dynamo-disaggregated-serving-source-reading/</link>
      <pubDate>Wed, 26 Aug 2026 13:50:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/nvidia-dynamo-disaggregated-serving-source-reading/</guid>
      <description>分析 Dynamo 如何进行两阶段路由、交换传输元数据，并让 KV Cache 在 Prefill 与 Decode Worker 之间直接移动。</description>
    </item>
    <item>
      <title>NVIDIA Dynamo 源码阅读（一）：数据中心级推理栈的整体架构</title>
      <link>https://yangyang233333.github.io/posts/nvidia-dynamo-architecture-overview/</link>
      <pubDate>Wed, 26 Aug 2026 13:50:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/nvidia-dynamo-architecture-overview/</guid>
      <description>从请求路径、控制面、数据面和后端边界出发，理解 NVIDIA Dynamo 为什么是推理引擎之上的分布式编排层。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（五）：模型层、Tensor Parallel 与自定义 Kernel</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-tensor-parallel/</link>
      <pubDate>Tue, 25 Aug 2026 21:10:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-tensor-parallel/</guid>
      <description>从张量并行的矩阵切分原理出发，分析 Mini-SGLang 的并行 Linear、Embedding、模型注册、权重加载和底层 Kernel。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（四）：Engine、Attention Backend 与 CUDA Graph</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-engine/</link>
      <pubDate>Tue, 25 Aug 2026 21:00:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-engine/</guid>
      <description>从 GPU 推理的 kernel 启动开销和 Prefill/Decode 差异出发，分析 Mini-SGLang Engine 的完整执行路径。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（三）：Paged KV Cache 与 Radix Prefix Cache</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-kv-cache/</link>
      <pubDate>Tue, 25 Aug 2026 20:50:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-kv-cache/</guid>
      <description>从自回归推理的 KV Cache 成本出发，分析 Mini-SGLang 的物理页池、请求页表、前缀匹配与缓存驱逐。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（二）：Scheduler、Continuous Batching 与 Chunked Prefill</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-scheduler/</link>
      <pubDate>Tue, 25 Aug 2026 20:40:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-scheduler/</guid>
      <description>先解释在线推理调度的资源约束，再分析 Mini-SGLang 如何组织 Prefill、Decode 和 CPU/GPU 重叠执行。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（一）：一次 LLM 请求如何穿过推理引擎</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-request-lifecycle/</link>
      <pubDate>Tue, 25 Aug 2026 20:30:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-request-lifecycle/</guid>
      <description>从 Prefill、Decode、Continuous Batching 和多进程流水线出发，梳理 Mini-SGLang 一次请求的完整执行流程。</description>
    </item>
    <item>
      <title>vLLM 与 Mooncake 对接源码解读：Prefill/Decode 分离中的 KV Cache 如何跨节点传输</title>
      <link>https://yangyang233333.github.io/posts/vllm-mooncake-integration/</link>
      <pubDate>Mon, 24 Aug 2026 16:58:43 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/vllm-mooncake-integration/</guid>
      <description>深入分析 vLLM 内置 MooncakeConnector：从代理拆分请求、Scheduler 元数据、GPU KV Cache 注册，到 Mooncake Transfer Engine 通过 RDMA 将 Prefill KV 直接搬到 Decode 节点。</description>
    </item>
  </channel>
</rss>
