<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Mini-SGLang on Hellokitty&#39;s Blog</title>
    <link>https://yangyang233333.github.io/tags/mini-sglang/</link>
    <description>Recent content in Mini-SGLang on Hellokitty&#39;s Blog</description>
    <generator>Hugo</generator>
    <language>zh-CN</language>
    <lastBuildDate>Tue, 25 Aug 2026 21:10:00 +0800</lastBuildDate>
    <atom:link href="https://yangyang233333.github.io/tags/mini-sglang/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Mini-SGLang 源码阅读（五）：模型层、Tensor Parallel 与自定义 Kernel</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-tensor-parallel/</link>
      <pubDate>Tue, 25 Aug 2026 21:10:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-tensor-parallel/</guid>
      <description>从张量并行的矩阵切分原理出发，分析 Mini-SGLang 的并行 Linear、Embedding、模型注册、权重加载和底层 Kernel。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（四）：Engine、Attention Backend 与 CUDA Graph</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-engine/</link>
      <pubDate>Tue, 25 Aug 2026 21:00:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-engine/</guid>
      <description>从 GPU 推理的 kernel 启动开销和 Prefill/Decode 差异出发，分析 Mini-SGLang Engine 的完整执行路径。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（三）：Paged KV Cache 与 Radix Prefix Cache</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-kv-cache/</link>
      <pubDate>Tue, 25 Aug 2026 20:50:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-kv-cache/</guid>
      <description>从自回归推理的 KV Cache 成本出发，分析 Mini-SGLang 的物理页池、请求页表、前缀匹配与缓存驱逐。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（二）：Scheduler、Continuous Batching 与 Chunked Prefill</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-scheduler/</link>
      <pubDate>Tue, 25 Aug 2026 20:40:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-scheduler/</guid>
      <description>先解释在线推理调度的资源约束，再分析 Mini-SGLang 如何组织 Prefill、Decode 和 CPU/GPU 重叠执行。</description>
    </item>
    <item>
      <title>Mini-SGLang 源码阅读（一）：一次 LLM 请求如何穿过推理引擎</title>
      <link>https://yangyang233333.github.io/posts/mini-sglang-source-reading-request-lifecycle/</link>
      <pubDate>Tue, 25 Aug 2026 20:30:00 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/mini-sglang-source-reading-request-lifecycle/</guid>
      <description>从 Prefill、Decode、Continuous Batching 和多进程流水线出发，梳理 Mini-SGLang 一次请求的完整执行流程。</description>
    </item>
  </channel>
</rss>
