vLLM 与 Mooncake 对接源码解读:Prefill/Decode 分离中的 KV Cache 如何跨节点传输

深入分析 vLLM 内置 MooncakeConnector:从代理拆分请求、Scheduler 元数据、GPU KV Cache 注册,到 Mooncake Transfer Engine 通过 RDMA 将 Prefill KV 直接搬到 Decode 节点。

2026年8月24日 · 9 分钟 · Hellokitty

Phoenix 源码解读:把 GPU 显存变成 Linux I/O 可直达的内存

深入解析 xPU-IO/Phoenix:它如何通过内核模块、用户态库和应用适配器,将 SSD 数据直接送入 GPU 显存;并比较 full BAR、staging、batch、stream 等数据路径的实现与取舍。

2026年8月24日 · 7 分钟 · Hellokitty