vLLM 与 Mooncake 对接源码解读:Prefill/Decode 分离中的 KV Cache 如何跨节点传输
深入分析 vLLM 内置 MooncakeConnector:从代理拆分请求、Scheduler 元数据、GPU KV Cache 注册,到 Mooncake Transfer Engine 通过 RDMA 将 Prefill KV 直接搬到 Decode 节点。
深入分析 vLLM 内置 MooncakeConnector:从代理拆分请求、Scheduler 元数据、GPU KV Cache 注册,到 Mooncake Transfer Engine 通过 RDMA 将 Prefill KV 直接搬到 Decode 节点。
深入解析 xPU-IO/Phoenix:它如何通过内核模块、用户态库和应用适配器,将 SSD 数据直接送入 GPU 显存;并比较 full BAR、staging、batch、stream 等数据路径的实现与取舍。