CUDA Event:GPU 时间线上的事件、同步原理与实战

CUDA kernel launch 通常是异步的:CPU 把 kernel、内存拷贝等操作提交到 stream 后便继续执行。由此产生两个常见问题:如何准确测量 GPU 工作耗时,以及如何让不同 stream 在不阻塞 CPU 的情况下建立依赖? CUDA Event 就是解决这类问题的基础设施。它可以理解为插入 GPU stream 时间线中的一个标记:当 event 之前的工作全部完成,event 才进入完成状态。借助这个状态,我们可以做 GPU 计时、CPU 等待、跨 stream 同步和异步资源回收。 1. Event 不是 CPU 事件,而是 GPU 时间线标记 一个 CUDA stream 是按序执行的 GPU 工作队列: CPU 提交: Kernel A → memcpy → Event E → Kernel B 异步提交 GPU 执行: Kernel A ── memcpy ── E 完成 ── Kernel B 调用 cudaEventRecord(event, stream) 时,CPU 通常只是向 stream 提交一个 event 记录操作,并不会等待 GPU 执行到该位置。只有当这个 stream 中排在 event 前面的操作完成后,event 才会被标记为完成。 ...

2026年8月31日 · 6 分钟 · Hellokitty

NVIDIA GPU-Initiated Data Storage(GIDS)详解:让 GPU Kernel 主动访问存储

GPUDirect Storage(GDS)已经能够让存储数据绕过 CPU 内存,直接进入 GPU 显存。但经典 GDS 仍有一个重要特征:I/O 请求由 CPU 侧应用代码提交。 当 GPU kernel 在执行过程中才知道下一份数据位于哪里时,控制权必须在 GPU 与 CPU 之间往返。对于图计算、向量检索、稀疏模型和超大规模数据分析,这种细粒度同步可能比数据传输本身更昂贵。 NVIDIA GPU-Initiated Data Storage,简称 GIDS,试图进一步消除这层控制瓶颈:让 GPU kernel 直接发起存储 I/O,使 GPU 不仅是数据的接收者,也是 I/O 请求的生产者。 本文介绍 GIDS 的动机、架构、工作流程、适用场景,以及它和 GDS 的本质区别。 一、为什么有了 GDS 还需要 GIDS GDS 优化了数据路径: CPU 发起请求 │ ▼ 存储 ─────────────► GPU 显存 数据不经过 CPU 内存 这已经消除了大量主机内存中转,但控制路径仍然经过 CPU。经典流程可能是: GPU 执行 kernel; GPU 产生下一批要访问的数据索引; kernel 结束或与 CPU 同步; CPU 读取结果并构造文件 I/O; CPU 调用 cuFile; 数据进入 GPU; CPU 再次启动 kernel。 如果每次请求都是大块、批量且可提前预测,这种方式通常没有问题。但如果 GPU 在计算过程中产生数以万计甚至更多的动态访问,频繁的 GPU—CPU 往返会带来: ...

2026年8月19日 · 4 分钟 · Hellokitty

NVIDIA GPUDirect Storage(GDS)详解:让存储数据绕过 CPU 直达 GPU

在 AI 训练、科学计算和数据分析系统中,GPU 的算力越来越强,但数据从存储设备进入 GPU 的路径却可能成为瓶颈。传统 I/O 通常要先把数据读入 CPU 内存,再复制到 GPU 显存,不仅增加内存带宽消耗,还让 CPU 承担大量数据搬运工作。 NVIDIA GPUDirect Storage,简称 GDS,解决的正是这个问题:它在存储设备与 GPU 显存之间建立更直接的数据路径,使应用能够通过 cuFile API 将文件数据读入 GPU 缓冲区,减少 CPU bounce buffer 和不必要的数据复制。 本文介绍 GDS 的工作原理、软件栈、典型使用方式、适用场景以及它与 GPU-Initiated Data Storage(GIDS)的关系。 一、传统 GPU I/O 为什么效率不高 传统文件读取到 GPU 的路径大致如下: NVMe / 文件系统 │ ▼ CPU 内存缓冲区 │ cudaMemcpy ▼ GPU 显存 应用通常先调用 read、pread 或异步 I/O 接口,把文件内容读入主机内存,然后再调用 CUDA memcpy 将数据复制到 GPU。 这条路径存在几个问题: 同一份数据先经过 CPU 内存,再进入 GPU 显存; 存储流量和 GPU 传输流量竞争 CPU 内存带宽; CPU 需要提交、管理和完成数据搬运; 大规模 GPU 系统中,CPU 和内存通道容易成为共享瓶颈; 应用需要维护主机端 staging buffer,并处理双重缓冲。 当 GPU 计算越来越快、单机挂载更多 NVMe 或更高速的并行文件系统后,这些额外开销会更加明显。 ...

2026年8月19日 · 3 分钟 · Hellokitty