CUDA 学习之路
CUDA学习之路[3]——GPU并行本质 | 硬件架构 × 编程模型
深入拆解 GPU 硬件架构本源,厘清 CUDA 全栈体系,搞懂并行计算的核心范式与 GPU 的适配边界,为高性能 CUDA 开发打下底层基础
CUDA学习之路[8]:粗看规约Reduce算法
从串行求和到GPU并行规约,逐层剥开取模优化、访存优化、常量展开等优化技术。新手也能看懂的规约算法全景图。
CUDA学习之路[11]:Norm系列详解
详细梳理Normalization方法的发展脉络、数学原理与设计动机,以及CUDA、Triton与Pytorch实现
CUDA学习之路[14]:矩阵乘法计算详解
无论是卷积层、全连接层还是注意力计算,最终都会归因到矩阵运算。
无论是C语言还是CUDA亦或者是numpy、pytorch,都有一大堆针对矩阵运算来进行优化的库,这也是我们AI Infra真正意义上的起点,跟随着我的视角,我们来完整的体会一下是如何优化的。