CUDA 学习之路

← 返回专栏

CUDA 学习之路

从祛魅、逐元素,到 Softmax / Norm,再到 Attention,把 CUDA 编程拆成可跟练的连载。

CUDA学习之路[0]——祛魅
你在什么时候才会用到CUDA呢?
Cover Image of the Post
CUDA学习之路[1]——速通环境配置
如果说深度学习是星辰大海,那环境配置就是暗礁浅滩。我不允许你永远在入门!
Cover Image of the Post
CUDA学习之路[2]——你需要哪些C/C++的知识呢?
你学Java/Python忽视的知识点,反而是在CUDA编程中最需要的。
Cover Image of the Post
CUDA学习之路[3]——GPU并行本质 | 硬件架构 × 编程模型
深入拆解 GPU 硬件架构本源,厘清 CUDA 全栈体系,搞懂并行计算的核心范式与 GPU 的适配边界,为高性能 CUDA 开发打下底层基础
Cover Image of the Post
CUDA学习之路[4]——CUDA全局坐标计算
从一维到三维,彻底理清CUDA线程索引的映射逻辑。
Cover Image of the Post
CUDA学习之路[5]——逐元素操作算子
最基础的一系列算子:element-wise。
Cover Image of the Post
CUDA学习之路[6]:PyTorch CUDA 扩展完全指南
从零掌握在 PyTorch 中调用 CUDA 代码的多种方式,理解 JIT 编译与预编译的权衡,并深入整合自动微分。
Cover Image of the Post
CUDA学习之路[7]:详解oneflow的element_wise代码
从架构师的角度来拆解Oneflow的element wise算子设计。如何只用200行就解决访存瓶颈?
Cover Image of the Post
CUDA学习之路[8]:粗看规约Reduce算法
从串行求和到GPU并行规约,逐层剥开取模优化、访存优化、常量展开等优化技术。新手也能看懂的规约算法全景图。
Cover Image of the Post
CUDA学习之路[9]:CUB 归约的分层设计
学习Nvidia提供的CUB仓库,学会如何看懂代码
Cover Image of the Post
CUDA学习之路[10]:Softmax优化详解
详细总结Softmax的概念及其所有的优化版本(预计万字)
Cover Image of the Post
CUDA学习之路[11]:Norm系列详解
详细梳理Normalization方法的发展脉络、数学原理与设计动机,以及CUDA、Triton与Pytorch实现
Cover Image of the Post
CUDA学习之路[12]:Norm系列代码实现
BN、LN、RMS的CUDA、Triton以及Pytorch实现
Cover Image of the Post
CUDA学习之路[13]:扫描算法详解
Scan 又称为Prefix Sum,是并行计算中最基础也最重要的collective原语之一。
Cover Image of the Post
CUDA学习之路[14]:矩阵乘法计算详解
无论是卷积层、全连接层还是注意力计算,最终都会归因到矩阵运算。 无论是C语言还是CUDA亦或者是numpy、pytorch,都有一大堆针对矩阵运算来进行优化的库,这也是我们AI Infra真正意义上的起点,跟随着我的视角,我们来完整的体会一下是如何优化的。
Cover Image of the Post
Profile Image of the Author
杜子源
都是风景,幸会
公告
如需vLLM项目,请点击赞助第一个二维码并备注github邮箱,或者加我Q:402555241私发我截图
音乐
封面

音乐

暂未播放

0:00 0:00
暂无歌词
分类
标签
站点统计
文章
30
分类
9
标签
12
总字数
101,788
运行时长
0
最后活动
0 天前

目录