专栏
17 篇文章
CUDA 学习之路
从祛魅、逐元素,到 Softmax / Norm,再到 Attention,把 CUDA 编程拆成可跟练的连载。
2 篇文章
Triton 学习之路
模板代码与 PyTorch 结合,补上 CUDA 之外的内核写法。
4 篇文章
LeetGPU 习题
加法、拷贝、颜色反转与 Reduce:用习题把基础算子写熟。
1 篇文章
从零实现 vLLM
从项目介绍开始,把手写推理引擎拆开看。
1 篇文章
存算一体
会刊、方向与跟进节奏,给存算一体一条独立线索。
1 篇文章
mytorch
从零理解张量与自动求导,而不是只会调包。
1 篇文章
入门资料汇总
AI Infra 入门路径与资料索引。
2 篇文章
使用工具
编辑器、图片工作流等日常效率笔记。
最新文章
查看全部文章 CUDA学习之路[16]:Attention算子详解
市面上讲解Transformer架构的博客、视频、书籍实在是太多了,我不敢保证自己真的能够讲的比这些大牛都优秀,只能说尽量把我对于Transformer的全部理解都写在这一个系列博客中。
CUDA学习之路[14]:矩阵乘法计算详解
无论是卷积层、全连接层还是注意力计算,最终都会归因到矩阵运算。
无论是C语言还是CUDA亦或者是numpy、pytorch,都有一大堆针对矩阵运算来进行优化的库,这也是我们AI Infra真正意义上的起点,跟随着我的视角,我们来完整的体会一下是如何优化的。
CUDA学习之路[11]:Norm系列详解
详细梳理Normalization方法的发展脉络、数学原理与设计动机,以及CUDA、Triton与Pytorch实现
CUDA学习之路[8]:粗看规约Reduce算法
从串行求和到GPU并行规约,逐层剥开取模优化、访存优化、常量展开等优化技术。新手也能看懂的规约算法全景图。