专栏

从零实现vLLM系列【6】:Attention实现
如何在模型中实现Attention算子
Cover Image of the Post
从零实现vLLM系列【7】:Sampler实现
如何在模型中实现Sampler
Cover Image of the Post
从零实现vLLM系列【5】:RotaryEmbedding
如何在模型中快速实现旋转编码
Cover Image of the Post
从零实现vLLM系列【4】:RMSNorm快速实现
如何在模型中快速实现RMSNorm
Cover Image of the Post
从零实现vLLM系列【3】:大模型的权重加载
掌握高效的模型加载方案
Cover Image of the Post
从零实现vLLM系列【2】:V0 极简自回归介绍
弄清楚dzyy-vLLM v0版本的整体架构设计
Cover Image of the Post
从零实现vLLM系列【1】:大模型概述
一文扫清大模型基本概念
Cover Image of the Post
从零实现vLLM系列【0】:项目介绍
使用 vLLM 和手写 vLLM是一个难度吗?或许手撕 vLLM 系列会帮到你
Cover Image of the Post
Awesome AI Infra
入门资料汇总
Cover Image of the Post
CUDA学习之路[16]:Attention算子详解
市面上讲解Transformer架构的博客、视频、书籍实在是太多了,我不敢保证自己真的能够讲的比这些大牛都优秀,只能说尽量把我对于Transformer的全部理解都写在这一个系列博客中。
Cover Image of the Post
CUDA学习之路[12]:Norm系列代码实现
BN、LN、RMS的CUDA、Triton以及Pytorch实现
Cover Image of the Post
CUDA学习之路[15]:卷积计算详解
完整的代码仓库在这里,希望对大家有所帮助和收获,希望大家多多Star!
Cover Image of the Post
CUDA学习之路[14]:矩阵乘法计算详解
无论是卷积层、全连接层还是注意力计算,最终都会归因到矩阵运算。 无论是C语言还是CUDA亦或者是numpy、pytorch,都有一大堆针对矩阵运算来进行优化的库,这也是我们AI Infra真正意义上的起点,跟随着我的视角,我们来完整的体会一下是如何优化的。
Cover Image of the Post
CUDA学习之路[11]:Norm系列详解
详细梳理Normalization方法的发展脉络、数学原理与设计动机,以及CUDA、Triton与Pytorch实现
Cover Image of the Post
CUDA学习之路[13]:扫描算法详解
Scan 又称为Prefix Sum,是并行计算中最基础也最重要的collective原语之一。
Cover Image of the Post
Profile Image of the Author
杜子源
都是风景,幸会
公告
如需vLLM项目,请点击赞助第一个二维码并备注github邮箱,或者加我Q:402555241私发我截图
音乐
封面

音乐

暂未播放

0:00 0:00
暂无歌词
分类
标签
站点统计
文章
37
分类
9
标签
15
总字数
121,008
运行时长
0
最后活动
0 天前

目录