AMD 2025 分布式推理算子优化挑战赛——笔记

比赛提供的link: 魔搭社区比赛首页 AMD比赛首页 amd-all2all kernel Leaderboard reference-kernels discord link Popcorn CLI lect: ytb Bonus Lecture: AMD Developer Challenge Mixture of Experts AMD Problem 9/16 lect note

September 9, 2025 · 1 min

triton is all you need 之 GEMM

代码参考了傅哥,请b站关注我是傅傅猪喵,谢谢喵! Triton DSL是以BLOCK tile为中心的Python DSL。与CUDA相比,Triton的使用者无法控制所有细节,因为某些优化是自动完成的,但是在Triton编译器的逐层编译优化之下也可以获得与Cuda相近甚至超过的性能。另外,Triton的编写和调试更加简单,而且学习成本更低。 ...

September 7, 2025 · 5 min

八股系列:inference infra

收集我和我小伙伴互相问的八股问题,里面有gemini deep search的回答,望周知。 LLM model rmsnorm和layernorm相比有什么优点参考为什么最新的大模型普遍用RMSNorm? swiglu和relu相比有什么修改GELU: 高斯误差线性单元 ReLU: 修正线性单元 Swish (β=1.0): 标准Swish函数 ...

September 3, 2025 · 35 min

【CUDA从入门到入土】四、矩阵乘法

矩阵乘法跟之前不同,之前一维可以直接写一个kernel,或者多个kernel线性的排布来并行计算,那么矩阵乘法就是由一维向二维转变的关键。这时候一维的kernel排布也变成了二维排布。 ...

September 3, 2025 · 1 min

【LLM 必读综述】Speed Always Wins:LLM高效架构调查

题目:Speed Always Wins: A Survey on Efficient Architectures for Large Language Models 作者:孙伟高 上海人工智能实验室 github:https://github.com/weigao266/Awesome-Efficient-Arch 文章的主要目的通过分析449篇大模型的论文,汇总得到了以下能让大模型速度提升的方向: ...

August 27, 2025 · 7 min

如何最快速的找到最核心的几篇文章

做这期blog的动机很简单,分享一下自己如何快速的上手某个领域的论文。最核心的三个步骤我觉得分别是: 确定自己研究领域的key words,这里是要从上到下的,如LLM -> 微调 和 CoT 确定自己需要研究的题目,如 如何确定CoT的某个环节有益于微调中得到高的得分 根据“and”的检索思想,从小到大的进行检索 先检索key words,确定论文的范围 在页面内只看研究的问题是否符合自己的要求 快速确定自己需要的论文想要快速了解某个领域的论文,一个是问,问从业者,这是最快的,有人脉,直接问最核心的开发者,受益无穷,少走很多弯路。 ...

August 24, 2025 · 4 min

【CUDA从入门到入土】三、reduce算子及其优化

该项目代码参考傅哥的课程,很有用的课程,请多多支持他。 reduce 规约求和是cuda中一个经典的问题,其本质是将输入的序列进行求和。 在CUDA的多线程中,我们清楚数据被分为一个一个的block中进行运行,每个block通过warp来并发32个线程进行运算。 ...

August 23, 2025 · 8 min

cursor trae解决插件问题

使用代理网站 使用vsixhub进行vsix下载,记得在marketplace里对比两者的版本,下载之后直接拖拽文件到cursor的插件栏里就行。 从vscode下载从vscode下载之后点击小齿轮进行下载 使用链接补充下载 在下面的链接的基础上补上一部分 https://marketplace.visualstudio.com/_apis/public/gallery/publishers/ 在后续补上{发布者}/vsextensions/{插件名}/{版本号}/vspackage 比如说上面的Nsight,组合起来就是: https://marketplace.visualstudio.com/_apis/public/gallery/publishers/NVIDIA/vsextensions/nsight-vscode-edition/2025.1.36067579/vspackage 注意,插件名有空格的地方要加短横线- 。这样能直接通过网页下载插件,不需要vscode代为下载。

August 20, 2025 · 1 min

【CUDA从入门到入土】二、CUDA调试和必知必会 & Nsight Computer 入门

上文中,我们运行了一个简单的cuda函数,并且一次过的将其运行了起来,这次,我们需要补充一些基础的概念,通过概念和框架的建立,我们才能走的更远,高屋建瓴的认识更多。 ...

August 17, 2025 · 7 min

【CUDA从入门到入土】五、cuda_kernel_和_cuda_attention详解

从cuda kernel出发,看懂人生第一个cuda attention

August 17, 2025 · 1 min

【CUDA从入门到入土】一、丝滑的CUDA入门

CUDA是什么 cuda是一种gpu编程组件,是一种原生支持GPU软硬件的架构,使得开发者可以直接在 GPU 上编写和执行通用计算程序。 GPU架构 上图是H100白皮书中,H100 GPU带满了144个SM的架构图 上图是H100中,1个SM的架构图 SM架构详解由此,我们可以高屋建瓴的看懂GPU,这里不雕琢细节,只直白的说明白GPU怎么工作的: PCIE 就是负责数据从显卡和主板之间进出的数据传输协议,理解为传递数据的就对了 ...

August 14, 2025 · 8 min

WSL2搭建cuda-triton开发环境

先用了vmware + ubuntu的方法,结果发现现在gpu无法透传到vmware的虚拟机里 故此使用wsl2的开发环境,后续会更新许多更舒服丝滑的操作 WSL2查看所有发行版本 wsl --list --online 安装指定版本 wsl --install Ubuntu-22.04 安装成功之后设置一下账户密码就行 安装miniconda用脚本安装 wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh chmod +x Miniconda3-latest-Linux-x86_64.sh ./Miniconda3-latest-Linux-x86_64.sh source ~/.bashrc conda list 用脚本安装就一直yes就行 安装CUDA Toolkit 和 cudnn使用 nvidia-smi查看cuda版本,在下面链接选择相应的版本 ...

August 14, 2025 · 4 min