Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

47 Commits
 
 
 
 

Repository files navigation

awesome-cuda

系统化整理深度学习 CUDA 加速与部署 生态资源,聚焦生产环境优化方案

维护状态: ✅ 活跃更新 | 最后更新: 2026-08-09 | 分支: new-organization


📖 关于本仓库

本仓库旨在为 CUDA 深度学习部署工程师性能优化爱好者 提供高质量的精选资源导航。内容偏重:

  • 🎯 实战导向: 优先收录经过大规模生产验证的框架和工具
  • 加速核心: 聚焦算子优化、注意力机制、Tensor Core 利用
  • 🛠️ 部署优先: 涵盖从模型转换、推理引擎到端侧部署的全链路
  • 📚 中文友好: 重点收录中文开发者社区的优质教程和博客

适合人群:

  • 深度学习推理部署工程师
  • CUDA 性能优化开发者
  • 准备 GPU 相关面试的求职者
  • 希望理解 LLM/CV 底层加速原理的研究者

使用建议: 按 快速索引 选择类别,再系统性入门。


💡 版本说明: 当前展示为 new-organization 分支(按资源类型重新分类重构,更简洁,结构清晰)。如需查看原始版本(按应用领域分类,手工整理,介绍更为细致),请访问 main 分支 README

类别 项目数 适合人群 描述
📚 学习教程 16 初学者 → 进阶 CUDA 编程入门、优化技巧、专项深入
🚀 生产框架 10 部署工程师 LLM/CV/点云推理服务框架
🔧 算子库 & 内核 15 性能优化者 Attention、GEMM、CV/点云算子
🛠️ 工具 & 生态 6 全栈开发者 NVIDIA 官方库、编译器、数据加载
📖 面试 & 知识 5 求职者 面试题、知识总结、12 篇博客

📚 学习教程

系统性学习 CUDA 编程和优化方法

CUDA 入门

项目 Stars 简介
cuda-samples ⭐ 2k+ NVIDIA 官方示例,从基础到进阶全覆盖
CUDA_Freshman ⭐ 1k+ 谭升博客系列教程,质量极高,入门首选
GPU-Puzzles ⭐ 3k+ Python 可视化学习,理解 GPU 并行思维
MatmulTutorial ⭐ 500+ 矩阵乘法从零到优化的完整教程
AIInfra ⭐ 7.2k+ 一个全面的 AIInfra 全景介绍,从模型应用到底层硬件全生态,聚焦 LLM 生态
AISystem ⭐ 16.9k+ 聚焦 AI 系统,包括 AI 芯片、AI 编译器、AI 推理和训练框架等 AI 全栈底层技术

优化进阶

项目 Stars 简介
How_to_optimize_in_GPU ⭐ 1k+ 接近理论峰值的 kernel 优化实战
how-to-optim-algorithm-in-cuda ⭐ 2k+ 结合主流框架代码分析优化技巧
Cute-Learning ⭐ 500+ Cutlass Cute 编程入门,Hopper 架构必备

专项深入

项目 Stars 简介
tvm_mlir_learn ⭐ 1k+ AI 编译器(TVM + MLIR)学习
tutorial-multi-gpu ⭐ 200+ 分布式 GPU 编程
CUDA-Related ⭐ 2k+ 分阶段系统教程(含 LLM 推理)
tensorrt-cookbook ⭐ 1k+ NVIDIA 官方 TensorRT 实践教程(Hackathon)
llm.c ⭐ 5k+ 纯 C/CUDA 实现 LLM training,学习基础算子最佳实践

DSL

项目 Stars 简介
triton-lang/triton ⭐ 19.9k+ OpenAI,自动调优,生态最广
tile-ai/tilelang ⭐ 6.6k+ 当前最火的 kernel DSL,GPU/CPU/加速器通用,DeepSeek/Qwen 官方采用
deepseek-ai/TileKernels ⭐ 1.6k+ Python 实现,用 TileLang 编写的 kernel 库
HazyResearch/ThunderKittens ⭐ 3.5k+ CUDA 实现,tile 原语框架,用简洁抽象写出接近手工优化的 kernel

热点方向

  • 自动生成 kernel

🚀 生产框架

经过大规模生产验证的推理服务框架

LLM 推理

项目 Stars 适用场景
vLLM ⭐ 40k+ 高吞吐在线服务
sglang ⭐ 10k+ 快速部署、结构化输出
llama.cpp ⭐ 70k+ 本地推理、资源受限环境
TensorRT-LLM ⭐ 8k+ NVIDIA 生态最优性能
Awesome-LLM-Inference ⭐ 2k+ LLM 推理全景图(论文/框架/技术)

CV 推理

项目 Stars 简介
jetson-inference ⭐ 8k+ Jetson 平台全栈部署指南
tensorrtx ⭐ 6k+ TensorRT C++ API 重写经典网络
tensorrt_demos ⭐ 500+ Jetson 平台 TensorRT 模型演示(多种网络)

CV PointCloud

项目 Stars 简介
CUDA-PointPillars ⭐ 500+ NVIDIA 官方 PointPillars CUDA 实现(端到端优化)
Pointcept ⭐ 3k+ 点云网络统一框架,提供 CUDA 加速算子

🔧 算子库 & 内核

高性能算子实现,可直接集成或学习参考

Attention 优化

项目 Stars 核心优势 架构支持
FlashAttention ⭐ 18k+ 算法与硬件极致联合优化 Ampere+
FlashMLA ⭐ 3k+ Hopper 高效 MLA 解码 Hopper
SpargeAttn ⭐ 1k+ 无训练稀疏注意力 Any
cuda_self-attention ⭐ 200+ 细粒度算子拆分教学 Any
ffpa-attn-mma ⭐ 300+ O(1) SRAM 复杂度 Ampere+
flashinfer-ai/flashinfer ⭐ 6.0k+ LLM Serving 专用 kernel 库,被 vLLM/SGLang 广泛集成,支持 PagedAttention/MoE Any
QwenLM/FlashQLA ⭐ 600+ Qwen 出品,基于 TileLang 的高性能线性注意力 kernel 库 Any

GEMM 实现

项目 Stars 特性 精度
siboehm/SGEMM_CUDA ⭐ 1.25k+ 配套经典博客,10 步从 1% 优化到接近 cuBLAS,讲解最清晰 FP32
DeepGEMM ⭐ 2k+ DeepSeek-V3 FP8 GEMM,JIT 编译 FP8
CUDA_gemm ⭐ 500+ 块稀疏 + 非均匀量化 GEMM INT4/FP16
grouped_gemm ⭐ 200+ MoE 分组 GEMM(Cutlass) FP16/BF16
Bruce-Lee-LY/cuda_hgemm ⭐ 556 WMMA API + MMA PTX 指令双路线,对比 cuBLAS,工程参考价值高 fp16/bf16
bytedance/flux ⭐ 1.3k+ 通信-计算重叠 GEMM,TP/EP 并行,基于 CUTLASS FP16/BF16
NVIDIA/cutlass ⭐ 10.1k+ C++,NVIDIA 官方高性能线性代数模板库,几乎所有高性能 GEMM kernel 的基座 通用
Marlin (vLLM 内置) - W4A16 高速推理 GEMM,业界主流 W4A16

MoE 优化

项目 Stars 说明
deepseek-ai/DeepEP ⭐ 9.8k+ 专家并行通信库,NVLink/RDMA 高吞吐 all-to-all,MoE 训推关键

量化 kernel

项目 Stars 说明
bitsandbytes-foundation/bitsandbytes ⭐ 8.3k+ k-bit 量化 (QLoRA 基石),8-bit 优化器
casper-hansen/AutoAWQ ⭐ 2.4k+ AWQ 4-bit 量化算法 (已归档,kernel 在 AutoAWQ_kernels)
casper-hansen/AutoAWQ_kernels - AutoAWQ 配套的底层 C++/CUDA kernel 库
ModelCloud/GPTQModel ⭐ 1.2k+ GPTQ 量化工具包,支持 N 卡/AMD/Intel/Apple,对接 vLLM/SGLang (AutoGPTQ 的继任者)
Marlin (vLLM 内置) - W4A16 高速推理 GEMM,业界主流

LLM 专属算子库

项目 Stars 说明
sgl-project/SpecForge ⭐ 1.1k+ 训练 EAGLE/EAGLE3 投机解码模型并对接 SGLang serving
NVIDIA/TransformerEngine ⭐ 3.4k+ Python/CUDA,NVIDIA 官方,FP8/FP4 训练加速,Hopper/Blackwell 混精
linkedin/Liger-Kernel ⭐ 6.5k+ LinkedIn 出品,训练用 Triton kernel (RMSNorm/RoPE/SwiGLU 等融合)

通用算子库

项目 Stars 内容
CUDA-Learn-Notes ⭐ 3k+ 150+ kernel,98%~100% cuBLAS 性能
CUDA_Kernel_Samples ⭐ 500+ 高频面试算子题目(naive → 优化)
Turbo-Softmax ⭐ 100+ exp/div 多项式近似加速
gpu-topk ⭐ 200+ GPU 并行 Top-K 选择算法
Pointcept/knncuda-kmeanskmcuda ⭐ 1k+ 点云 、KNN/Kmeans 实现集合

CV 算子 & 工具

项目 Stars 简介
CudaSift ⭐ 200+ SIFT 特征提取 CUDA 实现(1.2ms@1080p)
tsne-cuda ⭐ 300+ GPU 加速 t-SNE,比 sklearn 快 1200x

🛠️ 工具 & 生态

官方库、编译器、数据加载等基础设施

项目 Stars 类别 简介
cudnn-frontend ⭐ 300+ 神经网络库 cuDNN C++ wrapper,简化 API
cuda-python ⭐ 1k+ Python 绑定 CUDA 官方 Python 接口
DALI ⭐ 2k+ 数据加载 GPU 加速数据预处理
CV-CUDA ⭐ 1k+ 图像处理 NVIDIA + ByteDance 联合开发
CCCL ⭐ 2k+ C++ 核心库 Thrust + CUB + libcudacxx 集合
NVIDIA/cutlass ⭐ 10.1k+ GEMM 模板库 C++,NVIDIA 官方高性能线性代数模板库,几乎所有高性能 GEMM kernel 的基座

📖 面试 & 知识

面试准备、知识总结、博客资源

面试向

项目 Stars 内容
cuda-learn-note ⭐ 1k+ 面试常见 kernel 实现 + 优化总结
AI-Interview-Code ⭐ 500+ 手写注意力机制等(Python)
CUDA_Kernel_Samples ⭐ 500+ 高频面试算子(重复收录见算子库)

博客合集

作者/来源 链接 主题
知乎 GPU CUDA 高频面试问题汇总 面试汇总
知乎 从 0.44ms 到 0.04ms - 10倍softmax优化 Softmax 优化实战
知乎 深入浅出GPU优化系列:reduce优化 Reduce 优化
知乎-PTX Nvidia Tensor Core-MMA PTX编程入门 Tensor Core 底层编程
谭升 CUDA_C_Programming 系列 入门到进阶
奔跑的IC CUDA_C_Programming 学习 学习笔记
ZOMI AI 体系知识 硬件、编译、推理
Ken He NVIDIA TensorRT 博客 TensorRT 官方
NVIDIA reduction.pdf Reduce 优化
NVIDIA cuSparse documentation 稀疏矩阵库
NVIDIA cuBLAS documentation 基本线性代数库
unsloth unsloth.ai/blog LLM 量化与优化
《How To Write A Fast Matrix Multiplication From Scratch With Tensor Cores》 Tensor Core 矩阵乘法系统教程
《Implementing a fast Tensor Core matmul on the Ada Architecture》 Ada 架构 Tensor Core 优化

📑 附录

术语表

详细术语解释请见 Glossary.md

贡献指南

欢迎 PR 补充优秀项目!请确保:

  1. 项目与 CUDA 加速/部署强相关
  2. 维护状态活跃(近期有 commit)
  3. 提供 GitHub 链接 + 50 字以内简介

License

CC0 1.0 Universal - 公共领域贡献

About

Awesome code, projects, books, etc. related to CUDA

Resources

Stars

40 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors