系统化整理深度学习 CUDA 加速与部署 生态资源,聚焦生产环境优化方案
维护状态: ✅ 活跃更新 | 最后更新: 2026-08-09 | 分支: new-organization
本仓库旨在为 CUDA 深度学习部署工程师 和 性能优化爱好者 提供高质量的精选资源导航。内容偏重:
- 🎯 实战导向: 优先收录经过大规模生产验证的框架和工具
- ⚡ 加速核心: 聚焦算子优化、注意力机制、Tensor Core 利用
- 🛠️ 部署优先: 涵盖从模型转换、推理引擎到端侧部署的全链路
- 📚 中文友好: 重点收录中文开发者社区的优质教程和博客
适合人群:
- 深度学习推理部署工程师
- CUDA 性能优化开发者
- 准备 GPU 相关面试的求职者
- 希望理解 LLM/CV 底层加速原理的研究者
使用建议: 按 快速索引 选择类别,再系统性入门。
💡 版本说明: 当前展示为 new-organization 分支(按资源类型重新分类重构,更简洁,结构清晰)。如需查看原始版本(按应用领域分类,手工整理,介绍更为细致),请访问 main 分支 README。
| 类别 | 项目数 | 适合人群 | 描述 |
|---|---|---|---|
| 📚 学习教程 | 16 | 初学者 → 进阶 | CUDA 编程入门、优化技巧、专项深入 |
| 🚀 生产框架 | 10 | 部署工程师 | LLM/CV/点云推理服务框架 |
| 🔧 算子库 & 内核 | 15 | 性能优化者 | Attention、GEMM、CV/点云算子 |
| 🛠️ 工具 & 生态 | 6 | 全栈开发者 | NVIDIA 官方库、编译器、数据加载 |
| 📖 面试 & 知识 | 5 | 求职者 | 面试题、知识总结、12 篇博客 |
系统性学习 CUDA 编程和优化方法
| 项目 | Stars | 简介 |
|---|---|---|
| cuda-samples | ⭐ 2k+ | NVIDIA 官方示例,从基础到进阶全覆盖 |
| CUDA_Freshman | ⭐ 1k+ | 谭升博客系列教程,质量极高,入门首选 |
| GPU-Puzzles | ⭐ 3k+ | Python 可视化学习,理解 GPU 并行思维 |
| MatmulTutorial | ⭐ 500+ | 矩阵乘法从零到优化的完整教程 |
| AIInfra | ⭐ 7.2k+ | 一个全面的 AIInfra 全景介绍,从模型应用到底层硬件全生态,聚焦 LLM 生态 |
| AISystem | ⭐ 16.9k+ | 聚焦 AI 系统,包括 AI 芯片、AI 编译器、AI 推理和训练框架等 AI 全栈底层技术 |
| 项目 | Stars | 简介 |
|---|---|---|
| How_to_optimize_in_GPU | ⭐ 1k+ | 接近理论峰值的 kernel 优化实战 |
| how-to-optim-algorithm-in-cuda | ⭐ 2k+ | 结合主流框架代码分析优化技巧 |
| Cute-Learning | ⭐ 500+ | Cutlass Cute 编程入门,Hopper 架构必备 |
| 项目 | Stars | 简介 |
|---|---|---|
| tvm_mlir_learn | ⭐ 1k+ | AI 编译器(TVM + MLIR)学习 |
| tutorial-multi-gpu | ⭐ 200+ | 分布式 GPU 编程 |
| CUDA-Related | ⭐ 2k+ | 分阶段系统教程(含 LLM 推理) |
| tensorrt-cookbook | ⭐ 1k+ | NVIDIA 官方 TensorRT 实践教程(Hackathon) |
| llm.c | ⭐ 5k+ | 纯 C/CUDA 实现 LLM training,学习基础算子最佳实践 |
| 项目 | Stars | 简介 |
|---|---|---|
| triton-lang/triton | ⭐ 19.9k+ | OpenAI,自动调优,生态最广 |
| tile-ai/tilelang | ⭐ 6.6k+ | 当前最火的 kernel DSL,GPU/CPU/加速器通用,DeepSeek/Qwen 官方采用 |
| deepseek-ai/TileKernels | ⭐ 1.6k+ | Python 实现,用 TileLang 编写的 kernel 库 |
| HazyResearch/ThunderKittens | ⭐ 3.5k+ | CUDA 实现,tile 原语框架,用简洁抽象写出接近手工优化的 kernel |
- 自动生成 kernel
经过大规模生产验证的推理服务框架
| 项目 | Stars | 适用场景 |
|---|---|---|
| vLLM | ⭐ 40k+ | 高吞吐在线服务 |
| sglang | ⭐ 10k+ | 快速部署、结构化输出 |
| llama.cpp | ⭐ 70k+ | 本地推理、资源受限环境 |
| TensorRT-LLM | ⭐ 8k+ | NVIDIA 生态最优性能 |
| Awesome-LLM-Inference | ⭐ 2k+ | LLM 推理全景图(论文/框架/技术) |
| 项目 | Stars | 简介 |
|---|---|---|
| jetson-inference | ⭐ 8k+ | Jetson 平台全栈部署指南 |
| tensorrtx | ⭐ 6k+ | TensorRT C++ API 重写经典网络 |
| tensorrt_demos | ⭐ 500+ | Jetson 平台 TensorRT 模型演示(多种网络) |
| 项目 | Stars | 简介 |
|---|---|---|
| CUDA-PointPillars | ⭐ 500+ | NVIDIA 官方 PointPillars CUDA 实现(端到端优化) |
| Pointcept | ⭐ 3k+ | 点云网络统一框架,提供 CUDA 加速算子 |
高性能算子实现,可直接集成或学习参考
| 项目 | Stars | 核心优势 | 架构支持 |
|---|---|---|---|
| FlashAttention | ⭐ 18k+ | 算法与硬件极致联合优化 | Ampere+ |
| FlashMLA | ⭐ 3k+ | Hopper 高效 MLA 解码 | Hopper |
| SpargeAttn | ⭐ 1k+ | 无训练稀疏注意力 | Any |
| cuda_self-attention | ⭐ 200+ | 细粒度算子拆分教学 | Any |
| ffpa-attn-mma | ⭐ 300+ | O(1) SRAM 复杂度 | Ampere+ |
| flashinfer-ai/flashinfer | ⭐ 6.0k+ | LLM Serving 专用 kernel 库,被 vLLM/SGLang 广泛集成,支持 PagedAttention/MoE | Any |
| QwenLM/FlashQLA | ⭐ 600+ | Qwen 出品,基于 TileLang 的高性能线性注意力 kernel 库 | Any |
| 项目 | Stars | 特性 | 精度 |
|---|---|---|---|
| siboehm/SGEMM_CUDA | ⭐ 1.25k+ | 配套经典博客,10 步从 1% 优化到接近 cuBLAS,讲解最清晰 | FP32 |
| DeepGEMM | ⭐ 2k+ | DeepSeek-V3 FP8 GEMM,JIT 编译 | FP8 |
| CUDA_gemm | ⭐ 500+ | 块稀疏 + 非均匀量化 GEMM | INT4/FP16 |
| grouped_gemm | ⭐ 200+ | MoE 分组 GEMM(Cutlass) | FP16/BF16 |
| Bruce-Lee-LY/cuda_hgemm | ⭐ 556 | WMMA API + MMA PTX 指令双路线,对比 cuBLAS,工程参考价值高 | fp16/bf16 |
| bytedance/flux | ⭐ 1.3k+ | 通信-计算重叠 GEMM,TP/EP 并行,基于 CUTLASS | FP16/BF16 |
| NVIDIA/cutlass | ⭐ 10.1k+ | C++,NVIDIA 官方高性能线性代数模板库,几乎所有高性能 GEMM kernel 的基座 | 通用 |
| Marlin (vLLM 内置) | - | W4A16 高速推理 GEMM,业界主流 | W4A16 |
| 项目 | Stars | 说明 |
|---|---|---|
| deepseek-ai/DeepEP | ⭐ 9.8k+ | 专家并行通信库,NVLink/RDMA 高吞吐 all-to-all,MoE 训推关键 |
| 项目 | Stars | 说明 |
|---|---|---|
| bitsandbytes-foundation/bitsandbytes | ⭐ 8.3k+ | k-bit 量化 (QLoRA 基石),8-bit 优化器 |
| casper-hansen/AutoAWQ | ⭐ 2.4k+ | AWQ 4-bit 量化算法 (已归档,kernel 在 AutoAWQ_kernels) |
| casper-hansen/AutoAWQ_kernels | - | AutoAWQ 配套的底层 C++/CUDA kernel 库 |
| ModelCloud/GPTQModel | ⭐ 1.2k+ | GPTQ 量化工具包,支持 N 卡/AMD/Intel/Apple,对接 vLLM/SGLang (AutoGPTQ 的继任者) |
| Marlin (vLLM 内置) | - | W4A16 高速推理 GEMM,业界主流 |
| 项目 | Stars | 说明 |
|---|---|---|
| sgl-project/SpecForge | ⭐ 1.1k+ | 训练 EAGLE/EAGLE3 投机解码模型并对接 SGLang serving |
| NVIDIA/TransformerEngine | ⭐ 3.4k+ | Python/CUDA,NVIDIA 官方,FP8/FP4 训练加速,Hopper/Blackwell 混精 |
| linkedin/Liger-Kernel | ⭐ 6.5k+ | LinkedIn 出品,训练用 Triton kernel (RMSNorm/RoPE/SwiGLU 等融合) |
| 项目 | Stars | 内容 |
|---|---|---|
| CUDA-Learn-Notes | ⭐ 3k+ | 150+ kernel,98%~100% cuBLAS 性能 |
| CUDA_Kernel_Samples | ⭐ 500+ | 高频面试算子题目(naive → 优化) |
| Turbo-Softmax | ⭐ 100+ | exp/div 多项式近似加速 |
| gpu-topk | ⭐ 200+ | GPU 并行 Top-K 选择算法 |
| Pointcept/knn、 cuda-kmeans、kmcuda | ⭐ 1k+ | 点云 、KNN/Kmeans 实现集合 |
| 项目 | Stars | 简介 |
|---|---|---|
| CudaSift | ⭐ 200+ | SIFT 特征提取 CUDA 实现(1.2ms@1080p) |
| tsne-cuda | ⭐ 300+ | GPU 加速 t-SNE,比 sklearn 快 1200x |
官方库、编译器、数据加载等基础设施
| 项目 | Stars | 类别 | 简介 |
|---|---|---|---|
| cudnn-frontend | ⭐ 300+ | 神经网络库 | cuDNN C++ wrapper,简化 API |
| cuda-python | ⭐ 1k+ | Python 绑定 | CUDA 官方 Python 接口 |
| DALI | ⭐ 2k+ | 数据加载 | GPU 加速数据预处理 |
| CV-CUDA | ⭐ 1k+ | 图像处理 | NVIDIA + ByteDance 联合开发 |
| CCCL | ⭐ 2k+ | C++ 核心库 | Thrust + CUB + libcudacxx 集合 |
| NVIDIA/cutlass | ⭐ 10.1k+ | GEMM 模板库 | C++,NVIDIA 官方高性能线性代数模板库,几乎所有高性能 GEMM kernel 的基座 |
面试准备、知识总结、博客资源
| 项目 | Stars | 内容 |
|---|---|---|
| cuda-learn-note | ⭐ 1k+ | 面试常见 kernel 实现 + 优化总结 |
| AI-Interview-Code | ⭐ 500+ | 手写注意力机制等(Python) |
| CUDA_Kernel_Samples | ⭐ 500+ | 高频面试算子(重复收录见算子库) |
| 作者/来源 | 链接 | 主题 |
|---|---|---|
| 知乎 | GPU CUDA 高频面试问题汇总 | 面试汇总 |
| 知乎 | 从 0.44ms 到 0.04ms - 10倍softmax优化 | Softmax 优化实战 |
| 知乎 | 深入浅出GPU优化系列:reduce优化 | Reduce 优化 |
| 知乎-PTX | Nvidia Tensor Core-MMA PTX编程入门 | Tensor Core 底层编程 |
| 谭升 | CUDA_C_Programming 系列 | 入门到进阶 |
| 奔跑的IC | CUDA_C_Programming 学习 | 学习笔记 |
| ZOMI | AI 体系知识 | 硬件、编译、推理 |
| Ken He | NVIDIA TensorRT 博客 | TensorRT 官方 |
| NVIDIA | reduction.pdf | Reduce 优化 |
| NVIDIA | cuSparse documentation | 稀疏矩阵库 |
| NVIDIA | cuBLAS documentation | 基本线性代数库 |
| unsloth | unsloth.ai/blog | LLM 量化与优化 |
| 《How To Write A Fast Matrix Multiplication From Scratch With Tensor Cores》 | Tensor Core 矩阵乘法系统教程 | |
| 《Implementing a fast Tensor Core matmul on the Ada Architecture》 | Ada 架构 Tensor Core 优化 |
详细术语解释请见 Glossary.md
欢迎 PR 补充优秀项目!请确保:
- 项目与 CUDA 加速/部署强相关
- 维护状态活跃(近期有 commit)
- 提供 GitHub 链接 + 50 字以内简介
CC0 1.0 Universal - 公共领域贡献