欢迎来到 LLM_intro 项目!本项目旨在通过深入浅出的理论讲解和代码实践,帮助你掌握大语言模型(LLM)的核心概念。
为了更好地理解本项目的内容,建议具备以下基础:
- 数学基础:具备线性代数知识(矩阵运算、向量空间等是理解 Transformer 的关键)。
- 编程基础:了解 Python 编程。
本项目主要包含以下几个部分的学习资料:
这部分是《Transformer 架构:从直觉到实现》的完整教程,旨在通过直观的几何解释和代码实现,带你彻底搞懂 Transformer 架构。
Transformer介绍/- 包含从 "GPT 是什么" 到 "后 Transformer 架构" 的 30+ 章节 Markdown 文档。
- 涵盖内容:
- 基础直觉:GPT 发展史、大模型本质
- 核心组件:Tokenization、Positional Encoding、LayerNorm、Softmax
- Attention 机制:线性变换几何意义、QKV 的本质、Multi-Head Attention
- 完整架构:残差连接、前向传播、训练与推理
- 手写实现:手写 Model.py, Train.py, Inference.py
- 进阶优化:Flash Attention, KV Cache, LoRA, Quantization
- 文档中包含大量可视化图片(存储于
images/目录),帮助从几何角度理解复杂的数学原理。 - 文档目录:
- 前言
- 第 1 章:GPT 是什么
- 第 2 章:大模型的本质
- 第 3 章:Transformer 全景图
- 第 4 章:Tokenization
- 第 5 章:Positional Encoding
- 第 6 章:LayerNorm 与 Softmax
- 第 7 章:神经网络层
- 第 8 章:线性变换的几何意义
- 第 9 章:Attention 的几何逻辑
- 第 10 章:QKV 到底是什么
- 第 11 章:Multi-Head Attention
- 第 12 章:QKV 输出的本质
- 第 13 章:残差连接与 Dropout
- 第 14 章:词嵌入与位置信息
- 第 15 章:完整前向传播
- 第 16 章:训练与推理的异同
- 第 17 章:学习率的理解
- 第 18 章:手写 Model.py
- 第 19 章:手写 Train.py
- 第 20 章:手写 Inference.py
- 第 21 章:Flash Attention
- 第 22 章:KV Cache
- 第 23 章:MHA 到 MQA 到 GQA
- 第 24 章:Sparse 与 Infinite Attention
- 第 25 章:位置编码演进
- 第 26 章:LoRA 与 QLoRA
- 第 27 章:模型量化
- 第 28 章:Prompt Engineering
- 第 29 章:RLHF 与偏好学习
- 第 30 章:Mixture of Experts
- 第 31 章:推理模型革命
- 第 32 章:后 Transformer 架构
- 附录 A:Scaling Law
- 附录 B:解码策略详解
- 附录 C:常见问题 FAQ
-
Happy_LLM/chp1/- NLP 基础概念- 文档目录:
-
Happy_LLM/chp2/- 神经网络核心组件- 文档目录:
- 环境准备:确保安装 Python 3.x 及 PyTorch,建议使用Trae等编辑器。
- 基础学习:阅读
Transformer介绍中的文档,配合Happy_LLM/chp2的代码理解核心组件。 - 进阶学习:从
Happy_LLM/chp1开始,运行代码理解 NLP 的基础输入表示。 - 动手实践:跟随教程尝试手写 Transformer 模型。
Enjoy Coding! 🚀