CS 背景工程师的 LLM 学习路线图:五阶段从零到部署
CS 背景工程师的 LLM 学习路线图:五阶段从零到部署

欢迎来到「我到底该怎么学 LLM」指南。如果你有计算机背景,又受够了没完没了的机器学习前置课程,这篇就是为你写的。我是以过去的自己为原型写的——真希望当年有人把这些画得这么清楚。走完这条路线,你应该能从容地构建、训练、探索和研究。
文末的链接可以让你想挖多深就挖多深。卡住了就重看。已经会的就直接跳过。这些阶段是你的护栏,不是手铐。到终点时,你会真正建立起这些技能。每个资源、每个项目、每个链接的存在都有理由。使用它、改造它,把它变成你自己的。我希望你不只是把它当一堆收藏夹。
记住,当你卡住、需要把某件事拆解到第一性原理、想要按你的水平定制的材料、需要找出知识盲区,或只是想探索得更深时,随时可以使用 DeepResearch。
这是我「101 天博客」系列的第 4 篇。如果它触发了你什么——想法、问题或批评——我的私信开放。希望它能给你一些带走就能用的东西。
太长不看:我们要干什么?
极简版:
- 5 个阶段。
- 不绕道通用机器学习,除非绝对必要。
- 聚焦那些能让你从容构建、微调并上线 LLM 的基本功。
你将会:
- 手写一个自动微分引擎
- 从零构建一个 mini-GPT
- 使用 LoRA/QLoRA 等 PEFT 方法微调一个模型
这套路线如何运作
方法很简单。
分层学习: 构建直觉 ➡️ 强化理论 ➡️ 更多动手 ➡️ 论文深潜 ➡️ 构建真东西。
你会用到四类资源:
- 视觉直觉(3Blue1Brown、Karpathy)——把「为什么」和「怎么做」看明白。
- 正式理论(斯坦福/MIT 课程、开放课件)——很遗憾,有时候你就是绕不开数学。
- 论文(“Attention Is All You Need”、BERT、LoRA 等)——习惯读论文。
- 编程项目。
先概念,再拆解,然后拿起工具去做。
「路线图总览」部分负责给你概念层面的大图景,告诉你需要理解什么(高层视角)。之后「怎么真正去学」部分把这些概念拆成实际的学习阶段:学什么、怎么建直觉、完成哪些项目、按什么顺序。最后「去哪里学」链接到能帮你执行这条路线的具体视频、课程、论文和代码库。所以:先概念,再拆解,然后拿起工具去做。
路线图总览与主题
基础复习
- 对深度学习真正有用的线性代数与概率
- 干脏活用的 Python/PyTorch
- 项目:构建 Micrograd。之后你将构建一个 MLP 并训练它
Transformer
- 分词、嵌入、自注意力,以及所有模块图里的东西
- 预训练范式:BERT/MLM 对比 GPT/CLM,以及为什么、怎么做、何时用
- 项目:从零构建一个能跑的 mini-GPT
扩展与训练
- 「缩放定律」如何真正预测性能(数学)
- 分布式训练:数据并行、张量并行、流水线并行
- 项目:用 HuggingFace Accelerate 搭建多 GPU 训练。跑起来,看看为什么会崩,修好它
对齐与微调
- RLHF/Constitutional AI
- LoRA/QLoRA:参数高效微调
- 项目:从零实现 LoRA。接入一个 HuggingFace 模型,针对真实用例做一次微调
推理优化
- 推理优化:FlashAttention、量化、实现亚秒级响应
怎么真正去学(真正的计划)
阶段 0:基础复习
理解 LLM 不需要数学博士学位。但如果你看不懂一个简单的 PyTorch 训练循环,或者对矩阵乘法毫无直觉,事情会显得非常混乱(一旦想通了,其实真没那么难)。
- 线性代数/概率:3Blue1Brown 的视频。我想说,能够「看见」矩阵变换是很 helpful 的,需要就重看。
- 正式理论:MIT 18.06 线性代数(当然是 Strang 的)。
- 编程:Karpathy 的 Micrograd 系列。以我的经验,唯一一个不无聊的「从零手写自动微分引擎」教程。
- PyTorch:做官方入门,但把大部分时间花在把数学翻译成代码上。
- 小项目:构建 Micrograd。在 MNIST 上构建并训练一个基础 MLP。不许走捷径。
阶段 1:Transformer
我有个梗:LLM 里最吓人的其实是那些术语。Transformer 就是你听到时大脑需要条件反射「简单」的第一个词。它们不过是一摞矩阵乘法和注意力模块,外加一些非常聪明的工程。
- 直觉:3Blue1Brown 讲 Transformer/注意力的视频。Jay Alammar 的图解 Transformer。看、记笔记,需要就重看。
- 正式:斯坦福 CS224N 深度学习自然语言处理(看讲座本身,不是只看幻灯片)。
- 论文:“Attention Is All You Need”。如果上面这些心智模型还没建立,先别读,否则会淹死。只有在以上内容都熟练之后再读。
- 动手:Karpathy 的「Let’s Build GPT」(顿悟时刻,你会意识到这一切其实多简单)。
- 项目:从零重新实现一个 decoder-only 的 GPT。加分项:换上你自己的分词器,试试 BPE/SentencePiece。
阶段 2:缩放定律与大规模训练
LLM 变强靠的是搞清楚「扩展什么、怎么扩展、证明它能扩展、展示它确实有效」。
- 论文:“Scaling Laws for Neural Language Models”(Kaplan 等),然后是 “Chinchilla”(Hoffmann 等)。搞懂两者区别。
- 分布式训练:搞懂数据并行、张量并行、流水线并行到底在干什么。然后用 HuggingFace Accelerate 搭多 GPU 训练。是的,你总有一天会恨 CUDA。人生就是这样。
- 项目:挑一个模型,跑一个小型分布式作业。玩转 batch size、梯度累积。注意到显存多么容易爆了吗?很好,欢迎来到我的世界。
阶段 3:对齐与 PEFT
微调不只是小把戏。RLHF 和 PEFT 是你能把 LLM 用于真实世界场景的原因。
- RLHF:OpenAI 的「Aligning language models to follow instructions」博客文章,然后是 Ouyang 等的论文。掌握 SFT ➡️ 奖励模型 ➡️ RL 这条流水线。别陷进 PPO 的数学里太深。
- CAI/RLAIF:读 Anthropic 的「Constitutional AI」。
- LoRA/QLoRA:两篇论文都读,然后在 PyTorch 里真正实现 LoRA。如果你不会把一个 Linear 层替换成 LoRA 适配版本,再试一次。
- 项目:用你自己的 LoRA 适配器微调一个开源模型(如 gpt2、distilbert)。用真实数据集做,别用玩具文本。
阶段 4:生产
你终于来到了大多数人唯一能看到的部分:真正的应用。
- 推理优化:读 FlashAttention 论文。理解它为什么有效,然后在一个量化模型上试用。
去哪里学
以下是这条学习计划对应的阅读/观看清单。
数学/计算机前置
- 3Blue1Brown: Essence of Linear Algebra(YouTube)
- MIT 18.06: Linear Algebra(Strang, OCW)
- Deep Learning Book(Goodfellow)
PyTorch 基础
- Karpathy: Neural Networks Zero to Hero
- PyTorch Learn the Basics
- Zero to Mastery PyTorch
Transformer 与 LLM
- Attention Is All You Need(Vaswani 等)
- 3Blue1Brown: What is a GPT?(YouTube)
- Jay Alammar: The Illustrated Transformer
- Karpathy: Let’s Build GPT
- Stanford CS224N(YouTube 讲座)
扩展与分布式训练
- Kaplan 等: Scaling Laws
- Chinchilla 论文(Hoffmann 等)
- HuggingFace Accelerate
对齐与 PEFT
- OpenAI: Aligning LMs to Follow Instructions
- Anthropic: Constitutional AI
- LoRA: Low-Rank Adaptation
- QLoRA
- LightningAI: LoRA from Scratch
推理
- FlashAttention 论文
终局
如果你真的走完上面的路线、做完项目、冲出 YouTube 教程地狱,你会对 LLM 有极深的理解。你能看穿炒作,一眼识别胡扯,并构建自己的模型和工具。
如果你走完这个计划并真的做出了什么东西,私信我,我想看看。
祝你玩得开心。
原文信息
作者:theahmadosman(@theahmadosman)
原文地址:
暂无评论,快来抢沙发~