CS 背景工程师的 LLM 学习路线图:五阶段从零到部署

AI小蝌蚪AI 前沿📡 觉醒AI2026-09-21849 阅读💛 56 收藏

CS 背景工程师的 LLM 学习路线图:五阶段从零到部署

图片

欢迎来到「我到底该怎么学 LLM」指南。如果你有计算机背景,又受够了没完没了的机器学习前置课程,这篇就是为你写的。我是以过去的自己为原型写的——真希望当年有人把这些画得这么清楚。走完这条路线,你应该能从容地构建、训练、探索和研究。

文末的链接可以让你想挖多深就挖多深。卡住了就重看。已经会的就直接跳过。这些阶段是你的护栏,不是手铐。到终点时,你会真正建立起这些技能。每个资源、每个项目、每个链接的存在都有理由。使用它、改造它,把它变成你自己的。我希望你不只是把它当一堆收藏夹。

记住,当你卡住、需要把某件事拆解到第一性原理、想要按你的水平定制的材料、需要找出知识盲区,或只是想探索得更深时,随时可以使用 DeepResearch。

这是我「101 天博客」系列的第 4 篇。如果它触发了你什么——想法、问题或批评——我的私信开放。希望它能给你一些带走就能用的东西。

太长不看:我们要干什么?

极简版:

  • 5 个阶段。
  • 不绕道通用机器学习,除非绝对必要。
  • 聚焦那些能让你从容构建、微调并上线 LLM 的基本功。

你将会:

  • 手写一个自动微分引擎
  • 从零构建一个 mini-GPT
  • 使用 LoRA/QLoRA 等 PEFT 方法微调一个模型

这套路线如何运作

方法很简单。

分层学习: 构建直觉 ➡️ 强化理论 ➡️ 更多动手 ➡️ 论文深潜 ➡️ 构建真东西。

你会用到四类资源:

  • 视觉直觉(3Blue1Brown、Karpathy)——把「为什么」和「怎么做」看明白。
  • 正式理论(斯坦福/MIT 课程、开放课件)——很遗憾,有时候你就是绕不开数学。
  • 论文(“Attention Is All You Need”、BERT、LoRA 等)——习惯读论文。
  • 编程项目。

先概念,再拆解,然后拿起工具去做。

「路线图总览」部分负责给你概念层面的大图景,告诉你需要理解什么(高层视角)。之后「怎么真正去学」部分把这些概念拆成实际的学习阶段:学什么、怎么建直觉、完成哪些项目、按什么顺序。最后「去哪里学」链接到能帮你执行这条路线的具体视频、课程、论文和代码库。所以:先概念,再拆解,然后拿起工具去做。

路线图总览与主题

基础复习

  • 对深度学习真正有用的线性代数与概率
  • 干脏活用的 Python/PyTorch
  • 项目:构建 Micrograd。之后你将构建一个 MLP 并训练它

Transformer

  • 分词、嵌入、自注意力,以及所有模块图里的东西
  • 预训练范式:BERT/MLM 对比 GPT/CLM,以及为什么、怎么做、何时用
  • 项目:从零构建一个能跑的 mini-GPT

扩展与训练

  • 「缩放定律」如何真正预测性能(数学)
  • 分布式训练:数据并行、张量并行、流水线并行
  • 项目:用 HuggingFace Accelerate 搭建多 GPU 训练。跑起来,看看为什么会崩,修好它

对齐与微调

  • RLHF/Constitutional AI
  • LoRA/QLoRA:参数高效微调
  • 项目:从零实现 LoRA。接入一个 HuggingFace 模型,针对真实用例做一次微调

推理优化

  • 推理优化:FlashAttention、量化、实现亚秒级响应

怎么真正去学(真正的计划)

阶段 0:基础复习

理解 LLM 不需要数学博士学位。但如果你看不懂一个简单的 PyTorch 训练循环,或者对矩阵乘法毫无直觉,事情会显得非常混乱(一旦想通了,其实真没那么难)。

  • 线性代数/概率:3Blue1Brown 的视频。我想说,能够「看见」矩阵变换是很 helpful 的,需要就重看。
  • 正式理论:MIT 18.06 线性代数(当然是 Strang 的)。
  • 编程:Karpathy 的 Micrograd 系列。以我的经验,唯一一个不无聊的「从零手写自动微分引擎」教程。
  • PyTorch:做官方入门,但把大部分时间花在把数学翻译成代码上。
  • 小项目:构建 Micrograd。在 MNIST 上构建并训练一个基础 MLP。不许走捷径。

阶段 1:Transformer

我有个梗:LLM 里最吓人的其实是那些术语。Transformer 就是你听到时大脑需要条件反射「简单」的第一个词。它们不过是一摞矩阵乘法和注意力模块,外加一些非常聪明的工程。

  • 直觉:3Blue1Brown 讲 Transformer/注意力的视频。Jay Alammar 的图解 Transformer。看、记笔记,需要就重看。
  • 正式:斯坦福 CS224N 深度学习自然语言处理(看讲座本身,不是只看幻灯片)。
  • 论文:“Attention Is All You Need”。如果上面这些心智模型还没建立,先别读,否则会淹死。只有在以上内容都熟练之后再读。
  • 动手:Karpathy 的「Let’s Build GPT」(顿悟时刻,你会意识到这一切其实多简单)。
  • 项目:从零重新实现一个 decoder-only 的 GPT。加分项:换上你自己的分词器,试试 BPE/SentencePiece。

阶段 2:缩放定律与大规模训练

LLM 变强靠的是搞清楚「扩展什么、怎么扩展、证明它能扩展、展示它确实有效」。

  • 论文:“Scaling Laws for Neural Language Models”(Kaplan 等),然后是 “Chinchilla”(Hoffmann 等)。搞懂两者区别。
  • 分布式训练:搞懂数据并行、张量并行、流水线并行到底在干什么。然后用 HuggingFace Accelerate 搭多 GPU 训练。是的,你总有一天会恨 CUDA。人生就是这样。
  • 项目:挑一个模型,跑一个小型分布式作业。玩转 batch size、梯度累积。注意到显存多么容易爆了吗?很好,欢迎来到我的世界。

阶段 3:对齐与 PEFT

微调不只是小把戏。RLHF 和 PEFT 是你能把 LLM 用于真实世界场景的原因。

  • RLHF:OpenAI 的「Aligning language models to follow instructions」博客文章,然后是 Ouyang 等的论文。掌握 SFT ➡️ 奖励模型 ➡️ RL 这条流水线。别陷进 PPO 的数学里太深。
  • CAI/RLAIF:读 Anthropic 的「Constitutional AI」。
  • LoRA/QLoRA:两篇论文都读,然后在 PyTorch 里真正实现 LoRA。如果你不会把一个 Linear 层替换成 LoRA 适配版本,再试一次。
  • 项目:用你自己的 LoRA 适配器微调一个开源模型(如 gpt2、distilbert)。用真实数据集做,别用玩具文本。

阶段 4:生产

你终于来到了大多数人唯一能看到的部分:真正的应用。

  • 推理优化:读 FlashAttention 论文。理解它为什么有效,然后在一个量化模型上试用。

去哪里学

以下是这条学习计划对应的阅读/观看清单。

数学/计算机前置

  • 3Blue1Brown: Essence of Linear Algebra(YouTube)
  • MIT 18.06: Linear Algebra(Strang, OCW)
  • Deep Learning Book(Goodfellow)

PyTorch 基础

  • Karpathy: Neural Networks Zero to Hero
  • PyTorch Learn the Basics
  • Zero to Mastery PyTorch

Transformer 与 LLM

  • Attention Is All You Need(Vaswani 等)
  • 3Blue1Brown: What is a GPT?(YouTube)
  • Jay Alammar: The Illustrated Transformer
  • Karpathy: Let’s Build GPT
  • Stanford CS224N(YouTube 讲座)

扩展与分布式训练

  • Kaplan 等: Scaling Laws
  • Chinchilla 论文(Hoffmann 等)
  • HuggingFace Accelerate

对齐与 PEFT

  • OpenAI: Aligning LMs to Follow Instructions
  • Anthropic: Constitutional AI
  • LoRA: Low-Rank Adaptation
  • QLoRA
  • LightningAI: LoRA from Scratch

推理

  • FlashAttention 论文

终局

如果你真的走完上面的路线、做完项目、冲出 YouTube 教程地狱,你会对 LLM 有极深的理解。你能看穿炒作,一眼识别胡扯,并构建自己的模型和工具。

如果你走完这个计划并真的做出了什么东西,私信我,我想看看。

祝你玩得开心。

原文信息

作者:theahmadosman(@theahmadosman)

原文地址:

文章评论(0

暂无评论,快来抢沙发~