字
字节笔记本
2026年9月9日
LLMs-from-scratch:10.4 万星教学仓库,用 PyTorch 从零手写一个 LLM
API中转
¥120
本文介绍 Sebastian Raschka 的 LLMs-from-scratch(10.4 万 stars)——机器学习圈口碑顶级的"从零造 LLM"教学仓库,同名著作(Manning 出版)的官方代码库。它用一个可以跑通的小 GPT,把大语言模型从注意力机制到指令微调的每一层都掰开写给你看。
项目简介
Sebastian Raschka 是《Machine Learning Q and AI》等畅销书作者、前 Lightning AI 核心成员。这本《Build a Large Language Model (From Scratch)》的思路是:不调 API、不碰现成框架的高层封装,用 PyTorch 从注意力机制开始一步步手写,最终得到一个小而完整、能运行的类 ChatGPT 模型——训练和微调方法与 ChatGPT 背后的大模型同源。
仓库即书的配套代码,10 万+ stars 是技术书籍代码库里的现象级数字。
内容结构
按书的章节组织,每章一个阶段:
- 文本数据处理与注意力机制(从简化版到多头因果注意力)
- 手写 GPT 模型骨架、预训练循环、按章加载预训练权重做微调
- 指令微调(instruction finetuning)与分类微调
- 配套练习题与解答,Jupyter Notebook 形式可逐段运行
适合谁
- 想真正理解 LLM 内部机制而不是只会调 API 的工程师
- 需要系统补齐 Transformer 细节的研究者入门
- 教学场景:结构清晰的分章代码天然适合做课程素材
快速开始
bash
git clone --depth 1 https://github.com/rasbt/LLMs-from-scratch.git按章节顺序打开 Notebook 运行即可;书是可选的,代码注释本身就相当完整,但配合书体验最佳。
注意事项
- 教学导向:模型刻意做小,别拿它对标生产级模型性能
- 需要 PyTorch 基础;完全零基础建议先过一遍 PyTorch 入门再上手
- 站内另一篇 MiniMind 讲的是"从零训练 64M 中文小模型"的实战项目,与本仓库的"逐层手写教学"互补不重复
项目链接
- GitHub 仓库:https://github.com/rasbt/LLMs-from-scratch
- 同名书籍:Manning《Build a Large Language Model (From Scratch)》
- 作者主页:https://sebastianraschka.com
分享: