ByteNoteByteNote
LLMs-from-scratch:10.4 万星教学仓库,用 PyTorch 从零手写一个 LLM

字节笔记本

2026年9月9日

LLMs-from-scratch:10.4 万星教学仓库,用 PyTorch 从零手写一个 LLM

API中转
¥120

本文介绍 Sebastian Raschka 的 LLMs-from-scratch(10.4 万 stars)——机器学习圈口碑顶级的"从零造 LLM"教学仓库,同名著作(Manning 出版)的官方代码库。它用一个可以跑通的小 GPT,把大语言模型从注意力机制到指令微调的每一层都掰开写给你看。

项目简介

Sebastian Raschka 是《Machine Learning Q and AI》等畅销书作者、前 Lightning AI 核心成员。这本《Build a Large Language Model (From Scratch)》的思路是:不调 API、不碰现成框架的高层封装,用 PyTorch 从注意力机制开始一步步手写,最终得到一个小而完整、能运行的类 ChatGPT 模型——训练和微调方法与 ChatGPT 背后的大模型同源。

仓库即书的配套代码,10 万+ stars 是技术书籍代码库里的现象级数字。

内容结构

按书的章节组织,每章一个阶段:

  • 文本数据处理与注意力机制(从简化版到多头因果注意力)
  • 手写 GPT 模型骨架、预训练循环、按章加载预训练权重做微调
  • 指令微调(instruction finetuning)与分类微调
  • 配套练习题与解答,Jupyter Notebook 形式可逐段运行

适合谁

  • 想真正理解 LLM 内部机制而不是只会调 API 的工程师
  • 需要系统补齐 Transformer 细节的研究者入门
  • 教学场景:结构清晰的分章代码天然适合做课程素材

快速开始

bash
git clone --depth 1 https://github.com/rasbt/LLMs-from-scratch.git

按章节顺序打开 Notebook 运行即可;书是可选的,代码注释本身就相当完整,但配合书体验最佳。

注意事项

  • 教学导向:模型刻意做小,别拿它对标生产级模型性能
  • 需要 PyTorch 基础;完全零基础建议先过一遍 PyTorch 入门再上手
  • 站内另一篇 MiniMind 讲的是"从零训练 64M 中文小模型"的实战项目,与本仓库的"逐层手写教学"互补不重复

项目链接

分享: