从零开始手搓大模型
不依赖任何高层黑盒库,纯使用 Python 与 PyTorch 从底层字节流和矩阵运算出发,端到端实现 BPE 分词、现代 Transformer 架构、内存映射二进制数据流水线、混合精度预训练引擎、自回归 KV-Cache 推理、SFT 指令微调与 LoRA 适配器,并在消费级显卡上完整闭环。
SEQUENCE
系列学习顺序
12 篇指南
- 01
从零手搓大模型:0.04B (36M) LLM 端到端全栈实战全景
入门 - 02
0.04B 模型规格设计、数学建模与新手认知建立
入门 - 03
从零手写 Byte-Level BPE 分词器:开启通向大语言模型的第一道门
中级 - 04
从零手写现代 Transformer 架构:构建 0.04B 的思考中枢
进阶 - 05
现代 Transformer 架构纯数学推导与第一性原理 (数学附录)
中级 - 06
工业级数据清洗与零拷贝流水线:喂饱 GPU 的二进制管道
中级 - 07
工业级预训练引擎构建与训练优化:单卡驯服 0.04B 模型
中级 - 08
自回归推理与 KV-Cache 显存优化:打造毫秒级打字机
中级 - 09
0.04B 全流程端到端实操贯通:从语料到写诗的闭环演练
中级 - 10
有监督指令微调 (SFT):让无监督基座听懂人话
进阶 - 11
站在巨人的肩膀上:工业级 LoRA 微调与现代大模型双轨实战
进阶 - 12
全流程实战演练与训练总复盘:从预训练收官到 SFT 与 LoRA 落地
中级