每节一句说明和一个主要阅读入口。链接都是外部资料,需要联网。
- 语言模型全貌:模型读入已有的前缀,预测下一个 token。阅读 The Illustrated GPT-2。
- Tokenization:文本先切成 token,每个 token 再映射成一个整数 ID。阅读 Hugging Face 的 Tokenizers 一节。
- Embeddings:每个 token ID 变成一个向量,位置和上下文信息随后进入这个表示。阅读 3Blue1Brown 的 GPT 图解。
- Attention:每个位置读取前文的信息,同时遮住还没出现的未来。阅读 3Blue1Brown 的 Attention 图解。
- Transformer:把前面的模块连起来,理解整个网络。见下一节。
- 训练与生成:训练时,每个位置的输出与下一个 token 的标签对齐;生成时,选出的新 token 接回输入,继续预测。阅读 Karpathy 从零构建 GPT 视频的配套代码。
Transformer
Section titled “Transformer”- 整体结构:token ID 先变成向量表示,经过多层 Block,最后得到下一个 token 的分数。阅读 The Illustrated GPT-2。
- Attention:Q/K/V 决定每个位置读取哪些前文,因果遮罩挡住未来,多头同时从几个角度读取。阅读 3Blue1Brown 的 Attention 图解。
- Transformer Block:一个 Block 里,Attention、MLP 和残差连接怎样依次串联。阅读 The Illustrated GPT-2。
- 训练与推理:训练时所有位置同时接受监督;推理时一次生成一个 token,再接回输入。阅读 Karpathy 从零构建 GPT 视频的配套代码。