基础原理
从下一 token 预测出发,依次读分词、Transformer、训练与推理,最后看 loss 怎样更新参数。
基础原理
从下一 token 预测出发,依次读分词、Transformer、训练与推理,最后看 loss 怎样更新参数。
- LLM 基础原理从整体任务到 Transformer、训练和推理的总览
- 阅读路线基础原理的外部阅读入口,每节一个主要来源。
- 分词与对话格式从文本和消息结构到 token IDs,再区分 BPE、特殊 token 与解码
- Transformer
- Transformer:从输入到下一 token以 decoder-only 为主,定位 Embedding、Block、LM Head 与训练生成两条路径
- Embedding 与位置信息把 token 索引映射为可训练向量,再区分位置相加与 RoPE
- Attention 与因果遮罩用 QKV、因果遮罩和多头形状解释当前 token 如何读取上下文
- Transformer Block从上下文读取到逐位置加工,解释残差、Norm 和 MLP 的作用
- 训练和推理:同一模型,两种序列组织统一教学例子中的标签错位、训练张量、Prefill、Decode 与 KV 时序
- KV Cache:复用每一层的历史 K/V增量解码为什么只需要处理新 token:KV Cache 的原理、显存代价、Transformers 中的实现,以及围绕它展开的系统优化
- Decoder-only 完整手算:D=2保留可手算的完整 Attention、LM Head 与增量缓存数值例子
- Encoder–Decoder:原论文架构对照保留原论文结构、翻译时的数据流、cross-attention 与三类缓存
- 损失与优化
- 交叉熵:从正确 token 概率到 loss解释 one-hot、softmax 分母、平均 loss 与 logits 梯度 p−q
- 反向传播与参数更新从 loss 的梯度追到共享参数,区分 forward、backward 和 optimizer step