跳转到内容

基础原理

从下一 token 预测出发,依次读分词、Transformer、训练与推理,最后看 loss 怎样更新参数。

全部主题

基础原理

从下一 token 预测出发,依次读分词、Transformer、训练与推理,最后看 loss 怎样更新参数。

  1. LLM 基础原理从整体任务到 Transformer、训练和推理的总览
  2. 阅读路线基础原理的外部阅读入口,每节一个主要来源。
  3. 分词与对话格式从文本和消息结构到 token IDs,再区分 BPE、特殊 token 与解码
  4. Transformer
  5. Transformer:从输入到下一 token以 decoder-only 为主,定位 Embedding、Block、LM Head 与训练生成两条路径
  6. Embedding 与位置信息把 token 索引映射为可训练向量,再区分位置相加与 RoPE
  7. Attention 与因果遮罩用 QKV、因果遮罩和多头形状解释当前 token 如何读取上下文
  8. Transformer Block从上下文读取到逐位置加工,解释残差、Norm 和 MLP 的作用
  9. 训练和推理:同一模型,两种序列组织统一教学例子中的标签错位、训练张量、Prefill、Decode 与 KV 时序
  10. KV Cache:复用每一层的历史 K/V增量解码为什么只需要处理新 token:KV Cache 的原理、显存代价、Transformers 中的实现,以及围绕它展开的系统优化
  11. Decoder-only 完整手算:D=2保留可手算的完整 Attention、LM Head 与增量缓存数值例子
  12. Encoder–Decoder:原论文架构对照保留原论文结构、翻译时的数据流、cross-attention 与三类缓存
  13. 损失与优化
  14. 交叉熵:从正确 token 概率到 loss解释 one-hot、softmax 分母、平均 loss 与 logits 梯度 p−q
  15. 反向传播与参数更新从 loss 的梯度追到共享参数,区分 forward、backward 和 optimizer step