19. 公式与概念速查
学习目标
- 快速恢复公式上下文
- 检查符号、形状和单位
- 从缩写跳回对应章节
前置知识
- 已学习相应原理章节
本章产物能在不死记公式的前提下解释每个量的来源和适用条件。
19.1 核心公式
Embedding:
X = Embedding(token_ids)
Scaled Dot-Product Attention:
A = softmax(QK^T / sqrt(d_k) + mask)
Y = AV
Next-token Cross Entropy:
L = -log P(correct_token | history)
Perplexity:
PPL = exp(mean NLL)
LoRA:
W' = W + (alpha/r) BA
KV Cache:
bytes ≈ 2 × L × H_kv × D_head × T × bytes × batch
权重大小:
bytes ≈ parameter_count × bits / 8
有效 Batch:
micro_batch × grad_accum × data_parallel_world_size
粗略训练计算:
FLOPs ≈ 6 × parameter_count × training_tokens19.2 缩写表
| 缩写 | 含义 |
|---|---|
| CLM | Causal Language Modeling |
| MLM | Masked Language Modeling |
| SFT | Supervised Fine-Tuning |
| CPT | Continued Pretraining |
| PEFT | Parameter-Efficient Fine-Tuning |
| LoRA | Low-Rank Adaptation |
| QLoRA | Quantized LoRA |
| RLHF | Reinforcement Learning from Human Feedback |
| DPO | Direct Preference Optimization |
| MHA/MQA/GQA | Multi/Multi-Query/Grouped-Query Attention |
| KV Cache | Key-Value Cache |
| TTFT | Time To First Token |
| TPOT | Time Per Output Token |
| RAG | Retrieval-Augmented Generation |
| DDP | Distributed Data Parallel |
| FSDP | Fully Sharded Data Parallel |
| TP/PP | Tensor/Pipeline Parallel |
| MoE | Mixture of Experts |
19.3 符号、形状和单位
| 符号 | 含义 | 常见单位或形状 |
|---|---|---|
B | batch size | 请求/序列数 |
T | sequence length | token |
V | vocabulary size | token 类别数 |
C 或 d_model | hidden width | feature |
H | Query Head 数 | head |
H_kv | Key/Value Head 数 | head |
D_head | 单头维度 | 通常 C/H |
L | Transformer 层数 | layer |
P | 参数量 | parameter |
N | 训练 token 数 | token |
| TTFT | 首 token 延迟 | ms 或 s/request |
| TPOT | 后续 token 平均时间 | ms/token |
| Throughput | 系统处理能力 | token/s 或 request/s |
公式必须带单位检查。例如 KV Cache 公式中的最后一个 bytes 是每元素字节数;乘完后才得到字节。若把 FP16 的 2 bytes 忘掉,容量会差一倍;若把 Query Head 数误当 KV Head 数,GQA 模型估算也会错。
19.4 三个速算例题
LoRA 参数。 一个 4096 × 4096 线性层,rank 8:
完整矩阵 = 4096 × 4096 = 16,777,216 参数
LoRA = 8 × (4096 + 4096) = 65,536 参数
比例 ≈ 0.39%这只计算该层 Adapter,不代表整模型训练内存下降到 0.39%;前向仍需基座权重和激活。
权重容量。 8B 参数模型的理想权重下界:
FP16: 8e9 × 2 bytes ≈ 16 GB(十进制)
4-bit: 8e9 × 0.5 byte ≈ 4 GB(十进制)实际文件和运行内存还包含量化 scale、元数据、对齐、KV Cache 和工作区。
有效 batch。 micro-batch 2、梯度累积 8、数据并行 4:
effective batch = 2 × 8 × 4 = 64 sequences/update若各序列有效 token 数不同,按“序列”相同不代表每次更新的有效 token 数相同;packing 和 padding 会影响实际训练量。
速查页验收:看到一个公式时,能指出它是精确定义、近似估算还是特定实现,并能说出至少两个被省略的成本或假设。
本章依据
原理性结论以原始论文、官方文档或公开教材为依据。论文中的实验结果只适用于其声明的模型、数据、硬件和评估设置。
注意力与 Transformer 核心公式。
- 论文LoRA
低秩适配公式。
偏好优化目标。
KV Cache 形状和更新规则。