GOCLAWLLM ENGINEERING
GoClaw 首页

19. 公式与概念速查

速查按需查阅
学习目标
  1. 快速恢复公式上下文
  2. 检查符号、形状和单位
  3. 从缩写跳回对应章节
前置知识
  • 已学习相应原理章节

本章产物能在不死记公式的前提下解释每个量的来源和适用条件。

19.1 核心公式

Embedding:
X = Embedding(token_ids)

Scaled Dot-Product Attention:
A = softmax(QK^T / sqrt(d_k) + mask)
Y = AV

Next-token Cross Entropy:
L = -log P(correct_token | history)

Perplexity:
PPL = exp(mean NLL)

LoRA:
W' = W + (alpha/r) BA

KV Cache:
bytes ≈ 2 × L × H_kv × D_head × T × bytes × batch

权重大小:
bytes ≈ parameter_count × bits / 8

有效 Batch:
micro_batch × grad_accum × data_parallel_world_size

粗略训练计算:
FLOPs ≈ 6 × parameter_count × training_tokens

19.2 缩写表

缩写含义
CLMCausal Language Modeling
MLMMasked Language Modeling
SFTSupervised Fine-Tuning
CPTContinued Pretraining
PEFTParameter-Efficient Fine-Tuning
LoRALow-Rank Adaptation
QLoRAQuantized LoRA
RLHFReinforcement Learning from Human Feedback
DPODirect Preference Optimization
MHA/MQA/GQAMulti/Multi-Query/Grouped-Query Attention
KV CacheKey-Value Cache
TTFTTime To First Token
TPOTTime Per Output Token
RAGRetrieval-Augmented Generation
DDPDistributed Data Parallel
FSDPFully Sharded Data Parallel
TP/PPTensor/Pipeline Parallel
MoEMixture of Experts

19.3 符号、形状和单位

符号含义常见单位或形状
Bbatch size请求/序列数
Tsequence lengthtoken
Vvocabulary sizetoken 类别数
Cd_modelhidden widthfeature
HQuery Head 数head
H_kvKey/Value Head 数head
D_head单头维度通常 C/H
LTransformer 层数layer
P参数量parameter
N训练 token 数token
TTFT首 token 延迟ms 或 s/request
TPOT后续 token 平均时间ms/token
Throughput系统处理能力token/s 或 request/s

公式必须带单位检查。例如 KV Cache 公式中的最后一个 bytes 是每元素字节数;乘完后才得到字节。若把 FP16 的 2 bytes 忘掉,容量会差一倍;若把 Query Head 数误当 KV Head 数,GQA 模型估算也会错。

19.4 三个速算例题

LoRA 参数。 一个 4096 × 4096 线性层,rank 8:

完整矩阵 = 4096 × 4096 = 16,777,216 参数
LoRA     = 8 × (4096 + 4096) = 65,536 参数
比例     ≈ 0.39%

这只计算该层 Adapter,不代表整模型训练内存下降到 0.39%;前向仍需基座权重和激活。

权重容量。 8B 参数模型的理想权重下界:

FP16: 8e9 × 2 bytes  ≈ 16 GB(十进制)
4-bit: 8e9 × 0.5 byte ≈ 4 GB(十进制)

实际文件和运行内存还包含量化 scale、元数据、对齐、KV Cache 和工作区。

有效 batch。 micro-batch 2、梯度累积 8、数据并行 4:

effective batch = 2 × 8 × 4 = 64 sequences/update

若各序列有效 token 数不同,按“序列”相同不代表每次更新的有效 token 数相同;packing 和 padding 会影响实际训练量。

速查页验收:看到一个公式时,能指出它是精确定义、近似估算还是特定实现,并能说出至少两个被省略的成本或假设。


本章依据

原理性结论以原始论文、官方文档或公开教材为依据。论文中的实验结果只适用于其声明的模型、数据、硬件和评估设置。

  1. 注意力与 Transformer 核心公式。

  2. 论文LoRA

    低秩适配公式。

  3. 偏好优化目标。

  4. KV Cache 形状和更新规则。