20. 官方文档与经典论文
学习目标
- 区分论文主张、实验设置与工程外推
- 高效阅读原始论文和官方文档
- 形成可追溯的阅读笔记
前置知识
- 对应主题的基础章节
本章产物至少三篇论文的结构化阅读卡和一个复现实验提案。
基础与 Transformer
- PyTorch 基础教程
- PyTorch scaled_dot_product_attention
- PyTorch Transformer Building Blocks
- Attention Is All You Need
- The Annotated Transformer
Tokenizer、数据与训练
- Hugging Face Tokenizers
- Tokenizers API
- Hugging Face Datasets
- Transformers:Causal Language Modeling
- Transformers 文档
微调与对齐
Apple Silicon 推理与微调
评估、服务和分布式
建议论文阅读顺序
1. Attention Is All You Need
2. GPT 系列的语言模型与 in-context learning 论文
3. RoPE / RMSNorm / SwiGLU / GQA
4. LoRA
5. QLoRA
6. InstructGPT
7. DPO
8. FlashAttention
9. vLLM / PagedAttention
10. 你所在领域的数据与评估论文阅读论文时不要追求一次读懂全部证明。第一遍回答“问题是什么、方法结构是什么、比较了什么”;第二遍再追公式与实验细节;第三遍尝试实现或复现实验。
一篇论文的三遍阅读法
第一遍:定位主张,约 15~30 分钟。 阅读摘要、引言、方法总图、结论和局限。写下论文要解决的问题、相对 baseline 的新增机制、主要实验以及作者明确没有证明的内容。
第二遍:追踪证据。 阅读方法、数据、训练设置、评价指标和消融。对每个重要结论标注它来自公式推导、实验观察还是作者解释。记录模型、数据、硬件、seed、比较预算和统计不确定性。
第三遍:准备复现。 只选择一个最小主张,写出输入、输出、依赖、伪代码、预期图表和失败条件。完整复现论文通常超出个人资源;复现一个机制的正确性或趋势仍然有价值,但必须说明缩小了哪些条件。
论文阅读卡模板
引用:标题、作者、年份、版本和永久链接
问题:原有方法的具体限制是什么?
主张:作者声称改进了什么?
机制:新增了哪些结构、目标或系统策略?
证据:数据、baseline、指标、硬件和统计方法是什么?
消融:哪项实验把关键变量隔离出来?
边界:作者写了哪些限制?还有哪些未讨论?
复现:个人设备能验证哪个最小结论?
迁移:你的场景与论文设置哪里相同、哪里不同?示例:不要把论文结果直接写成产品结论
假设论文在特定 GPU、序列长度和 batch 下报告吞吐提升。正确转述方式是:“论文在其声明设置下观察到提升,机制是减少某类内存访问;我们需要在目标硬件和请求分布上重新测量。”错误转述是:“该方法能让所有模型推理更快。”
同理,某个 benchmark 的平均分提高,不代表你的中文业务、长尾输入、安全集或延迟也提高。论文是实验设计和证据来源,不是免验证的配置清单。
阅读练习与验收
从 Transformer、LoRA 和 PagedAttention 各选一篇原始论文:
- 每篇完成一张阅读卡。
- 找出一个公式、一个关键实验和一个局限。
- 用不超过 200 字准确转述主张,不使用“全面领先”“显著更强”等无设置描述。
- 为其中一篇设计个人设备可完成的最小复现实验。
- 列出复现失败时仍然有价值的中间产物,例如形状断言、容量模型或 baseline。
验收标准:能够明确区分“论文证明/定义”“论文在特定设置下观察”“基于论文做出的工程推断”三种句子。