# GoClaw LLM 工程手册：课程结课考核

## 形式

- 理论口试：30 分钟，解释公式、形状和边界。
- 实验答辩：展示一个成功实验和一个故意失败实验。
- 综合项目：提交代码、数据说明、评估结果和服务演示。

## 必答题

1. 画出 `[B,T] → [B,T,C] → [B,T,V] → loss`，解释每一维。
2. 用三 token 例子说明 causal mask 如何阻止标签泄漏。
3. 说明 prefill、decode、TTFT、TPOT 的区别。
4. 推导 LoRA 参数量，并解释为什么训练内存不会简单按比例下降。
5. 解释 DPO 的 policy margin、reference margin 和 β。
6. 设计一个不泄漏 test 的 SFT 数据切分。
7. 对 RAG 错误给出至少五类分层诊断。
8. 解释为什么更低 perplexity 不必然代表更好的聊天模型。
9. 设计 KV Cache 前后语义一致性测试。
10. 解释为什么平均延迟下降而 P99 上升可能不是发布改进。

## 实验答辩要求

学生必须现场完成一次：

```text
读取配置 → 运行命令 → 展示原始输出 → 指出一个断言 → 修改一个变量 → 解释变化
```

禁止只打开已经执行好的 Notebook 截图。教师可随机要求学生删除一个关键组件，或者输入一条不在词表/评估集中的样本。

## 综合项目门槛

- 有明确用户、范围和不支持场景。
- 有 prompt 或搜索 baseline。
- 数据来源和许可可追溯。
- train/valid/test 没有 prompt 或文档簇泄漏。
- 至少保存逐样本评估结果。
- RAG 有检索指标和引用支持检查。
- API 有健康检查、错误 schema、超时和权限测试。
- 能展示一次回滚或禁用某组件后的行为。

## 评分

| 项目 | 分值 |
|---|---:|
| 理论正确性与边界 | 20 |
| 实验可复现性 | 20 |
| 数据与评估设计 | 20 |
| 系统工程与安全 | 20 |
| 技术表达与答辩 | 10 |
| 反例和下一步实验 | 10 |

低于 60 分：只能说明完成了跟随式实验。80 分以上：可以独立维护一个小型 LLM 应用。90 分以上：能够针对新问题设计并审查实验，而不仅是复述已有教程。
