GOCLAWLLM ENGINEERING
GoClaw 首页

15. 现代架构与高级主题

高级主题3~4 小时
学习目标
  1. 比较 MoE、长上下文、蒸馏和多模态的代价
  2. 区分架构机制与营销标签
  3. 为高级方案设计可证伪的评估
前置知识
  • Transformer、训练与推理章节

本章产物一个高级方案的架构决策记录,包含收益、约束、验证与退出条件。

15.1 Mixture-of-Experts(MoE)

Dense 模型每个 token 经过全部 MLP 参数。MoE 层包含多个专家和一个 router:

token hidden state
  → router 计算专家分数
  → 选择 top-k 专家
  → 专家分别计算
  → 加权合并

MoE 可以让总参数量很大,而单 token 只激活少数专家。但它带来:

所以“总参数 100B、激活 10B”不等于在所有方面都和 dense 10B 一样便宜。

15.2 长上下文

把 context window 从 8K 扩到 128K,至少涉及:

“能接收 128K”不等于“能可靠使用每个位置”。评估要包含不同位置的 needle、跨段综合、多跳证据和干扰文档。

15.3 知识蒸馏

Teacher 给 Student 提供:

Student 学习 teacher 分布,目标可能结合真实标签和蒸馏 loss。风险是 teacher 的错误与偏见被复制;合成数据过多还可能降低多样性。

15.4 多模态模型

常见做法:

图像/音频 encoder
  → 产生连续特征
  → projector 映射到 LLM hidden space
  → 与文本 token 一起进入语言模型

或把图像离散化为视觉 token。学习多模态时,需要额外掌握:

先完成文本 LLM 主线,再扩展多模态,避免同时引入过多变量。

15.5 Retrieval、Memory 与参数知识

三种“记住”:

设计系统时,最新事实、用户私有状态和精确记录通常更适合外部记忆,而不是反复微调进参数。

15.6 Interpretability

常见层次:

注意力权重不自动等于因果解释。模型“关注”某位置不证明该位置决定最终输出;需要干预、消融和对照实验。

15.7 高级架构不是功能清单

评估高级方案时,先把“机制—收益—代价—证据”写成一行:

方案机制预期收益新增代价最小验证
MoE每个 token 路由到少数专家增大总容量而控制激活计算路由、通信、负载均衡专家利用率、质量、吞吐
长上下文扩大可处理序列并适配位置单请求读取更多证据Attention、KV、训练长度分布不同位置与干扰强度评估
蒸馏Student 拟合 Teacher 信号更小模型接近部分能力Teacher 成本与错误继承同题集质量—延迟前沿
多模态Encoder/Projector 接入非文本特征处理图像、音频或视频对齐数据与模态特有评估单模态、跨模态、缺失模态对照
外部记忆检索或状态存储可更新、可审计的知识索引、权限、一致性检索与端到端分层评估
可解释性探针、干预和特征分析形成内部机制假设工具误差和因果外推风险干预能否预测行为变化

任何架构选择都必须回答:当前 baseline 的哪项指标不够?新机制如何针对该瓶颈?如果结果没有改善,如何退出而不让系统永久背负复杂度?

15.8 三个容量推演

MoE 激活量。 假设共有 64 个专家,每个 token 选择 top-2。不能因此说“只需要存 2 个专家”;单机或集群仍需让全部专家权重可访问。需要分别估算总权重存储、单 token 激活计算和 all-to-all 通信。

长上下文 KV。 若序列从 8K 扩到 32K,在层数、KV Head、Head Dimension、dtype 和 batch 不变时,KV Cache 约扩大 4 倍;标准 Attention 分数元素约扩大 16 倍。两者增长率不同,不能用一个“上下文成本”数字代替。

蒸馏前沿。 比较 Teacher 与 Student 时不要只看准确率。至少绘制:任务得分—P95 延迟、任务得分—内存、任务得分—每千 token 成本。若 Student 只便宜 5% 却明显退化,蒸馏未必值得维护。

15.9 设计实验:提交一份架构决策记录

从 MoE、长上下文、蒸馏、多模态、外部记忆或可解释性中选一个,填写:

问题:现有 baseline 的具体失败是什么?
证据:哪些逐样本结果或性能指标证明存在瓶颈?
候选:至少两个方案,包括“不改变架构”。
机制:候选方案为什么可能解决问题?
代价:数据、训练、推理、服务和运维新增什么?
实验:唯一改变的变量、样本、指标和硬件是什么?
通过条件:达到什么结果才采纳?
退出条件:失败时删除哪些组件、保留哪些产物?

章节验收:能对一个流行架构提出可证伪的实验,而不是复述“更快、更长、更智能”;能把论文实验设置与自己的硬件、数据和业务边界分开。


本章依据

原理性结论以原始论文、官方文档或公开教材为依据。论文中的实验结果只适用于其声明的模型、数据、硬件和评估设置。

  1. 稀疏 MoE 路由、容量和训练稳定性。

  2. 论文RoFormer

    旋转位置编码和长序列位置表示。

  3. 教师—学生知识蒸馏。

  4. 文本—图像对比学习的代表性多模态方法。