Transformer 系统学习路径:第2章 · 进阶
分类:
machine-learning/transformer· 风格:专业 + 科普 · 少公式 · 重直觉
风格:专业 + 科普 · 少公式 · 重直觉(为什么 / 怎么调 / 效果是什么)
前置:总览 · 第1章 · 基础知识
本章目标:能读懂现代 LLM / 生物 FM 的方法部分;知道调什么旋钮、踩什么坑
与第1章关系:第1章 = 单塔长什么样;第2章 = 怎么训、怎么扩、怎么快、怎么接任务
0. 第2章 地图(先看全貌)
Section titled “0. 第2章 地图(先看全貌)”flowchart TB subgraph 目标层 PT["预训练目标<br/>学什么分布"] end subgraph 能力层 PE["位置编码进阶<br/>RoPE / ALiBi"] LONG["长上下文<br/>外推与稀疏"] EFF["效率<br/>FlashAttn / KV Cache"] end subgraph 落地层 FT["全参微调 vs PEFT<br/>LoRA 等"] STAB["稳训练旋钮"] ALIGN["对齐接口<br/>SFT → DPO/GRPO"] end subgraph 边界层 FAIL["失败模式<br/>过拟合 / 遗忘 / 上下文浪费"] CPT["与 CPT 的接口<br/>CPT ≠ RL"] end PT --> PE --> LONG --> EFF EFF --> FT --> STAB --> ALIGN ALIGN --> FAIL --> CPT
读法建议: 不必一次啃完。先 1→2→6→7(目标、位置、微调、稳训练),再回头补效率与对齐。
1. 预训练目标:模型到底在「学什么」?
Section titled “1. 预训练目标:模型到底在「学什么」?”预训练 = 用海量无标签(或弱标签)序列,逼模型学会「这种语言/分子的语法与统计」。
| 范式 | 人话 | 掩码/可见性 | 经典用途 |
|---|---|---|---|
| CLM 因果语言建模 | 猜下一个 token | 只能看过去 | GPT 系、多数生成式基因组 LM |
| MLM 掩码语言建模 | 挖空再填 | 双向可见 | BERT 系、部分蛋白 LM |
| Prefix / 前缀 LM | 前半双向、后半因果 | 混合 | 部分统一架构 |
| 去噪 Denoising | 打乱/删改后还原 | 看损坏版 | T5 系 seq2seq |
| 对比学习 | 正样本靠近、负样本推远 | 通常双塔/同塔增强 | 检索、部分表示学习 |
1.1 选型直觉(非图像序列)
Section titled “1.1 选型直觉(非图像序列)”要「续写 / 自由生成」? → 偏 CLM(Decoder)要「整段理解 / 分类 / embedding」? → 偏 MLM 或 CLM 取表征输入 A 输出 B(翻译、设计)? → 偏去噪 Enc-Dec 或 Decoder+提示要「找相似序列」? → 对比学习很香1.2 效果与坑
Section titled “1.2 效果与坑”| 现象 | 可能原因 | 调什么 |
|---|---|---|
| 生成很顺但分类一般 | CLM 偏下一 token,表征未必对齐任务 | 加小监督头、对比损失、或换 MLM 式预训练 |
| 填空很强但不会写长文 | MLM 没练「从左到右写」 | 加生成阶段或换 CLM |
| 训练集 loss 很低、下游崩 | 背了数据分布,任务分布不同 | 数据配比、领域 CPT、评估要独立 hold-out |
生物向预告(第3章):基因组常 CLM;蛋白既有 MLM(ESM 思路)也有生成式;任务标签稀缺时预训练质量几乎决定上限。
2. 缩放直觉:数据 · 参数 · 算力
Section titled “2. 缩放直觉:数据 · 参数 · 算力”不必背公式,记住三件「一起涨才划算」的事:
| 杠杆 | 变大时通常… | 单独猛拉时常见副作用 |
|---|---|---|
| 数据 | 泛化变好、分布更全 | 脏数据/重复会锁死偏见 |
| 参数 | 容量↑,能装更复杂模式 | 数据不够就过拟合或「背答案」 |
| 算力/步数 | 训得更充分 | 无脑加步数可能过拟合或浪费 |
手感法则:
- 小模型 + 干净领域数据 常常打过「大模型乱吃无关语料」——尤其组学领域。
- 算力预算固定时:先保证有效 token 数和数据质量,再纠结层数。
- 评估要跟业务走:交叉熵降了 ≠ 剪接预测准了。
flowchart LR D["数据质量与覆盖"] --> C["有效算力"] P["参数量"] --> C C --> U["下游可用能力"] T["任务对齐的评估"] --> U
3. 位置编码进阶:RoPE / ALiBi(第1章 的升级)
Section titled “3. 位置编码进阶:RoPE / ALiBi(第1章 的升级)”第1章:位置 = 「座位号名片」。
第2章:现代大模型几乎不用「简单绝对位置表」一条路走到黑。
| 方案 | 直觉 | 优点 | 注意 |
|---|---|---|---|
| 绝对可学习位置 | 每个位置一个向量 | 简单 | 超长难外推,常卡死 max length |
| 正弦绝对位置 | 用波标记位置 | 不占参数 | 外推仍一般 |
| RoPE 旋转位置 | 用旋转把「相对距离」编进 Q·K | 相对位置友好,主流 | 极长外推要额外技巧 |
| ALiBi | 对注意力分数加「距离惩罚」 | 外推有时很香、实现直接 | 与某些结构搭配要试 |
为什么在乎相对位置?
句子里「A 在 B 左边 3 个」往往比「A 在绝对第 107 位」更有意义——基因组 motif、依赖距离同理。
调参/选型手感:
- 读论文看到 RoPE → 默认「相对位置 + 可尝试长度外推」
- 上下文要从 4k 拉到 32k/100k → 不只换 PE,还要看数据里有没有长序列、注意力是否改稀疏
4. 注意力效率:平方复杂度从哪来、怎么扛
Section titled “4. 注意力效率:平方复杂度从哪来、怎么扛”4.1 瓶颈要点
Section titled “4.1 瓶颈要点”Self-Attention 有一张 [L, L] 的「全员对全员」关系表:
长度 ×2 → 这块的算力/显存往往 ×4 量级(再乘 batch、头数等)。
所以:L 是第一公民。Tokenization 切太碎、上下文乱拼很长,账单先爆炸。
4.2 常见出路(只需直觉)
Section titled “4.2 常见出路(只需直觉)”| 路线 | 人话 | 效果感 |
|---|---|---|
| FlashAttention 等 | 同一套数学,算得更省显存、更快 | 「同样全注意力,工程上扛更长」 |
| 稀疏注意力 | 不看所有人,只看窗口/块/远程跳点 | 丢一点全局,换长度 |
| 线性/核近似 | 换一种近似注意力 | 理论香,任务上要实证 |
| 分层 / 检索增强 | 先粗筛再精看 | 超长文档、超长基因组常用思路 |
| SSM / Hyena 等混合 | 不全靠 softmax 注意力 | 长 DNA 论文里常见对照(第3章) |
实践优先级(多数人):
先 合理 L + 好的 truncation/packing → 再 FlashAttention 级实现 → 再考虑改结构。
5. 推理工程:KV Cache、采样、批处理
Section titled “5. 推理工程:KV Cache、采样、批处理”5.1 KV Cache(生成必懂)
Section titled “5.1 KV Cache(生成必懂)”自回归时,每步只多一个新 token,但注意力还要看过去所有位置。
KV Cache = 把已经算过的 K、V 存起来,下一步只算新 token 的 Q/K/V,再和缓存拼。
| 没有 Cache | 有 Cache |
|---|---|
| 每步重复算历史 | 历史复用 |
| 越生成越慢得离谱 | 接近「每步固定增量」 |
代价: 显存里要挂着「层数 × 头 × 已生成长度」的缓存——长对话/长基因组续写时,显存往往死在 Cache 而不是权重。
5.2 采样旋钮(生成多样性)
Section titled “5.2 采样旋钮(生成多样性)”| 旋钮 | 调高时 | 调低时 |
|---|---|---|
| Temperature 温度 | 更随机、更有创意、更易胡言 | 更贪心、更稳、更死板 |
| Top-k | 只从概率最高的 k 个里抽 | k=1 近似贪心 |
| Top-p (nucleus) | 从「累计概率达 p」的小集合里抽 | p 小 → 更保守 |
任务手感:
- 注释/抽取/要可复现 → 温度低、甚至贪心
- 设计/头脑风暴式生成 → 适度升温 + top-p
- 生物序列生成要额外用生物学过滤器(开放阅读框、重复、GC…)——第3章展开
5.3 Batching
Section titled “5.3 Batching”推理时把多条请求拼 batch 可提吞吐,但长度不齐要 pad,KV Cache 管理变复杂。产品系统才深挖;科研脚本先保证单条正确。
6. 参数高效微调 PEFT:何时全参、何时 LoRA
Section titled “6. 参数高效微调 PEFT:何时全参、何时 LoRA”预训练好了,接到你的任务,通常有三条路:
flowchart TB BASE["预训练底座"] --> A["全参数微调"] BASE --> B["PEFT:LoRA / Adapter / Prefix…"] BASE --> C["只训任务头 / 线性探测"] A --> HA["效果上限高 · 贵 · 易忘旧能力"] B --> HB["性价比高 · 多任务可插拔"] C --> HC["最快最稳基线 · 上限看表征"]
6.1 LoRA 直觉(最常用)
Section titled “6.1 LoRA 直觉(最常用)”全量微调 = 改整张大权重矩阵。
LoRA = 冻住原矩阵,旁边加一对很小的可训练低秩矩阵,用「低维修正」逼近需要的更新。
| 优点 | 代价/注意 |
|---|---|
| 可训练参数少几个数量级 | rank 太小可能欠拟合 |
| 多任务可存多套小插件 | 推理要合并或带插件 |
| 常减轻灾难性遗忘 | 不是万能;数据烂一样挂 |
旋钮手感:
rank:容量;从较小试起(如 8/16),不够再加alpha/ 学习率:和 rank 耦合,要一起扫- 插在哪些层:常注意力的 Q/V,也可 MLP;领域差得远时多插一点
6.2 什么时候值得全参微调?
Section titled “6.2 什么时候值得全参微调?”- 领域与底座差很远,且你有足够高质量数据 + 算力
- 要改的是「底层表征」而不只是表层格式
- 可以接受维护完整新权重、并处理遗忘
否则:线性探测 → LoRA → 全参 由便宜到贵做消融,最省时间。
7. 稳定训练:真正天天调的旋钮
Section titled “7. 稳定训练:真正天天调的旋钮”| 旋钮 | 为什么存在 | 手感 |
|---|---|---|
| 学习率 LR | 步子太大震荡,太小爬不动 | 预训练小、微调往往更小;扫数量级 |
| Warmup | 初期梯度乱,先热身再全速 | 有助于大 batch / 大模型开训 |
| 梯度裁剪 | 防止偶发爆炸一步毁模型 | 出现 loss spike 时先查这个和数据 |
| Weight decay | 限制权重无界变大 | 轻度正则,不是主药 |
| Dropout | 减轻过拟合 | 现代大 LM 预训练有时很小;小数据微调可加 |
| 混合精度 | 更快更省显存 | 注意溢出;重要部分可保留高精度 |
| Batch / 梯度累积 | 等效大 batch | 显存不够就累积;过大 batch 要配 LR |
| 序列 packing | 减少 pad 浪费 | 提高有效 token 利用率 |
7.1 Loss 曲线读法(科研够用)
Section titled “7.1 Loss 曲线读法(科研够用)”| 现象 | 优先怀疑 |
|---|---|
| 一步飙到 NaN | LR 过大、坏样本、溢出、没裁剪 |
| 训练降、验证升 | 过拟合;减步数/加正则/加数据/早停 |
| 两边都不降 | LR 过小、数据 bug、标签错、模型太小或目标不对 |
| 训练很漂亮、一上真实分布就崩 | 分布偏移;要领域数据或 CPT |
7.2 数据侧往往比模型侧更致命
Section titled “7.2 数据侧往往比模型侧更致命”- 重复序列、泄漏的验证集、错误标签
- 长度截断切掉了关键 motif
- 正负样本比例极端
先做 100 条人工抽查,再开大规模训练——组学项目尤其如此。
8. 对齐与偏好:SFT → DPO/GRPO 落在 Transformer 上哪里?
Section titled “8. 对齐与偏好:SFT → DPO/GRPO 落在 Transformer 上哪里?”你已在 RL 系列学过对齐。这里只钉与 Transformer 的接口:
| 阶段 | 在 Transformer 上干什么 | 数据长什么样 |
|---|---|---|
| SFT | 用「标准输入→标准输出」做监督,更新(全参或 LoRA) | 指令-回答对 |
| 奖励模型 RM | 另训一个给回复打分的头/模型 | 排序/偏好对 |
| RLHF (PPO 等) | 策略=带 KL 约束的 Transformer 生成策略 | 在线采样 + RM |
| DPO / GRPO 等 | 常常不显式 RM,直接用偏好对改策略 | 选定/拒绝回复对 |
flowchart LR PT["预训练 CLM/MLM"] --> SFT["SFT 格式对齐"] SFT --> PREF["偏好优化 DPO/GRPO/…"] SFT --> RL["RLHF 可选"] PREF --> USE["下游使用"] RL --> USE
关键划界(再强调):
- CPT / 继续预训练:还在学「序列怎么继续/填空」——分布学习
- SFT:学「在这种提示下输出该长什么样」——任务格式
- DPO/RL:按人类或规则偏好改「更常说什么」——行为偏好
- 三者都常是同一套 Transformer 权重上的不同目标,不是三种骨架
生物场景里:更多是 CPT + 小 SFT;真正 RLHF 少见,但「偏好/排序数据」(哪条 sgRNA 更好、哪段注释更可信)可以借鉴 DPO 思路——展开在第3章。
9. 常见失败模式与 CPT 接口
Section titled “9. 常见失败模式与 CPT 接口”9.1 失败模式速查
Section titled “9.1 失败模式速查”| 模式 | 症状 | 优先动作 |
|---|---|---|
| 过拟合 | 训练好、验证差 | 早停、更多数据、LoRA 降容、正则 |
| 上下文浪费 | 窗口很长但有效信号短 | 重做截断/检索/packing |
| 捷径学习 | 指标高但不靠生物学特征 | 打乱对照、硬负样本、外部验证 |
| 灾难性遗忘 | 领域 CPT/微调后旧能力崩 | 回放混合、LoRA 插件化、小 LR、评估旧任务 |
| 评估泄漏 | 虚高 | 严格按序列/物种/家族划分 hold-out |
9.2 与生物 CPT、λ_mix 的接口
Section titled “9.2 与生物 CPT、λ_mix 的接口”延续你 RL / CPT 线的结论:
| CPT | 偏好/RL 对齐 | |
|---|---|---|
| 目标 | 下一 token / 填空等 | 按反馈改策略 |
| 常见正则 | 数据混合 λ_mix、回放 | KL 对参考策略 |
| 风险 | 忘通用/忘旧域 | 奖黑客、多样性崩 |
λ_mix ≠ KL:一个管「旧数据还吃多少」,一个管「别离旧策略太远」。都是抗崩,但不是同一个旋钮。
10. 读论文 Checklist(第2章 交付技能)
Section titled “10. 读论文 Checklist(第2章 交付技能)”拿到一篇 LLM / 生物 FM 论文,按序勾:
- 架构:Enc / Dec / Enc-Dec?层数、d_model、头数?
- Tokenization:粒度、词表、特殊 token、最大长?
- 位置编码:绝对 / RoPE / ALiBi / 其他?
- 预训练目标:MLM / CLM / 去噪 / 混合?数据从哪来、多大规模?
- 长序列:截断、稀疏、SSM 混合、两阶段?
- 微调:全参还是 LoRA?任务头怎么接?
- 训练:LR、warmup、batch、步数、硬件?
- 评估:ML 指标 + 是否有生物学验证?划分是否泄漏?
- 失败与消融:去掉位置/换目标/缩数据会怎样?
- 与你任务的差距:物种、长度、标签定义是否同分布?
11. 第2章 自检清单
Section titled “11. 第2章 自检清单”- 能说明 CLM 与 MLM 各擅长什么、掩码有何不同
- 知道为何
[L,L]使长序列变贵,并说出 2 种缓解思路 - 能解释 KV Cache 省的是什么、费的是什么
- 温度 / top-p 调高调低的效果
- LoRA 相对全参微调的取舍
- 能根据 loss 曲线提出 2 个优先排查项
- 能划分 CPT、SFT、DPO/RL 在 Transformer 上的不同问题定义
- 能用第 10 节 checklist 扫完一篇方法部分
| 术语 | 要点 |
|---|---|
| CLM | 猜下一个,适合生成 |
| MLM | 填空,适合双向理解 |
| RoPE | 旋转注入相对位置 |
| FlashAttention | 同算法更省更快 |
| KV Cache | 生成时复用历史 K/V |
| LoRA | 低秩小插件改大模型 |
| Warmup | 学习率先爬坡 |
| λ_mix | CPT 时旧数据混合比例 |
| KL 约束 | 对齐时别离参考策略太远 |
12. 可选练习(进阶肌肉记忆)
Section titled “12. 可选练习(进阶肌肉记忆)”| 练习 | 做法 | 收获 |
|---|---|---|
| A 目标对照 | 同一小语料分别假想 MLM vs CLM 能解什么下游 | 选型语感 |
| B 长度账单 | 固定显存,估算 L 翻倍对注意力的压力 | 敬畏 L |
| C LoRA 消融 | 只训头 vs LoRA vs 全参(小模型) | 性价比曲线 |
| D 论文精读 | 用第 10 节 checklist 精读 1 篇 ESM 或基因组 FM | 迁移到第3章 |
13. 第2章 参数速查表(在第1章「起手式」之上加的旋钮)
Section titled “13. 第2章 参数速查表(在第1章「起手式」之上加的旋钮)”第1章 已经给了结构/训练/生成参数的完整表。这里只列第2章 特有或要重新校准的旋钮,避免重复。
13.1 长上下文相关
Section titled “13.1 长上下文相关”| 参数 | 含义 | 常见值 | 手感 | 关键公式/关系 |
|---|---|---|---|---|
max_seq_len | 上下文窗口 | 2k / 8k / 32k / 128k+ | 数据里没长序列,拉长白搭 | 显存 ∝ L² |
rope_theta | RoPE 基频 | 10000(默认)/ 1M+(长上下文) | 拉长上下文常同步调大 | 频率越低越能编码远距离 |
attention_window | 局部窗口大小 | 128 / 512 / 4096 | Longformer 类稀疏必配 | 用小窗换长 L |
13.2 效率相关
Section titled “13.2 效率相关”| 参数 | 含义 | 常见值 | 手感 |
|---|---|---|---|
flash_attention | 是否用 FlashAttention | on/off | 现代训练默认开 |
gradient_checkpointing | 中间激活重算 | on/off | 显存换算力(约 1.3~2× 慢) |
kv_cache_dtype | KV Cache 精度 | fp16 / int8 / int4 | 长对话省显存关键 |
13.3 LoRA / PEFT 相关
Section titled “13.3 LoRA / PEFT 相关”| 参数 | 含义 | 常见值 | 手感 | 公式 |
|---|---|---|---|---|
lora_rank r | 低秩维度 | 4 / 8 / 16 / 32 / 64 | 起 8~16,不够加 | ΔW = B · A,B∈ℝ^(d×r), A∈ℝ^(r×d) |
lora_alpha α | 缩放系数 | 通常 = r 或 2r | 有效放缩为 α/r | 更新 = (α/r) · B · A · x |
lora_dropout | LoRA 层的 dropout | 0.0 ~ 0.1 | 小数据可加 | — |
target_modules | 插入哪些层 | Q,V / Q,K,V,O / +MLP | 领域差远就多插 | — |
13.4 对齐相关
Section titled “13.4 对齐相关”| 参数 | 含义 | 常见值 | 手感 |
|---|---|---|---|
kl_coef β | KL 约束强度 | 0.01 ~ 0.5 | 太大不学、太小跑偏(奖黑客) |
dpo_beta | DPO 的偏好锐度 | 0.1 ~ 0.5 | 越大越信偏好、越易过拟合 |
sft_epochs | SFT 轮数 | 1 ~ 3 | 多了灾难性遗忘 |
13.5 CPT / 抗遗忘相关
Section titled “13.5 CPT / 抗遗忘相关”| 参数 | 含义 | 常见值 | 手感 |
|---|---|---|---|
λ_mix | 旧数据混合比例 | 0.1 ~ 0.5 | 领域越窄需回放越多 |
replay_buffer | 通用回放池占比 | 5% ~ 30% | 与 λ_mix 相关 |
cpt_lr | CPT 学习率 | 通常 ≤ 预训练 LR 的 1/5 ~ 1/10 | 小步慢走护住旧能力 |
14. 各组件「变体图谱 + 文献链接」
Section titled “14. 各组件「变体图谱 + 文献链接」”核心问题:Transformer 的每个「零件」是否允许换?换成什么?为什么?效果如何? 下面按组件列出。
凡例: ✅ = 主流已成熟;🧪 = 有前景但需权衡;⚠️ = 有效但要小心搭配
14.1 位置编码(Position Encoding)· 允许变体 ✅
Section titled “14.1 位置编码(Position Encoding)· 允许变体 ✅”| 变体 | 为什么用 | 效果 | 代表文献 |
|---|---|---|---|
| 绝对正弦 Sinusoidal | 原论文默认、不占参数 | 训练长度内可用,外推差 | Vaswani et al. 2017 · Attention Is All You Need |
| 可学习绝对 | 简单,让模型自己学 | 卡死 max_len;外推≈0 | Devlin et al. 2018 · BERT |
| 相对位置 Rel-PE | 更符合语言/序列直觉 | 长距离更稳 | Shaw et al. 2018 · Transformer-XL |
| RoPE 旋转位置 ✅ | 用旋转把相对距离编入 Q·K | 现代主流,LLaMA 系全用 | Su et al. 2021 · RoFormer |
| ALiBi 距离惩罚 ✅ | 训练短、推理长的外推友好 | 免外推训练,长度外推稳 | Press et al. 2021 |
| YaRN / NTK 缩放 🧪 | 已训好的 RoPE 模型拉长 L | 免重训扩展上下文 | Peng et al. 2023 · YaRN |
| NoPE 无位置编码 🧪 | 因果掩码本身带隐式位置 | 小模型可行,超长外推有惊喜 | Kazemnejad et al. 2023 |
14.2 归一化 Normalization · 允许变体 ✅
Section titled “14.2 归一化 Normalization · 允许变体 ✅”| 变体 | 为什么用 | 效果 | 代表文献 |
|---|---|---|---|
| Post-Norm(原始) | 表达力强 | 深层难训,需仔细 warmup | Vaswani et al. 2017 |
| Pre-Norm ✅ | 深层友好 | GPT/LLaMA/多数现代 LM 默认 | Xiong et al. 2020 |
| RMSNorm ✅ | 去掉均值项更快 | 精度接近 LayerNorm,训练更快 | Zhang & Sennrich 2019 |
| DeepNorm ⚠️ | 训练极深(1000 层)时稳定 | 千层 Transformer 可行 | Wang et al. 2022 |
14.3 激活函数(FFN 中的非线性)· 允许变体 ✅
Section titled “14.3 激活函数(FFN 中的非线性)· 允许变体 ✅”| 变体 | 为什么用 | 效果 | 代表文献 |
|---|---|---|---|
| ReLU(原始) | 简单快 | 部分神经元「死亡」 | — |
| GELU | 平滑,梯度更好 | BERT 默认 | Hendrycks & Gimpel 2016 |
| SwiGLU ✅ | 门控增强 FFN | LLaMA/PaLM 默认,明显更好 | Shazeer 2020 |
| GeGLU | GELU 版本的门控 | 与 SwiGLU 接近 | 同上 |
14.4 注意力效率与稀疏 · 允许变体 ✅
Section titled “14.4 注意力效率与稀疏 · 允许变体 ✅”| 变体 | 思路 | 效果 | 代表文献 |
|---|---|---|---|
| FlashAttention ✅ | 融合内核减 IO | 同数学,2~10× 快,省显存 | Dao et al. 2022 · FlashAttn-2 |
| Longformer | 滑窗 + 全局 token | 长文档友好 | Beltagy et al. 2020 |
| BigBird | 随机 + 窗口 + 全局 | 理论保证 + 长上下文 | Zaheer et al. 2020 |
| Performer / Linear Attn 🧪 | 核方法近似 softmax | 线性复杂度,任务上要实证 | Choromanski et al. 2020 |
| Mamba / SSM 🧪✅ | 状态空间模型替代注意力 | 长基因组超香 | Gu & Dao 2023 |
| Hyena 🧪 | 长卷积 + 门控 | 百万级 tokens DNA 可行 | Poli et al. 2023 · HyenaDNA |
| MoE 稀疏专家 ✅ | 只激活部分专家 | 参数大、算力小 | Shazeer et al. 2017 · Mixtral |
14.5 注意力头结构 · 允许变体 ✅
Section titled “14.5 注意力头结构 · 允许变体 ✅”| 变体 | 思路 | 效果 | 代表文献 |
|---|---|---|---|
| MHA 多头 | 每头独立 K/V | 表达强、KV Cache 大 | 原论文 |
| MQA 多查询 | 所有头共享 K/V | KV Cache 小很多,略掉点 | Shazeer 2019 |
| GQA 分组查询 ✅ | MHA 与 MQA 折中 | LLaMA-2/3 默认,性价比佳 | Ainslie et al. 2023 |
| MLA 潜在注意力 ✅🧪 | K/V 压到低维潜空间 | DeepSeek-V2/V3 默认,Cache 极省 | DeepSeek-V2 |
14.6 预训练目标 · 允许变体 ✅
Section titled “14.6 预训练目标 · 允许变体 ✅”| 变体 | 思路 | 效果 | 代表文献 |
|---|---|---|---|
| CLM 因果 ✅ | 猜下一 token | 生成主流 | Radford et al. 2018 · GPT |
| MLM 掩码 ✅ | 挖空填空 | 双向理解 | BERT · ESM 蛋白 LM |
| Span 掩码 | 挖连续片段 | 更强于短语级 | SpanBERT · T5 |
| Prefix-LM | 前双向后因果 | 兼容分类与生成 | UniLM |
| Denoising (T5) | 打乱/删/掩再还原 | seq2seq 万金油 | T5 |
| ELECTRA 判别 🧪 | 判「这个 token 是不是真的」 | 样本效率高 | Clark et al. 2020 |
| 对比学习 ✅ | 拉近正样本推远负样本 | 检索/表征强 | SimCSE |
| FIM 填中间 ✅ | 前+后→中间 | 代码/结构化生成 | Bavarian et al. 2022 |
14.7 参数高效微调 PEFT · 允许变体 ✅
Section titled “14.7 参数高效微调 PEFT · 允许变体 ✅”| 变体 | 思路 | 效果 | 代表文献 |
|---|---|---|---|
| LoRA ✅ | 低秩旁路 ΔW=BA | 主流性价比 | Hu et al. 2021 |
| QLoRA ✅ | 底座 4-bit + LoRA | 单卡微调大模型 | Dettmers et al. 2023 |
| DoRA | 分解方向/幅度 | 常优于 LoRA 一点 | Liu et al. 2024 |
| AdaLoRA | 自适应分配 rank | 参数更省 | Zhang et al. 2023 |
| Adapter | 串行小瓶颈层 | LoRA 前身 | Houlsby et al. 2019 |
| Prefix Tuning | 前缀虚拟 token | 生成任务好用 | Li & Liang 2021 |
| P-Tuning v2 | 深层前缀 | 分类任务补齐 | Liu et al. 2021 |
| IA³ | 缩放向量 | 极少参数 | Liu et al. 2022 |
| BitFit ⚠️ | 只训 bias | 极简,上限低 | Zaken et al. 2021 |
14.8 对齐算法 · 允许变体 ✅
Section titled “14.8 对齐算法 · 允许变体 ✅”| 变体 | 思路 | 效果 | 代表文献 |
|---|---|---|---|
| PPO / RLHF ✅ | 在线 RL + KL 约束 | 效果强、工程重 | InstructGPT |
| DPO ✅ | 无显式 RM,直接偏好对 | 简单稳定,主流选择 | Rafailov et al. 2023 |
| IPO | 身份偏好优化 | 对过拟合更稳 | Azar et al. 2023 |
| KTO | 单点偏好 | 不需成对偏好数据 | Ethayarajh et al. 2024 |
| GRPO ✅ | 群相对策略优化 | DeepSeek-R1 用它 | DeepSeek-Math |
| ORPO | 单阶段整合 SFT+对齐 | 免 SFT | Hong et al. 2024 |
| SimPO ⚠️ | 无参考模型的 DPO 变体 | 更省,风险稍大 | Meng et al. 2024 |
14.9 三大架构与其他骨架 · 允许变体 ✅
Section titled “14.9 三大架构与其他骨架 · 允许变体 ✅”| 变体 | 场景 | 代表文献 |
|---|---|---|
| Encoder-only | 分类/表征 | BERT · ESM |
| Decoder-only ✅(现代主流) | 生成/续写 | GPT-3 · LLaMA |
| Encoder-Decoder | 翻译/seq2seq | T5 · BART |
| Mamba/SSM 🧪 | 长序列替代 | Mamba |
| Hyena 🧪 | 超长基因组 | HyenaDNA |
| RetNet 🧪 | 保留网络 | Sun et al. 2023 |
| RWKV 🧪 | RNN-Transformer 融合 | Peng et al. 2023 |
14.10 「换 vs 不换」决策口诀
Section titled “14.10 「换 vs 不换」决策口诀”零件 默认选择 什么时候要考虑换─────────────────────────────────────────────────位置编码 RoPE 超长外推 → ALiBi / YaRNNorm Pre-Norm+RMSNorm 千层深模型 → DeepNormFFN 激活 SwiGLU 资源极紧 → GELU注意力实现 FlashAttention 百万级 L → SSM/Hyena注意力头 GQA 推理显存紧 → MQA/MLA预训练目标 CLM 需双向表征 → MLM;A→B → 去噪微调 LoRA 大模型单卡 → QLoRA;效果榨干 → 全参对齐 SFT → DPO 工程强团队 → PPO;推理型 → GRPO生物向的变体选择细节(k-mer vs BPE、蛋白 MLM vs 基因组 CLM、Hyena/Mamba 在超长基因组的地位、CPT 里 LoRA 的插入策略)→ 第3章展开。
文内「变体图谱」表格中的 arXiv / 论文链接即为本章主要参考来源;下列为高频入口:
15. 下一站
Section titled “15. 下一站”第2章 = 怎么把塔训大、训稳、接到任务与对齐。
第3章 = 组学 / 互作 / 预测 / 基因:同样骨架,换生物约束与评估——正文已展开。
第2章 完 · Transformer 系统学习路径
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。