Transformer 系统学习路径:总览
分类:
machine-learning/transformer· 风格:专业 + 科普 · 少公式 · 重直觉
风格:专业 + 科普 · 少公式 · 重直觉(为什么 / 怎么调 / 效果是什么)
读者画像:有组学与生物信息背景,非 CS 科班;需要「能讲清楚 + 能动手调」
本系列范围:序列建模主线(非图像 Vision Transformer 仅作对比一笔带过)
一、你为什么要学 Transformer?
Section titled “一、你为什么要学 Transformer?”可以把 Transformer 想成:
一套「用注意力在任意位置之间直接传话」的通用序列引擎。
在 NLP 里它几乎统治了语言模型;在生物序列(DNA / RNA / 蛋白质)里,它同样是当前 foundation model 的默认骨架——因为「长程依赖、位置关系、上下文条件」在基因组和蛋白上同样关键。
学完本系列后,你应能:
- 用自己的话讲清:Token → 嵌入 → 自注意力 → FFN → 残差+归一化 各自在干什么
- 知道 Encoder-only / Decoder-only / Encoder-Decoder 分别适合什么任务
- 看懂论文里的:预训练目标、位置编码、KV Cache、LoRA、长上下文技巧
- 为第3章(生物向)打好接口:tokenization、序列长度、掩码、多模态融合的设计直觉
二、概念地图(先建立全局)
Section titled “二、概念地图(先建立全局)”flowchart TB subgraph L0["入口"] SEQ["序列问题<br/>文本 / DNA / 蛋白 / 时序"] end subgraph L1["第1章 · 基础"] TOK["Tokenization<br/>切成可计算单元"] EMB["Embedding + 位置编码<br/>给每个 token 坐标与含义"] ATT["Self-Attention<br/>谁该听谁说话"] FFN["FFN / MLP<br/>逐位置非线性加工"] BLK["Block 堆叠<br/>残差 + LayerNorm"] ARC["三大架构<br/>Enc / Dec / Enc-Dec"] end subgraph L2["第2章 · 进阶"] PT["预训练目标<br/>MLM / CLM / 对比学习"] SCALE["缩放定律直觉<br/>数据·参数·算力"] EFF["效率工程<br/>KV Cache / FlashAttn"] PEFT["高效适配<br/>LoRA / Adapter / Prompt"] LONG["长上下文<br/>RoPE / ALiBi / 稀疏注意力"] STAB["训练稳定与调参<br/>LR / Warmup / 梯度"] end subgraph L3["第3章 · 生物向 ✅"] OMICS["组学序列建模"] INT["互作与关系"] PRED["功能与结构预测"] GENE["基因调控与变异"] end SEQ --> TOK --> EMB --> ATT --> FFN --> BLK --> ARC ARC --> PT --> SCALE PT --> EFF --> PEFT --> LONG --> STAB STAB --> OMICS STAB --> INT STAB --> PRED STAB --> GENE
一张「信息流」简图(单层 Transformer Block)
Section titled “一张「信息流」简图(单层 Transformer Block)”flowchart LR X["输入 X<br/>每个位置一个向量"] --> QKV["线性投影<br/>得到 Q / K / V"] QKV --> SA["Self-Attention<br/>加权混合上下文"] SA --> ADD1["+ 残差"] X --> ADD1 ADD1 --> LN1["LayerNorm"] LN1 --> MLP["FFN<br/>逐位置加工"] MLP --> ADD2["+ 残差"] LN1 --> ADD2 ADD2 --> LN2["LayerNorm"] LN2 --> Y["输出 Y<br/>同形状、更「懂上下文」"]
三、推荐学习顺序(严格按这个走)
Section titled “三、推荐学习顺序(严格按这个走)”| 顺序 | 内容 | 目标 | 预计精力 |
|---|---|---|---|
| 0 | 本总览 | 建立地图,知道终点在哪 | 20–30 分钟 |
| 1 | 第1章 · 基础知识 | 能手画 Block、能解释注意力 | 2–4 天 |
| 2 | 第2章 · 进阶 | 能读现代 LLM / 生物 FM 论文方法部分 | 3–5 天 |
| 3 | 第3章 · 生物向 | 组学/互作/预测/调控/CPT/评估/开题 | 4–6 天 |
| 可选练习 | 极小自注意力手算 + 极简 GPT 级 toy | 把「感觉」变成「肌肉记忆」 | 穿插进行 |
建议的阅读节奏
Section titled “建议的阅读节奏”- 先通读总览概念图(不要急着抠细节)
- 第1章 按「问题 → 直觉 → 组件 → 调参手感 → 自检」 一节一节过
- 第2章 对照你见过的生物 foundation model 论文(如 ESM、HyenaDNA、Nucleotide Transformer、OmniGene 类 CPT)做批注
- 第3章 按「三物理量选型 → 三支柱模型 → 开题五铁律」 落到你的林木多组学与 CPT 线
四、四阶段目录结构(完整计划)
Section titled “四、四阶段目录结构(完整计划)”第1章 · 基础知识 ✅ 本轮完成
Section titled “第1章 · 基础知识 ✅ 本轮完成”- 序列建模的「老路」与为什么需要 Transformer
- Tokenization:把世界切成模型能吃的块
- Embedding:把离散符号变成连续向量
- 位置信息:没有顺序,注意力会瞎
- Self-Attention 核心直觉(Query / Key / Value 三角色)
- Multi-Head:多组「关注偏好」并行
- FFN、残差连接、LayerNorm:让深层堆得起来
- 三大架构与典型任务
- 训练时 vs 推理时:掩码、自回归、teacher forcing 直觉
- 第1章 自检清单 + 迷你实验建议
第2章 · 进阶 ✅ 本轮完成
Section titled “第2章 · 进阶 ✅ 本轮完成”- 预训练范式:MLM / CLM / 前缀 / 对比 / 去噪
- 缩放直觉:数据、参数、算力如何一起涨
- 位置编码进阶:绝对 / 相对 / RoPE / ALiBi
- 注意力效率:复杂度瓶颈、稀疏、线性近似、FlashAttention 直觉
- 推理工程:KV Cache、batching、采样温度 top-p
- 参数高效微调 PEFT:LoRA / Adapter / Prefix / 全参何时才值得
- 稳定训练:学习率、warmup、梯度裁剪、混合精度
- 对齐与偏好(与 RL 系列接口):SFT → DPO/GRPO 在 Transformer 上的落点
- 常见失败模式:过拟合、上下文浪费、灾难性遗忘(接 CPT)
- 第2章 自检 + 读论文 checklist
第3章 · 生物向(组学 / 互作 / 预测 / 基因)✅ 已完成
Section titled “第3章 · 生物向(组学 / 互作 / 预测 / 基因)✅ 已完成”| 板块 | 主题 | 状态 |
|---|---|---|
| 0 | 全景地图 + 三支柱(Evo 2 / DNABERT-2·NT / ESM) | ✅ |
| 3.1 | 生物序列 tokenization(k-mer / BPE / 单碱基 / 氨基酸 / 特殊 token) | ✅ |
| 3.2 | 基因组尺度建模:超长序列、稀疏注意力、SSM 混合 | ✅ |
| 3.3 | 转录组 / 单细胞:表达排序 vs 基因名+数值 | ✅ |
| 3.4 | 蛋白质:ESM-2/3、InstructPLM-mu、PEFT | ✅ |
| 3.5 | 互作:双塔/交叉注意力、困难负例、图-序列 | ✅ |
| 3.6 | 预测任务设计 + 标签划分铁律 | ✅ |
| 3.7 | 基因调控与多组学融合(甲基化 token / 旁路分支) | ✅ |
| 3.8 | CPT / 灾难性遗忘 / λ_mix / CPT≠RL | ✅ |
| 3.9 | 评估协议:L1→L2→L3 双栏评估 | ✅ |
| 3.10 | 开题 Go/No-Go 模板(对齐 rl_go_nogo_checklist) | ✅ |
正文见 第3章 · 生物向;风格对齐第1章–2,优先级 🌲 植物/树木 > 人/医学 > 动物=微生物。
五、与你已有知识的接口
Section titled “五、与你已有知识的接口”| 你已掌握 | 在本系列中的接口 |
|---|---|
| 森林树木多组学数据库 / 组学资源 | 第3章:数据形态如何变成 token 与标签 |
| 比较基因组 / HGT | 注意力是否「看见」远缘片段;负样本与掩码设计 |
| 植物 TF / 基序 | 序列→结合偏好:局部 motif vs 长程染色质语境 |
| 生物 CPT / 灾难性遗忘 | 第2章 末 + 第3章:继续预训练 ≠ 强化学习;λ_mix 接口 |
| RL 全四阶段 | 对齐章:奖励模型 / DPO 作用在 Transformer 策略 上 |
与 RL 系列的划界:
CPT 是「在同一套预测目标上继续学分布」;RL / 偏好优化是「按反馈改行为策略」。二者都常跑在 Transformer 上,但问题定义不同。
六、文件清单
Section titled “六、文件清单”| 页面 | 内容 | 状态 |
|---|---|---|
| 总览 | 概念图 + 推荐顺序 + 完整计划 | ✅ |
| 第1章 · 基础知识 | 基础详解(形象图解版) | ✅ |
| 第2章 · 进阶 | 进阶详解 | ✅ |
| 第3章 · 生物向 | 生物向全文(组学/互作/CPT/评估/开题) | ✅ |
/figures/transformer-tutorial-chapter1/tf1-01 … tf1-08.svg | 第1章 八张教学示意图 | ✅ |
七、开始方式
Section titled “七、开始方式”打开 第1章 · 基础知识,从「为什么需要注意力」读起(文内已嵌 8 张形象配图)。
读的时候建议边看边在草稿纸上画:
- 一个 4 个 token 的句子,Q/K/V 如何互相打分
- 一个 Block 的数据形状:
[batch, seq_len, d_model]如何保持不变
第1章 自检通过后进入 第2章 · 进阶;生物落地直接读 第3章 · 生物向(三物理量选型 → 三支柱 → 开题五铁律)。
全系列已完成 ✅(基础 → 进阶 → 生物向)。
0
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。