跳转到内容

Transformer 系统学习路径:总览

分类machine-learning/transformer · 风格:专业 + 科普 · 少公式 · 重直觉

风格:专业 + 科普 · 少公式 · 重直觉(为什么 / 怎么调 / 效果是什么)
读者画像:有组学与生物信息背景,非 CS 科班;需要「能讲清楚 + 能动手调」
本系列范围:序列建模主线(非图像 Vision Transformer 仅作对比一笔带过)


可以把 Transformer 想成:

一套「用注意力在任意位置之间直接传话」的通用序列引擎。

在 NLP 里它几乎统治了语言模型;在生物序列(DNA / RNA / 蛋白质)里,它同样是当前 foundation model 的默认骨架——因为「长程依赖、位置关系、上下文条件」在基因组和蛋白上同样关键。

学完本系列后,你应能:

  1. 用自己的话讲清:Token → 嵌入 → 自注意力 → FFN → 残差+归一化 各自在干什么
  2. 知道 Encoder-only / Decoder-only / Encoder-Decoder 分别适合什么任务
  3. 看懂论文里的:预训练目标、位置编码、KV Cache、LoRA、长上下文技巧
  4. 第3章(生物向)打好接口:tokenization、序列长度、掩码、多模态融合的设计直觉

示意图

一张「信息流」简图(单层 Transformer Block)

Section titled “一张「信息流」简图(单层 Transformer Block)”
示意图

三、推荐学习顺序(严格按这个走)

Section titled “三、推荐学习顺序(严格按这个走)”
顺序内容目标预计精力
0本总览建立地图,知道终点在哪20–30 分钟
1第1章 · 基础知识能手画 Block、能解释注意力2–4 天
2第2章 · 进阶能读现代 LLM / 生物 FM 论文方法部分3–5 天
3第3章 · 生物向组学/互作/预测/调控/CPT/评估/开题4–6 天
可选练习极小自注意力手算 + 极简 GPT 级 toy把「感觉」变成「肌肉记忆」穿插进行
  1. 先通读总览概念图(不要急着抠细节)
  2. 第1章 按「问题 → 直觉 → 组件 → 调参手感 → 自检」 一节一节过
  3. 第2章 对照你见过的生物 foundation model 论文(如 ESM、HyenaDNA、Nucleotide Transformer、OmniGene 类 CPT)做批注
  4. 第3章 按「三物理量选型 → 三支柱模型 → 开题五铁律」 落到你的林木多组学与 CPT 线

四、四阶段目录结构(完整计划)

Section titled “四、四阶段目录结构(完整计划)”
  1. 序列建模的「老路」与为什么需要 Transformer
  2. Tokenization:把世界切成模型能吃的块
  3. Embedding:把离散符号变成连续向量
  4. 位置信息:没有顺序,注意力会瞎
  5. Self-Attention 核心直觉(Query / Key / Value 三角色)
  6. Multi-Head:多组「关注偏好」并行
  7. FFN、残差连接、LayerNorm:让深层堆得起来
  8. 三大架构与典型任务
  9. 训练时 vs 推理时:掩码、自回归、teacher forcing 直觉
  10. 第1章 自检清单 + 迷你实验建议
  1. 预训练范式:MLM / CLM / 前缀 / 对比 / 去噪
  2. 缩放直觉:数据、参数、算力如何一起涨
  3. 位置编码进阶:绝对 / 相对 / RoPE / ALiBi
  4. 注意力效率:复杂度瓶颈、稀疏、线性近似、FlashAttention 直觉
  5. 推理工程:KV Cache、batching、采样温度 top-p
  6. 参数高效微调 PEFT:LoRA / Adapter / Prefix / 全参何时才值得
  7. 稳定训练:学习率、warmup、梯度裁剪、混合精度
  8. 对齐与偏好(与 RL 系列接口):SFT → DPO/GRPO 在 Transformer 上的落点
  9. 常见失败模式:过拟合、上下文浪费、灾难性遗忘(接 CPT)
  10. 第2章 自检 + 读论文 checklist

第3章 · 生物向(组学 / 互作 / 预测 / 基因)✅ 已完成

Section titled “第3章 · 生物向(组学 / 互作 / 预测 / 基因)✅ 已完成”
板块主题状态
0全景地图 + 三支柱(Evo 2 / DNABERT-2·NT / ESM)
3.1生物序列 tokenization(k-mer / BPE / 单碱基 / 氨基酸 / 特殊 token)
3.2基因组尺度建模:超长序列、稀疏注意力、SSM 混合
3.3转录组 / 单细胞:表达排序 vs 基因名+数值
3.4蛋白质:ESM-2/3、InstructPLM-mu、PEFT
3.5互作:双塔/交叉注意力、困难负例、图-序列
3.6预测任务设计 + 标签划分铁律
3.7基因调控与多组学融合(甲基化 token / 旁路分支)
3.8CPT / 灾难性遗忘 / λ_mix / CPT≠RL
3.9评估协议:L1→L2→L3 双栏评估
3.10开题 Go/No-Go 模板(对齐 rl_go_nogo_checklist)

正文见 第3章 · 生物向;风格对齐第1章–2,优先级 🌲 植物/树木 > 人/医学 > 动物=微生物。


你已掌握在本系列中的接口
森林树木多组学数据库 / 组学资源第3章:数据形态如何变成 token 与标签
比较基因组 / HGT注意力是否「看见」远缘片段;负样本与掩码设计
植物 TF / 基序序列→结合偏好:局部 motif vs 长程染色质语境
生物 CPT / 灾难性遗忘第2章 末 + 第3章:继续预训练 ≠ 强化学习;λ_mix 接口
RL 全四阶段对齐章:奖励模型 / DPO 作用在 Transformer 策略

与 RL 系列的划界:

CPT 是「在同一套预测目标上继续学分布」;RL / 偏好优化是「按反馈改行为策略」。二者都常跑在 Transformer 上,但问题定义不同。


页面内容状态
总览概念图 + 推荐顺序 + 完整计划
第1章 · 基础知识基础详解(形象图解版)
第2章 · 进阶进阶详解
第3章 · 生物向生物向全文(组学/互作/CPT/评估/开题)
/figures/transformer-tutorial-chapter1/tf1-01tf1-08.svg第1章 八张教学示意图

打开 第1章 · 基础知识,从「为什么需要注意力」读起(文内已嵌 8 张形象配图)。

读的时候建议边看边在草稿纸上画:

  1. 一个 4 个 token 的句子,Q/K/V 如何互相打分
  2. 一个 Block 的数据形状:[batch, seq_len, d_model] 如何保持不变

第1章 自检通过后进入 第2章 · 进阶;生物落地直接读 第3章 · 生物向(三物理量选型 → 三支柱 → 开题五铁律)。

全系列已完成 ✅(基础 → 进阶 → 生物向)。