跳转到内容

Transformer 系统学习路径:第3章 · 生物向

分类machine-learning/transformer · 风格:专业 + 科普 · 少公式 · 重直觉

状态:✅ 正文展开完成(风格对齐第1章–2:专业 + 科普 · 少公式 · 重直觉 · 图解 + 表格 + Mermaid) 前置总览 · 第1章 · 第2章 范围非图像 —— DNA / RNA / 蛋白 / 单细胞 / 多组学 / 互作 / 调控 优先级:🌲 植物 / 树木 > 🧑‍⚕️ 人 / 医学 > 🐾 动物 = 🦠 微生物(举例与篇幅按此权重) 对接你的资产:森林树木多组学数据库(甲基化 token、开放染色质、基因调控字段)· OmniGene-4 类 CPT 知识线


0. 一张地图:生物向 Transformer 全景

Section titled “0. 一张地图:生物向 Transformer 全景”

第1章 教你「注意力怎么算」,第2章 教你「怎么训得动、调得省」。第3章 只回答一件事:

把生物数据塞进 Transformer 之前,你要做的所有决定。

这些决定不是玄学,它们由三个物理量决定——序列有多长、信号是局部还是长程、你有多少带标签的数据。记住这句话,本章所有选型都能顺出来。

示意图

本章三根支柱模型(后文反复引用,先混个脸熟):

支柱是什么一句话直觉对应你哪条线
Evo 2跨全生命域 DNA 生成模型,9.3T bp、100 万 token 上下文DNA 界的 GPT,能”读完整条染色体”超长序列 / 跨域 CPT
DNABERT-2 / Nucleotide Transformer多物种 DNA 编码器取嵌入做下游任务的主力植物多物种迁移
ESM-2 / ESM-3蛋白语言模型一条氨基酸序列 → 一串”懂结构功能”的向量蛋白功能 / 互作

3.1 生物序列 Tokenization:一切的起点

Section titled “3.1 生物序列 Tokenization:一切的起点”

直觉:token 粒度 = 你戴的”眼镜度数”

Section titled “直觉:token 粒度 = 你戴的”眼镜度数””

第1章 说过:Transformer 先把输入切成 token,再查嵌入表。生物序列没有天然的”词”,所以怎么切就是你替模型做的第一个、也是最影响全局的决定。切法决定了两件事:序列变多长(L)模型能不能看见你关心的模式

示意图
切法怎么切优点痛点什么时候用
单碱基 (char)每个 A/T/G/C 一个 token分辨率最高,单点变异看得清L 太长,算力爆变异效应、超长模型(Evo 2 就是单碱基级)
k-mer每 k 个碱基一段保留局部模式词表随 k 指数膨胀,稀有 k-mer 学不好;相邻 k-mer 高度重叠冗余早期方法,现在少用
BPE 子词按语料频率自动合并高频片段L 更短、词表可控、稀有片段被拆解边界不含生物学含义当今 DNA 主流(DNABERT-2 用 BPE 替换 k-mer)citation:DNABERT-2 · arXiv
氨基酸 / codon蛋白按 20 种氨基酸;DNA 可按密码子三联体天然对齐生物单位codon 需定阅读框蛋白 LM(ESM 系)、编码区分析

实践结论:DNA 任务默认从 BPE(DNABERT-2 / NT)起步;蛋白任务用氨基酸级(ESM-2);只有当你要极致单点分辨率或超长上下文(Evo 2 路线)才回到单碱基。这与第1章”token 越细 L 越长、越吃算力”的口令完全一致。

特殊 token:把”元信息”喂进去

Section titled “特殊 token:把”元信息”喂进去”

自然语言有 [CLS] [SEP] [MASK];生物序列可以自定义更有用的特殊 token:

特殊 token作用你的场景
[MASK]MLM 预训练遮盖Encoder-only 底座(第2章 §1 的 MLM 目标)
<物种> / <染色体> / <链>告诉模型上下文来源🌲 多树种联合训练时区分物种,减少负迁移
<甲基化> / <开放染色质>把表观信号编进序列流直接对接你数据库的甲基化 token 字段(详见 3.7)
反向互补增强正链/负链都喂数据增强,但注意别让同一区域同时进训练集和测试集 → 泄漏
  • 植物 DNA 底座目前多以 Nucleotide Transformer(850 物种多物种编码器) citation:Nucleotide Transformer · Nature Methods 或 HuggingFace zhangtaolab 系列 Plant DNA FM(BPE tokenizer) 为起点。
  • 多物种联合词表是双刃剑:能借近缘物种数据,但远缘物种可能带来负迁移 → 用 <物种> token + 后续 CPT(3.8)来缓解。
  • 树木大基因组(如针叶树可达 20+ Gb)不要整条塞,先想清楚 3.2 的长序列策略。

自问三题(写进你的开题笔记)

Section titled “自问三题(写进你的开题笔记)”
  1. 我的序列平均多长?切成 token 后 L 大概多少?(用第1章 的 [B, L, d] 口令推一遍)
  2. 我关心的信号有多大?(单点 SNP → 要细粒度;motif → k-mer/BPE 够;调控网络 → 要长程)
  3. 要不要生成序列?要 → 后面架构得留 Decoder;只做预测 → Encoder-only 最省。

3.2 基因组尺度与超长序列:当 L 大到算力扛不住

Section titled “3.2 基因组尺度与超长序列:当 L 大到算力扛不住”

第1章 讲过,标准自注意力要让每个 token 看所有 token——计算量随序列长度 L 的平方增长。基因组动辄几百万、几十亿碱基,L² 直接爆炸。所以超长序列的核心矛盾就是:既想看得远,又算不起。 解决思路只有四类:

示意图
路线代表复杂度优点代价适合
切窗滑动大多数 BERT 类 DNA 模型O(窗²)×窗数实现简单,复用现成模型窗口边界切断增强子-启动子这类远距离依赖局部任务(启动子识别)
稀疏注意力Longformer 式近线性仍是注意力,长程可选保留稀疏模式要手工设计中长序列
SSM / 卷积混合骨架HyenaDNA、Caduceus、Mamba线性 O(L)天生吃超长序列,显存友好对”精确 token 配对”不如注意力灵全基因组、超长上下文
注意力 + SSM 混合Evo 2、MTMixG-Net线性为主兼顾长程与局部架构复杂前沿大模型

对接第2章:这就是第2章 §3「不全是 softmax 注意力」的落地——长序列场景里,换骨架(Mamba/SSM)往往比堆注意力更实在。RoPE/ALiBi 这类相对位置编码在这里也关键,因为它们支持”训练时短、推理时外推更长”。

情况建议
只关心某类局部元件(启动子、TFBS)切窗 + Encoder-only 就够,别上百万上下文
关心增强子-启动子远程调控稀疏注意力或 SSM 混合,配 RoPE 外推
树种基因组巨大、算力有限优先 SSM 骨架(线性显存)+ 分层处理,绝不整条直塞
想复用现成底座先用 NT / DNABERT-2 取窗口嵌入再拼接,避免从头训超长模型

3.3 转录组 / 单细胞:当”序列”其实是一张表达表

Section titled “3.3 转录组 / 单细胞:当”序列”其实是一张表达表”

直觉:这里没有”顺序”,只有”哪些基因、表达多少”

Section titled “直觉:这里没有”顺序”,只有”哪些基因、表达多少””

DNA/蛋白是有顺序的字符串,但单细胞表达数据是一个 细胞 × 基因 的大矩阵——每个细胞就是”一堆基因各自表达了多少”。这带来一个根本问题:

表达数据更像一个”集合”,而不是一句有先后的话。 所以 tokenization 和位置编码的玩法完全不同。

示意图
思路怎么做代表直觉
表达排序法每个细胞里的基因按表达量从高到低排成一个”句子”,基因名=token,位置=排名Geneformer用”谁更活跃”的相对顺序替代绝对数值,天然抗批次差异
基因名 + 数值基因名做 token,表达值单独编码进去scGPT、scBERT保留定量信息,但要小心不同实验的数值尺度

最大的坑:batch 效应 = 捷径学习

Section titled “最大的坑:batch 效应 = 捷径学习”

不同批次、不同测序平台的数据有系统性差异(batch 效应)。若训练/测试划分没处理好,模型可能靠”这是哪个批次”来蒙对答案,而不是真学到生物信号——这就是第2章 反复警告的捷径学习

评估划分铁律:按批次 / 供体 / 物种留出测试集,而不是随机打乱。否则 AUROC 虚高,一到新数据就崩。

🌲 给森林树木多组学的落地建议

Section titled “🌲 给森林树木多组学的落地建议”
  • 树种单细胞参考稀缺 → 优先迁移:用 TranscriptFormer/scGPT 底座取嵌入,接简单分类头(线性探测),而非从头训。
  • 想跨树种迁移 → 用直系同源映射(OrthologTransformer 思路)统一基因命名,再联合建模。
  • 表达 + 序列想一起用 → 见 3.7 的多组学融合。

3.4 蛋白语言模型与结构 / 功能:一条氨基酸序列能”读懂”多少

Section titled “3.4 蛋白语言模型与结构 / 功能:一条氨基酸序列能”读懂”多少”

直觉:蛋白 LM 就是”学会了蛋白语法”的 BERT/GPT

Section titled “直觉:蛋白 LM 就是”学会了蛋白语法”的 BERT/GPT”

蛋白由 20 种氨基酸串成。蛋白语言模型(PLM)做的事和 NLP 里的 BERT 一模一样:用 MLM(遮盖预测) 在海量蛋白序列上预训练,学会”哪些氨基酸组合合理、哪些位置重要”。学完后,任意一条序列丢进去,就能吐出一串懂结构与功能的向量。

示意图
模型规模关键点直觉
ESM-2650M / 3B / 15B纯序列 MLM,取嵌入是下游主力”只读序列就能猜出结构信号” citation:ESM-2 · Technology Networks
ESM-3多模态序列 + 结构 + 功能三种 token 一起建模,能生成新蛋白”不止读,还能按结构/功能约束创作”
InstructPLM-mu在 ESM-2 上1 小时 PEFT 微调即追平 ESM-3低成本适配的典范,呼应第2章 §6 PEFT citation:InstructPLM-mu · arXiv

关键结论不必总追最大模型。 InstructPLM-mu 证明——在 ESM-2 上花 1 小时做 PEFT(LoRA 类),就能逼近专门训练的 ESM-3。这对算力有限的你极其重要:先拿现成底座 + 轻量微调,别急着从头训。

  1. 零样本嵌入 + 线性探测 🌲:ESM-2 取向量,接一个逻辑回归/线性头 → 这就是”植物蛋白用 ESM-2 embedding + 线性头”的标准打法,几乎不花算力。
  2. PEFT 微调:数据稍多时,LoRA 插件式微调(对接第2章 §6/§9),保留底座、只训小插件。
  3. 结构/生成:需要设计新蛋白才用 ESM-3 这类多模态生成模型,且必须加硬性生物约束解码(见 3.10)。
  • 植物蛋白注释稀缺 → 零样本嵌入 + 简单头是性价比之王,别一上来就微调大模型。
  • 想做蛋白功能预测(如抗逆相关蛋白)→ ESM-2 embedding 已能捕获大量结构信号,配少量标注即可起步。
  • 蛋白与 DNA 联合(如 TF 蛋白 ↔ 结合位点)→ 见 3.5 的双塔 / 交叉注意力。

3.5 互作、调控与序列对:两条序列怎么”谈恋爱”

Section titled “3.5 互作、调控与序列对:两条序列怎么”谈恋爱””

直觉:从”读一条”到”判断两条的关系”

Section titled “直觉:从”读一条”到”判断两条的关系””

前面都是喂一条序列。但很多生物问题是两条序列的关系

  • 蛋白–蛋白互作(PPI):这两个蛋白会不会结合?
  • TF–DNA:这个转录因子会不会结合这段启动子?
  • RBP–RNA:这个 RNA 结合蛋白会不会抓住这段 RNA?

处理”序列对”有三种经典架构,选型直接决定成本与精度:

示意图
架构交互程度成本适合
拼接输入最强(全交互)高(每对重算)对数不多、要求精度
双塔弱(只在末端比对)低(嵌入可预存、可复用)海量候选筛选(先用双塔粗筛)
交叉注意力精排、机制研究

实战策略双塔粗筛 + 交叉注意力精排。先用双塔把海量候选对快速打分(嵌入预存复用),再对 top 候选用交叉注意力精算。这套”粗筛→精排”思路和搜索引擎完全一样。

图 + 序列:调控网络的天然结构

Section titled “图 + 序列:调控网络的天然结构”

PPI 网络、基因调控网络本质是。前沿做法是把序列编码器(学节点特征)+ 图结构(学连接)结合——序列给”是什么”,图给”和谁连”。

🔑 困难负例:直接对接你的 HGT 检测经验

Section titled “🔑 困难负例:直接对接你的 HGT 检测经验”

互作/调控模型最大的陷阱是负样本太easy:随机配一对不相关序列,模型轻松学会区分,AUROC 虚高,实战却废。必须构造困难负例——形态相似但真不结合的对。

对接你的 HGT 检测:你在水平基因转移检测里设计”困难负例”(序列相似但非 HGT)的经验,可以原封不动搬到互作模型的负样本设计上。困难负例的质量,往往比换什么注意力更决定成败(呼应 3.6)。

  • 🌲 TF–DNA(植物调控):植物转录因子结合位点预测,正是”TF 蛋白序列 × 启动子 DNA”的序列对问题,可用双塔或交叉注意力,配 PWM/motif 做可解释校验(见 3.9)。
  • 🧑‍⚕️ PPI:人类蛋白互作预测常用 ESM-2 双塔嵌入 + 分类头,成本低、可大规模筛。

3.6 预测任务设计:题目怎么出,比用什么模型更重要

Section titled “3.6 预测任务设计:题目怎么出,比用什么模型更重要”

直觉:一半的成败在”出题”,不在”模型”

Section titled “直觉:一半的成败在”出题”,不在”模型””

生物向 Transformer 的常见任务其实就几类:

示意图
任务类型头部底座建议典型陷阱
位点/元件识别分类头Encoder-only 取嵌入正负样本比例失衡
变异效应打分/分类单碱基分辨率(Evo 2/AlphaGenome)参考等位与变异等位要对齐
表达/表型回归回归头序列 + 多组学(3.7)批次/环境混杂
序列设计Decoder 生成Evo 2 / ESM-3生成不合法序列

🔑 第一性原则:标签怎么划分 > 换什么注意力

Section titled “🔑 第一性原则:标签怎么划分 > 换什么注意力”

这是本章最重要的一句话,请贴在开题笔记最上方:

调换注意力机制带来的提升,往往远小于一次数据泄漏造成的虚高。

生物数据的”泄漏”极其隐蔽:同一基因家族的同源序列、同一染色体的相邻区域、反向互补的同一片段——若它们同时出现在训练集和测试集,模型就是在”背答案”。

正确的划分方式(按你研究对象选):

划分依据防的是什么泄漏适合
按基因家族同源序列泄漏蛋白/基因功能预测
按染色体邻近区域泄漏基因组元件识别
按物种 🌲近缘物种泄漏跨树种迁移评估
时间/批次批次捷径单细胞、时序

实践结论:开题时先花力气把训练/测试划分做干净(按家族/染色体/物种留出),再谈模型。一个划分干净的 CNN baseline,常比划分脏的 Transformer 更可信。


3.7 基因调控与多组学融合:把甲基化、染色质喂进模型

Section titled “3.7 基因调控与多组学融合:把甲基化、染色质喂进模型”

直觉:光有 DNA 序列不够,还要”当时的状态”

Section titled “直觉:光有 DNA 序列不够,还要”当时的状态””

一段 DNA 会不会被转录,不只看序列本身,还看它当时的表观状态——甲基化程度、染色质开不开放、组蛋白修饰。这正是你的森林树木多组学数据库的核心字段。问题是:怎么把这些”旁路信号”喂进以序列为主的 Transformer?

示意图
方式怎么做优点缺点你的场景
专用 token甲基化/染色质离散化成 token,插进序列流简单,复用现成架构增加 L;离散化损失精度直接对接你数据库的甲基化 token 字段
条件输入表观信号作为附加通道或条件向量保留连续值需改输入层开放染色质连续信号
旁路分支每种组学单独编码器,末端融合灵活,缺哪个组学都能跑参数多多组学不全时最稳

对接前沿:多模态基础 Transformer(Nat Methods 2025/2026 系列,如 NicheTrans 做空间多组学)证明旁路分支 + 融合在组学不全时最鲁棒——这对你”某些树种缺甲基化数据”的现实特别有用 citation:NicheTrans · Nature Methods

TF 基序(局部)× 长程染色质(远程)

Section titled “TF 基序(局部)× 长程染色质(远程)”

基因调控天生是局部 + 长程的混合信号:

  • 局部:TF 结合基序(motif),几十 bp 内的模式 → 卷积/局部注意力就能抓。
  • 长程:增强子隔着几十上百 kb 调控启动子 → 需要长上下文(3.2 的 SSM/稀疏注意力)。

所以调控模型往往要局部 + 长程双管齐下,这也是 Evo 2、AlphaGenome 这类长上下文模型的用武之地。

🌲 森林树木多组学:把数据库变成”训练行”

Section titled “🌲 森林树木多组学:把数据库变成”训练行””

你的数据库(甲基化、开放染色质、基因调控字段)可以这样接入:

数据库字段融合方式变成什么
甲基化 token专用 token 并入序列每个位点带”甲基化状态”标记
开放染色质条件通道连续开放性信号
基因调控关系图结构(配 3.5 图+序列)调控网络的边
缺失组学的树种旁路分支(可缺省)缺哪个跑哪个

物种转移思路:数据全的树种上训好,用 CPT(3.8)迁到数据少的树种;缺失组学用旁路分支的”可缺省”设计兜底。


3.8 CPT、灾难性遗忘与域适配:把通用底座”驯化”成林木专家

Section titled “3.8 CPT、灾难性遗忘与域适配:把通用底座”驯化”成林木专家”

直觉:站在巨人肩膀上,但别把巨人推下去

Section titled “直觉:站在巨人肩膀上,但别把巨人推下去”

从头训一个 DNA/蛋白大模型你训不起。正确姿势是拿现成通用底座(Evo 2 / NT / ESM-2)→ 在你的林木数据上继续预训练(CPT, Continued Pre-Training)→ 变成林木专家。但这里有个著名陷阱:

灾难性遗忘:只用林木数据狂训,模型会把原来学到的通用生物知识忘光,最后”精而脆”——林木任务好一点点,别的全崩。

示意图

三个防遗忘手段(对接第2章 §6/§9 与 OmniGene 线)

Section titled “三个防遗忘手段(对接第2章 §6/§9 与 OmniGene 线)”
手段做法直觉对接
数据回放 + λ_mix 配比CPT 时按比例 λ_mix 混入通用数据一边学新的,一边复习旧的你在 OmniGene-4 CPT 里的核心变量
LoRA 插件化冻结底座,只训小插件;不同任务换不同插件底座不动就不会忘;插件可插拔第2章 §6 PEFT
回放缓冲保留一小份原始预训练样本反复喂定期”回炉”防漂移经典防遗忘

λ_mix 的直觉:它是”复习旧知识 vs 学习新知识”的旋钮。λ_mix 偏大 → 保通用、林木学得慢;偏小 → 林木快、易遗忘。这是你 CPT 实验里最该调的超参之一,和 OmniGene-4 那条线完全一致。

🔑 关键边界:CPT ≠ RL(呼应你的 RL 系列 Phase 4)

Section titled “🔑 关键边界:CPT ≠ RL(呼应你的 RL 系列 Phase 4)”

这条你在强化学习 Phase 4 已经反复确认,这里再钉一次,避免混淆:

CPT 是”继续用自监督/预测目标喂知识”,靠 λ_mix 防遗忘;RL 是”用奖励信号对齐行为”,靠 KL 约束防跑偏。两者的”防漂移旋钮”不是一个东西(λ_mix ≠ KL),别混用。

生物底座的域适配几乎总是 CPT(+可选 SFT),而不是 RL。RL 只在你要”按某个目标函数优化生成序列”(如设计高结合力蛋白)时才登场,且要极其小心奖励作弊。

示意图

实践结论:林木底座 = 通用底座 + CPT(λ_mix 防遗忘)+ LoRA 任务插件。这套和你 OmniGene-4 的知识线同构,可直接复用你已有的 CPT 认知,别当成新东西。


3.9 评估协议:别只看 AUROC,要看”生物学上说得通吗”

Section titled “3.9 评估协议:别只看 AUROC,要看”生物学上说得通吗””

直觉:机器学习指标高 ≠ 学到了真生物

Section titled “直觉:机器学习指标高 ≠ 学到了真生物”

一个模型 AUROC 0.95,可能是真本事,也可能是背了泄漏答案 / 抓了批次捷径。所以生物向评估必须双栏并行:一栏看机器学习指标,一栏看生物学合理性。这套三级结构和你 RL 系列的 L1→L2→L3 完全同构。

示意图
级别看什么例子与 RL 系列对应
L1 机器指标常规 ML 分数分类 AUROC/F1;生成 PPL;回归 R²L1
L2 生物学合理性学到的东西符不符合已知生物学注意力/显著性是否落在已知 motif上;预测的调控边是否命中已知 TF–靶基因;生成序列是否保留功能基序L2
L3 决策/实验价值结论能否驱动真实验预测的候选位点值不值得去做湿实验验证;ROI 排序对不对L3

实践结论:论文里只报 L1 是不够的,审稿人会问”你确定不是泄漏/捷径?“——用 L2(motif 恢复、已知调控边命中)自证清白,用 L3 说明价值。这正是你 RL Phase 4 那套 L1→L2→L3 的生物版。

  • motif 恢复:模型对启动子的高关注区,应落在已知植物 TF motif(如 W-box、G-box)上。
  • 已知调控边命中:预测的调控关系,应能召回你数据库里已验证的基因调控字段
  • 跨物种一致性:同源基因在近缘树种间的预测应大体一致(配 OrthologTransformer 思路)。

3.10 开题 Go/No-Go:一页纸决定”要不要上 Transformer”

Section titled “3.10 开题 Go/No-Go:一页纸决定”要不要上 Transformer””

直觉:Transformer 不是默认答案,是”够复杂才请出来”的重武器

Section titled “直觉:Transformer 不是默认答案,是”够复杂才请出来”的重武器”

很多生物问题用不上 Transformer——局部 motif 问题一个 PWM/CNN 就打平甚至更好,还省算力、更可解释。开题时先用下面这张清单过一遍(对齐你 RL 系列的 rl_go_nogo_checklist)。

示意图
你的情况推荐方案别做什么
局部 motif(TFBS、短元件)PWM / CNN / GBDT baseline别一上来堆大 Transformer
长程 / 条件依赖(增强子-启动子、多组学调控)Transformer(稀疏/SSM 长上下文)别用切窗切断长程
标签少 🌲(树种注释稀缺)预训练底座 + 线性探测 / PEFT别从头训、别全量微调
要生成(设计启动子/蛋白)Decoder(Evo 2/ESM-3)+ 硬生物约束解码别让它生成非法序列
算力不匹配PEFT + 小窗 + 检索增强;或 SSM 骨架别硬上百万上下文

开题铁律(可贴墙上)

  1. 先 baseline 后 Transformer——PWM/CNN 打不平再上重武器。
  2. 划分干净 > 换注意力——数据泄漏比架构选择更致命(3.6)。
  3. 双栏评估——L1 机器指标 + L2 生物合理性,缺一不可(3.9)。
  4. 底座 + CPT + LoRA——别从头训,复用 OmniGene 那套(3.8)。
  5. CPT ≠ RL——域适配用 CPT,别错请 RL(呼应 RL Phase 4)。

① 三物理量 → 选型速查

物理量小 →大 →
序列长度 L常规注意力 EncoderSSM/稀疏(Evo 2 路线)
信号范围局部→CNN/PWM baseline长程→Transformer
带标签数据少→底座+线性探测/PEFT多→可微调/从头

② 三支柱模型 → 用途速查

支柱主用途你的落点
Evo 2超长 DNA、生成、变异树木大基因组、跨域 CPT
DNABERT-2 / NTDNA 取嵌入植物多物种迁移
ESM-2 / ESM-3蛋白表征 / 生成蛋白功能、互作

③ 开题五铁律:baseline 先行 · 划分干净 · 双栏评估 · 底座+CPT+LoRA · CPT≠RL。


说明:以上部分链接指向期刊主域或预印本平台;正文标注的年份/结论以对应论文摘要为准,落地前请以全文为准。🌲 植物/树木条目为本章重点,篇幅与举例均按 植物>人/医学>动物=微生物 的优先级组织。


第3章 完成 ✅ —— 至此,Transformer 系统学习路径「基础 → 进阶 → 生物向」三阶段正文全部展开。回到 总览 查看完整推荐顺序。