Transformer 系统学习路径:第3章 · 生物向
分类:
machine-learning/transformer· 风格:专业 + 科普 · 少公式 · 重直觉
状态:✅ 正文展开完成(风格对齐第1章–2:专业 + 科普 · 少公式 · 重直觉 · 图解 + 表格 + Mermaid) 前置:总览 · 第1章 · 第2章 范围:非图像 —— DNA / RNA / 蛋白 / 单细胞 / 多组学 / 互作 / 调控 优先级:🌲 植物 / 树木 > 🧑⚕️ 人 / 医学 > 🐾 动物 = 🦠 微生物(举例与篇幅按此权重) 对接你的资产:森林树木多组学数据库(甲基化 token、开放染色质、基因调控字段)· OmniGene-4 类 CPT 知识线
0. 一张地图:生物向 Transformer 全景
Section titled “0. 一张地图:生物向 Transformer 全景”第1章 教你「注意力怎么算」,第2章 教你「怎么训得动、调得省」。第3章 只回答一件事:
把生物数据塞进 Transformer 之前,你要做的所有决定。
这些决定不是玄学,它们由三个物理量决定——序列有多长、信号是局部还是长程、你有多少带标签的数据。记住这句话,本章所有选型都能顺出来。
flowchart TB
DATA["你的生物数据<br/>DNA / RNA / 蛋白 / 表达矩阵"] --> TOK["3.1 Tokenization<br/>怎么切成 token"]
TOK --> LEN{"序列有多长?"}
LEN -->|"短~中(启动子/蛋白)"| ARCH["常规 Transformer<br/>Encoder-only 取表征"]
LEN -->|"超长(全基因组)"| LONG["3.2 长序列骨架<br/>稀疏注意力 / SSM 混合"]
ARCH --> TASK["3.6 任务设计<br/>分类/回归/生成"]
LONG --> TASK
TASK --> SIG{"信号是局部还是长程?"}
SIG -->|"局部 motif"| BASE["先跑 baseline<br/>PWM / CNN"]
SIG -->|"长程/条件"| TF["Transformer 才划算"]
TF --> MULTI["3.7 多组学融合<br/>甲基化/染色质旁路"]
MULTI --> CPT["3.8 CPT 域适配<br/>λ_mix 防遗忘"]
CPT --> EVAL["3.9 双栏评估<br/>ML指标 + 生物合理性"]
EVAL --> GO["3.10 开题 Go/No-Go"] 本章三根支柱模型(后文反复引用,先混个脸熟):
| 支柱 | 是什么 | 一句话直觉 | 对应你哪条线 |
|---|---|---|---|
| Evo 2 | 跨全生命域 DNA 生成模型,9.3T bp、100 万 token 上下文 | DNA 界的 GPT,能”读完整条染色体” | 超长序列 / 跨域 CPT |
| DNABERT-2 / Nucleotide Transformer | 多物种 DNA 编码器 | 取嵌入做下游任务的主力 | 植物多物种迁移 |
| ESM-2 / ESM-3 | 蛋白语言模型 | 一条氨基酸序列 → 一串”懂结构功能”的向量 | 蛋白功能 / 互作 |
3.1 生物序列 Tokenization:一切的起点
Section titled “3.1 生物序列 Tokenization:一切的起点”直觉:token 粒度 = 你戴的”眼镜度数”
Section titled “直觉:token 粒度 = 你戴的”眼镜度数””第1章 说过:Transformer 先把输入切成 token,再查嵌入表。生物序列没有天然的”词”,所以怎么切就是你替模型做的第一个、也是最影响全局的决定。切法决定了两件事:序列变多长(L) 和 模型能不能看见你关心的模式。
flowchart LR SEQ["ATGGCATTGCAA..."] --> S1["单碱基<br/>A T G G C A...<br/>L 最长, 分辨率最高"] SEQ --> S2["k-mer(如6)<br/>ATGGCA TGGCAT...<br/>词表爆炸, 稀有k-mer多"] SEQ --> S3["BPE 子词<br/>ATG GCATT GCAA<br/>自适应频率, L 更短 ✅"]
四种主流切法与选型表
Section titled “四种主流切法与选型表”| 切法 | 怎么切 | 优点 | 痛点 | 什么时候用 |
|---|---|---|---|---|
| 单碱基 (char) | 每个 A/T/G/C 一个 token | 分辨率最高,单点变异看得清 | L 太长,算力爆 | 变异效应、超长模型(Evo 2 就是单碱基级) |
| k-mer | 每 k 个碱基一段 | 保留局部模式 | 词表随 k 指数膨胀,稀有 k-mer 学不好;相邻 k-mer 高度重叠冗余 | 早期方法,现在少用 |
| BPE 子词 ✅ | 按语料频率自动合并高频片段 | L 更短、词表可控、稀有片段被拆解 | 边界不含生物学含义 | 当今 DNA 主流(DNABERT-2 用 BPE 替换 k-mer)citation:DNABERT-2 · arXiv |
| 氨基酸 / codon | 蛋白按 20 种氨基酸;DNA 可按密码子三联体 | 天然对齐生物单位 | codon 需定阅读框 | 蛋白 LM(ESM 系)、编码区分析 |
实践结论:DNA 任务默认从 BPE(DNABERT-2 / NT)起步;蛋白任务用氨基酸级(ESM-2);只有当你要极致单点分辨率或超长上下文(Evo 2 路线)才回到单碱基。这与第1章”token 越细 L 越长、越吃算力”的口令完全一致。
特殊 token:把”元信息”喂进去
Section titled “特殊 token:把”元信息”喂进去”自然语言有 [CLS] [SEP] [MASK];生物序列可以自定义更有用的特殊 token:
| 特殊 token | 作用 | 你的场景 |
|---|---|---|
[MASK] | MLM 预训练遮盖 | Encoder-only 底座(第2章 §1 的 MLM 目标) |
<物种> / <染色体> / <链> | 告诉模型上下文来源 | 🌲 多树种联合训练时区分物种,减少负迁移 |
<甲基化> / <开放染色质> | 把表观信号编进序列流 | 直接对接你数据库的甲基化 token 字段(详见 3.7) |
| 反向互补增强 | 正链/负链都喂 | 数据增强,但注意别让同一区域同时进训练集和测试集 → 泄漏 |
🌲 植物 / 树木特别提示
Section titled “🌲 植物 / 树木特别提示”- 植物 DNA 底座目前多以 Nucleotide Transformer(850 物种多物种编码器) citation:Nucleotide Transformer · Nature Methods 或 HuggingFace
zhangtaolab系列 Plant DNA FM(BPE tokenizer) 为起点。 - 多物种联合词表是双刃剑:能借近缘物种数据,但远缘物种可能带来负迁移 → 用
<物种>token + 后续 CPT(3.8)来缓解。 - 树木大基因组(如针叶树可达 20+ Gb)不要整条塞,先想清楚 3.2 的长序列策略。
自问三题(写进你的开题笔记)
Section titled “自问三题(写进你的开题笔记)”- 我的序列平均多长?切成 token 后 L 大概多少?(用第1章 的
[B, L, d]口令推一遍) - 我关心的信号有多大?(单点 SNP → 要细粒度;motif → k-mer/BPE 够;调控网络 → 要长程)
- 要不要生成序列?要 → 后面架构得留 Decoder;只做预测 → Encoder-only 最省。
3.2 基因组尺度与超长序列:当 L 大到算力扛不住
Section titled “3.2 基因组尺度与超长序列:当 L 大到算力扛不住”直觉:注意力的”平方诅咒”
Section titled “直觉:注意力的”平方诅咒””第1章 讲过,标准自注意力要让每个 token 看所有 token——计算量随序列长度 L 的平方增长。基因组动辄几百万、几十亿碱基,L² 直接爆炸。所以超长序列的核心矛盾就是:既想看得远,又算不起。 解决思路只有四类:
flowchart TB LONG["超长序列(全基因组)"] --> A["① 切窗滑动<br/>分段处理再拼"] LONG --> B["② 稀疏/线性注意力<br/>只看部分token对"] LONG --> C["③ 换骨架: SSM/卷积<br/>Mamba/Hyena, 线性复杂度"] LONG --> D["④ 检索增强<br/>只调关键片段"] A --> NOTE1["简单但可能切断长程依赖"] B --> NOTE2["保留注意力形式, 折中"] C --> NOTE3["天生适合长序列, 但对'精确配对'弱"] D --> NOTE4["工程重, 适合库检索场景"]
四条路线对照表
Section titled “四条路线对照表”| 路线 | 代表 | 复杂度 | 优点 | 代价 | 适合 |
|---|---|---|---|---|---|
| 切窗滑动 | 大多数 BERT 类 DNA 模型 | O(窗²)×窗数 | 实现简单,复用现成模型 | 窗口边界切断增强子-启动子这类远距离依赖 | 局部任务(启动子识别) |
| 稀疏注意力 | Longformer 式 | 近线性 | 仍是注意力,长程可选保留 | 稀疏模式要手工设计 | 中长序列 |
| SSM / 卷积混合骨架 ✅ | HyenaDNA、Caduceus、Mamba | 线性 O(L) | 天生吃超长序列,显存友好 | 对”精确 token 配对”不如注意力灵 | 全基因组、超长上下文 |
| 注意力 + SSM 混合 | Evo 2、MTMixG-Net | 线性为主 | 兼顾长程与局部 | 架构复杂 | 前沿大模型 |
对接第2章:这就是第2章 §3「不全是 softmax 注意力」的落地——长序列场景里,换骨架(Mamba/SSM)往往比堆注意力更实在。RoPE/ALiBi 这类相对位置编码在这里也关键,因为它们支持”训练时短、推理时外推更长”。
- Evo 2(Nature 2026):9.3T bp 训练,100 万 token 上下文,单碱基分辨率,跨细菌/古菌/真核三域。它用注意力 + SSM 混合骨架才扛得住百万级上下文 citation:Genome modeling and design across all domains of life with Evo 2。
- 🧑⚕️ AlphaGenome(2025):把 100 万碱基上下文用于变异效应预测,一次读入长片段判断一个变异对表达、剪接、染色质的综合影响 citation:AlphaGenome · DeepMind。
- 🌲 MTMixG-Net(Front Plant Sci 2025):植物基因组任务里用 Transformer + Mamba 混合,正是”注意力管局部、SSM 管长程”的植物版实证 citation:MTMixG-Net · Frontiers in Plant Science。
🌲 树木大基因组的现实建议
Section titled “🌲 树木大基因组的现实建议”| 情况 | 建议 |
|---|---|
| 只关心某类局部元件(启动子、TFBS) | 切窗 + Encoder-only 就够,别上百万上下文 |
| 关心增强子-启动子远程调控 | 稀疏注意力或 SSM 混合,配 RoPE 外推 |
| 树种基因组巨大、算力有限 | 优先 SSM 骨架(线性显存)+ 分层处理,绝不整条直塞 |
| 想复用现成底座 | 先用 NT / DNABERT-2 取窗口嵌入再拼接,避免从头训超长模型 |
3.3 转录组 / 单细胞:当”序列”其实是一张表达表
Section titled “3.3 转录组 / 单细胞:当”序列”其实是一张表达表”直觉:这里没有”顺序”,只有”哪些基因、表达多少”
Section titled “直觉:这里没有”顺序”,只有”哪些基因、表达多少””DNA/蛋白是有顺序的字符串,但单细胞表达数据是一个 细胞 × 基因 的大矩阵——每个细胞就是”一堆基因各自表达了多少”。这带来一个根本问题:
表达数据更像一个”集合”,而不是一句有先后的话。 所以 tokenization 和位置编码的玩法完全不同。
flowchart LR CELL["一个细胞的表达谱"] --> M1["方案A: 基因名当token<br/>按表达量排序成'句子'<br/>(Geneformer 路线)"] CELL --> M2["方案B: 基因名token + 表达值编码<br/>(scGPT 路线)"] M1 --> USE["取细胞嵌入<br/>做细胞类型分类/轨迹"] M2 --> USE
两种主流编码思路
Section titled “两种主流编码思路”| 思路 | 怎么做 | 代表 | 直觉 |
|---|---|---|---|
| 表达排序法 | 每个细胞里的基因按表达量从高到低排成一个”句子”,基因名=token,位置=排名 | Geneformer | 用”谁更活跃”的相对顺序替代绝对数值,天然抗批次差异 |
| 基因名 + 数值 | 基因名做 token,表达值单独编码进去 | scGPT、scBERT | 保留定量信息,但要小心不同实验的数值尺度 |
最大的坑:batch 效应 = 捷径学习
Section titled “最大的坑:batch 效应 = 捷径学习”不同批次、不同测序平台的数据有系统性差异(batch 效应)。若训练/测试划分没处理好,模型可能靠”这是哪个批次”来蒙对答案,而不是真学到生物信号——这就是第2章 反复警告的捷径学习。
评估划分铁律:按批次 / 供体 / 物种留出测试集,而不是随机打乱。否则 AUROC 虚高,一到新数据就崩。
前沿:跨物种转录组底座
Section titled “前沿:跨物种转录组底座”- TranscriptFormer(Science 2026):跨物种转录组基础模型,学到可迁移的细胞状态表征 citation:TranscriptFormer · Science。
- 🌲 Plant single-cell genomics with foundation models(Curr Opin Plant Biol 2024):综述植物单细胞 FM 的机会与难点——植物细胞类型注释缺参考、跨组织差异大,是迁移学习的重点战场 citation:Plant single-cell with FM · Current Opinion in Plant Biology。
- 🌲 OrthologTransformer(Nat Commun 2026):用直系同源关系做跨物种基因对齐,正好呼应你做的比较基因组——把一个物种学到的表达规律迁移到近缘树种 citation:Nature Communications。
🌲 给森林树木多组学的落地建议
Section titled “🌲 给森林树木多组学的落地建议”- 树种单细胞参考稀缺 → 优先迁移:用 TranscriptFormer/scGPT 底座取嵌入,接简单分类头(线性探测),而非从头训。
- 想跨树种迁移 → 用直系同源映射(OrthologTransformer 思路)统一基因命名,再联合建模。
- 表达 + 序列想一起用 → 见 3.7 的多组学融合。
3.4 蛋白语言模型与结构 / 功能:一条氨基酸序列能”读懂”多少
Section titled “3.4 蛋白语言模型与结构 / 功能:一条氨基酸序列能”读懂”多少”直觉:蛋白 LM 就是”学会了蛋白语法”的 BERT/GPT
Section titled “直觉:蛋白 LM 就是”学会了蛋白语法”的 BERT/GPT”蛋白由 20 种氨基酸串成。蛋白语言模型(PLM)做的事和 NLP 里的 BERT 一模一样:用 MLM(遮盖预测) 在海量蛋白序列上预训练,学会”哪些氨基酸组合合理、哪些位置重要”。学完后,任意一条序列丢进去,就能吐出一串懂结构与功能的向量。
flowchart LR SEQ["氨基酸序列<br/>MKTAYIAK..."] --> ESM["ESM-2<br/>(MLM 预训练 Encoder)"] ESM --> EMB["每残基向量 [L,d]<br/>+ 整条蛋白向量"] EMB --> T1["功能注释(零样本)"] EMB --> T2["接线性头: 定位/稳定性"] EMB --> T3["接触/结构预测"]
三代 ESM,看清演进逻辑
Section titled “三代 ESM,看清演进逻辑”| 模型 | 规模 | 关键点 | 直觉 |
|---|---|---|---|
| ESM-2 | 650M / 3B / 15B | 纯序列 MLM,取嵌入是下游主力 | ”只读序列就能猜出结构信号” citation:ESM-2 · Technology Networks |
| ESM-3 | 多模态 | 序列 + 结构 + 功能三种 token 一起建模,能生成新蛋白 | ”不止读,还能按结构/功能约束创作” |
| InstructPLM-mu | 在 ESM-2 上 | 1 小时 PEFT 微调即追平 ESM-3 | 低成本适配的典范,呼应第2章 §6 PEFT citation:InstructPLM-mu · arXiv |
关键结论:不必总追最大模型。 InstructPLM-mu 证明——在 ESM-2 上花 1 小时做 PEFT(LoRA 类),就能逼近专门训练的 ESM-3。这对算力有限的你极其重要:先拿现成底座 + 轻量微调,别急着从头训。
用法三档(从省到贵)
Section titled “用法三档(从省到贵)”- 零样本嵌入 + 线性探测 🌲:ESM-2 取向量,接一个逻辑回归/线性头 → 这就是”植物蛋白用 ESM-2 embedding + 线性头”的标准打法,几乎不花算力。
- PEFT 微调:数据稍多时,LoRA 插件式微调(对接第2章 §6/§9),保留底座、只训小插件。
- 结构/生成:需要设计新蛋白才用 ESM-3 这类多模态生成模型,且必须加硬性生物约束解码(见 3.10)。
🌲 植物 / 树木蛋白的现实建议
Section titled “🌲 植物 / 树木蛋白的现实建议”- 植物蛋白注释稀缺 → 零样本嵌入 + 简单头是性价比之王,别一上来就微调大模型。
- 想做蛋白功能预测(如抗逆相关蛋白)→ ESM-2 embedding 已能捕获大量结构信号,配少量标注即可起步。
- 蛋白与 DNA 联合(如 TF 蛋白 ↔ 结合位点)→ 见 3.5 的双塔 / 交叉注意力。
3.5 互作、调控与序列对:两条序列怎么”谈恋爱”
Section titled “3.5 互作、调控与序列对:两条序列怎么”谈恋爱””直觉:从”读一条”到”判断两条的关系”
Section titled “直觉:从”读一条”到”判断两条的关系””前面都是喂一条序列。但很多生物问题是两条序列的关系:
- 蛋白–蛋白互作(PPI):这两个蛋白会不会结合?
- TF–DNA:这个转录因子会不会结合这段启动子?
- RBP–RNA:这个 RNA 结合蛋白会不会抓住这段 RNA?
处理”序列对”有三种经典架构,选型直接决定成本与精度:
flowchart TB PAIR["序列对 A, B"] --> C1["① 拼接输入<br/>[A][SEP][B] 一起进模型"] PAIR --> C2["② 双塔(Siamese)<br/>各自编码, 再比对向量"] PAIR --> C3["③ 交叉注意力<br/>A 看 B, B 看 A"] C1 --> R1["交互最充分, 但每对都要重算, 贵"] C2 --> R2["可预存嵌入, 海量筛选快 ✅"] C3 --> R3["精度高, 折中成本"]
三种架构对照
Section titled “三种架构对照”| 架构 | 交互程度 | 成本 | 适合 |
|---|---|---|---|
| 拼接输入 | 最强(全交互) | 高(每对重算) | 对数不多、要求精度 |
| 双塔 ✅ | 弱(只在末端比对) | 低(嵌入可预存、可复用) | 海量候选筛选(先用双塔粗筛) |
| 交叉注意力 | 强 | 中 | 精排、机制研究 |
实战策略:双塔粗筛 + 交叉注意力精排。先用双塔把海量候选对快速打分(嵌入预存复用),再对 top 候选用交叉注意力精算。这套”粗筛→精排”思路和搜索引擎完全一样。
图 + 序列:调控网络的天然结构
Section titled “图 + 序列:调控网络的天然结构”PPI 网络、基因调控网络本质是图。前沿做法是把序列编码器(学节点特征)+ 图结构(学连接)结合——序列给”是什么”,图给”和谁连”。
🔑 困难负例:直接对接你的 HGT 检测经验
Section titled “🔑 困难负例:直接对接你的 HGT 检测经验”互作/调控模型最大的陷阱是负样本太easy:随机配一对不相关序列,模型轻松学会区分,AUROC 虚高,实战却废。必须构造困难负例——形态相似但真不结合的对。
对接你的 HGT 检测:你在水平基因转移检测里设计”困难负例”(序列相似但非 HGT)的经验,可以原封不动搬到互作模型的负样本设计上。困难负例的质量,往往比换什么注意力更决定成败(呼应 3.6)。
🌲🧑⚕️ 案例
Section titled “🌲🧑⚕️ 案例”- 🌲 TF–DNA(植物调控):植物转录因子结合位点预测,正是”TF 蛋白序列 × 启动子 DNA”的序列对问题,可用双塔或交叉注意力,配 PWM/motif 做可解释校验(见 3.9)。
- 🧑⚕️ PPI:人类蛋白互作预测常用 ESM-2 双塔嵌入 + 分类头,成本低、可大规模筛。
3.6 预测任务设计:题目怎么出,比用什么模型更重要
Section titled “3.6 预测任务设计:题目怎么出,比用什么模型更重要”直觉:一半的成败在”出题”,不在”模型”
Section titled “直觉:一半的成败在”出题”,不在”模型””生物向 Transformer 的常见任务其实就几类:
flowchart TB Y["你要预测什么?"] --> A["位点/元件识别<br/>启动子·增强子·剪接位点"] Y --> B["变异效应<br/>这个突变有害吗?"] Y --> C["表达/表型回归<br/>预测表达量·性状"] Y --> D["序列设计/生成<br/>造一段新启动子"] A --> HEAD["→ 分类头"] B --> HEAD C --> REG["→ 回归头"] D --> GEN["→ Decoder + 硬约束解码"]
| 任务类型 | 头部 | 底座建议 | 典型陷阱 |
|---|---|---|---|
| 位点/元件识别 | 分类头 | Encoder-only 取嵌入 | 正负样本比例失衡 |
| 变异效应 | 打分/分类 | 单碱基分辨率(Evo 2/AlphaGenome) | 参考等位与变异等位要对齐 |
| 表达/表型回归 | 回归头 | 序列 + 多组学(3.7) | 批次/环境混杂 |
| 序列设计 | Decoder 生成 | Evo 2 / ESM-3 | 生成不合法序列 |
🔑 第一性原则:标签怎么划分 > 换什么注意力
Section titled “🔑 第一性原则:标签怎么划分 > 换什么注意力”这是本章最重要的一句话,请贴在开题笔记最上方:
调换注意力机制带来的提升,往往远小于一次数据泄漏造成的虚高。
生物数据的”泄漏”极其隐蔽:同一基因家族的同源序列、同一染色体的相邻区域、反向互补的同一片段——若它们同时出现在训练集和测试集,模型就是在”背答案”。
正确的划分方式(按你研究对象选):
| 划分依据 | 防的是什么泄漏 | 适合 |
|---|---|---|
| 按基因家族 | 同源序列泄漏 | 蛋白/基因功能预测 |
| 按染色体 | 邻近区域泄漏 | 基因组元件识别 |
| 按物种 🌲 | 近缘物种泄漏 | 跨树种迁移评估 |
| 时间/批次 | 批次捷径 | 单细胞、时序 |
实践结论:开题时先花力气把训练/测试划分做干净(按家族/染色体/物种留出),再谈模型。一个划分干净的 CNN baseline,常比划分脏的 Transformer 更可信。
3.7 基因调控与多组学融合:把甲基化、染色质喂进模型
Section titled “3.7 基因调控与多组学融合:把甲基化、染色质喂进模型”直觉:光有 DNA 序列不够,还要”当时的状态”
Section titled “直觉:光有 DNA 序列不够,还要”当时的状态””一段 DNA 会不会被转录,不只看序列本身,还看它当时的表观状态——甲基化程度、染色质开不开放、组蛋白修饰。这正是你的森林树木多组学数据库的核心字段。问题是:怎么把这些”旁路信号”喂进以序列为主的 Transformer?
flowchart TB
DNA["DNA 序列(主输入)"] --> ENC["序列编码器"]
METH["甲基化<br/>开放染色质<br/>组蛋白修饰"] --> WAY{"三种喂法"}
WAY --> W1["① 专用 token<br/>把状态编成额外token并入序列"]
WAY --> W2["② 条件输入<br/>作为附加通道/条件向量"]
WAY --> W3["③ 旁路分支<br/>单独编码器再融合"]
W1 --> ENC
W2 --> ENC
W3 --> FUSE["特征融合"]
ENC --> FUSE
FUSE --> OUT["调控预测<br/>表达/结合/开放性"] 三种融合方式对照
Section titled “三种融合方式对照”| 方式 | 怎么做 | 优点 | 缺点 | 你的场景 |
|---|---|---|---|---|
| 专用 token | 甲基化/染色质离散化成 token,插进序列流 | 简单,复用现成架构 | 增加 L;离散化损失精度 | 直接对接你数据库的甲基化 token 字段 |
| 条件输入 | 表观信号作为附加通道或条件向量 | 保留连续值 | 需改输入层 | 开放染色质连续信号 |
| 旁路分支 | 每种组学单独编码器,末端融合 | 灵活,缺哪个组学都能跑 | 参数多 | 多组学不全时最稳 |
对接前沿:多模态基础 Transformer(Nat Methods 2025/2026 系列,如 NicheTrans 做空间多组学)证明旁路分支 + 融合在组学不全时最鲁棒——这对你”某些树种缺甲基化数据”的现实特别有用 citation:NicheTrans · Nature Methods。
TF 基序(局部)× 长程染色质(远程)
Section titled “TF 基序(局部)× 长程染色质(远程)”基因调控天生是局部 + 长程的混合信号:
- 局部:TF 结合基序(motif),几十 bp 内的模式 → 卷积/局部注意力就能抓。
- 长程:增强子隔着几十上百 kb 调控启动子 → 需要长上下文(3.2 的 SSM/稀疏注意力)。
所以调控模型往往要局部 + 长程双管齐下,这也是 Evo 2、AlphaGenome 这类长上下文模型的用武之地。
🌲 森林树木多组学:把数据库变成”训练行”
Section titled “🌲 森林树木多组学:把数据库变成”训练行””你的数据库(甲基化、开放染色质、基因调控字段)可以这样接入:
| 数据库字段 | 融合方式 | 变成什么 |
|---|---|---|
| 甲基化 token | 专用 token 并入序列 | 每个位点带”甲基化状态”标记 |
| 开放染色质 | 条件通道 | 连续开放性信号 |
| 基因调控关系 | 图结构(配 3.5 图+序列) | 调控网络的边 |
| 缺失组学的树种 | 旁路分支(可缺省) | 缺哪个跑哪个 |
物种转移思路:数据全的树种上训好,用 CPT(3.8)迁到数据少的树种;缺失组学用旁路分支的”可缺省”设计兜底。
3.8 CPT、灾难性遗忘与域适配:把通用底座”驯化”成林木专家
Section titled “3.8 CPT、灾难性遗忘与域适配:把通用底座”驯化”成林木专家”直觉:站在巨人肩膀上,但别把巨人推下去
Section titled “直觉:站在巨人肩膀上,但别把巨人推下去”从头训一个 DNA/蛋白大模型你训不起。正确姿势是拿现成通用底座(Evo 2 / NT / ESM-2)→ 在你的林木数据上继续预训练(CPT, Continued Pre-Training)→ 变成林木专家。但这里有个著名陷阱:
灾难性遗忘:只用林木数据狂训,模型会把原来学到的通用生物知识忘光,最后”精而脆”——林木任务好一点点,别的全崩。
flowchart LR
BASE["通用底座<br/>Evo2/NT/ESM-2"] --> CPT["CPT 继续预训练<br/>喂林木多组学"]
CPT --> RISK{"只喂林木数据?"}
RISK -->|"是"| FORGET["灾难性遗忘<br/>通用能力崩塌 ❌"]
RISK -->|"混入通用数据<br/>λ_mix 配比"| SAFE["林木专家<br/>且不忘本 ✅"]
SAFE --> PEFT["或用 LoRA 插件化<br/>底座冻结, 换任务换插件"] 三个防遗忘手段(对接第2章 §6/§9 与 OmniGene 线)
Section titled “三个防遗忘手段(对接第2章 §6/§9 与 OmniGene 线)”| 手段 | 做法 | 直觉 | 对接 |
|---|---|---|---|
| 数据回放 + λ_mix 配比 | CPT 时按比例 λ_mix 混入通用数据 | 一边学新的,一边复习旧的 | 你在 OmniGene-4 CPT 里的核心变量 |
| LoRA 插件化 | 冻结底座,只训小插件;不同任务换不同插件 | 底座不动就不会忘;插件可插拔 | 第2章 §6 PEFT |
| 回放缓冲 | 保留一小份原始预训练样本反复喂 | 定期”回炉”防漂移 | 经典防遗忘 |
λ_mix 的直觉:它是”复习旧知识 vs 学习新知识”的旋钮。λ_mix 偏大 → 保通用、林木学得慢;偏小 → 林木快、易遗忘。这是你 CPT 实验里最该调的超参之一,和 OmniGene-4 那条线完全一致。
🔑 关键边界:CPT ≠ RL(呼应你的 RL 系列 Phase 4)
Section titled “🔑 关键边界:CPT ≠ RL(呼应你的 RL 系列 Phase 4)”这条你在强化学习 Phase 4 已经反复确认,这里再钉一次,避免混淆:
CPT 是”继续用自监督/预测目标喂知识”,靠 λ_mix 防遗忘;RL 是”用奖励信号对齐行为”,靠 KL 约束防跑偏。两者的”防漂移旋钮”不是一个东西(λ_mix ≠ KL),别混用。
生物底座的域适配几乎总是 CPT(+可选 SFT),而不是 RL。RL 只在你要”按某个目标函数优化生成序列”(如设计高结合力蛋白)时才登场,且要极其小心奖励作弊。
🌲 森林树木 CPT 落地路线
Section titled “🌲 森林树木 CPT 落地路线”flowchart TB S1["Step1: 选底座<br/>DNA→NT/Evo2, 蛋白→ESM-2"] --> S2["Step2: CPT<br/>林木多组学 + λ_mix 混通用"] S2 --> S3["Step3: 任务适配<br/>LoRA 插件 / 线性探测"] S3 --> S4["Step4: 双栏评估<br/>见 3.9"] S4 --> S5["Step5: 缺失组学树种<br/>旁路分支 + 物种转移"]
实践结论:林木底座 = 通用底座 + CPT(λ_mix 防遗忘)+ LoRA 任务插件。这套和你 OmniGene-4 的知识线同构,可直接复用你已有的 CPT 认知,别当成新东西。
3.9 评估协议:别只看 AUROC,要看”生物学上说得通吗”
Section titled “3.9 评估协议:别只看 AUROC,要看”生物学上说得通吗””直觉:机器学习指标高 ≠ 学到了真生物
Section titled “直觉:机器学习指标高 ≠ 学到了真生物”一个模型 AUROC 0.95,可能是真本事,也可能是背了泄漏答案 / 抓了批次捷径。所以生物向评估必须双栏并行:一栏看机器学习指标,一栏看生物学合理性。这套三级结构和你 RL 系列的 L1→L2→L3 完全同构。
flowchart TB M["模型输出"] --> L1["L1 机器学习指标<br/>AUROC / F1 / PPL"] M --> L2["L2 生物学合理性<br/>motif 恢复 / 已知调控边命中"] M --> L3["L3 决策/实验价值<br/>能否指导下一步实验"] L1 --> V["三级都过, 才算可信"] L2 --> V L3 --> V
三级评估栈(照抄进开题)
Section titled “三级评估栈(照抄进开题)”| 级别 | 看什么 | 例子 | 与 RL 系列对应 |
|---|---|---|---|
| L1 机器指标 | 常规 ML 分数 | 分类 AUROC/F1;生成 PPL;回归 R² | L1 |
| L2 生物学合理性 | 学到的东西符不符合已知生物学 | 注意力/显著性是否落在已知 motif上;预测的调控边是否命中已知 TF–靶基因;生成序列是否保留功能基序 | L2 |
| L3 决策/实验价值 | 结论能否驱动真实验 | 预测的候选位点值不值得去做湿实验验证;ROI 排序对不对 | L3 |
实践结论:论文里只报 L1 是不够的,审稿人会问”你确定不是泄漏/捷径?“——用 L2(motif 恢复、已知调控边命中)自证清白,用 L3 说明价值。这正是你 RL Phase 4 那套 L1→L2→L3 的生物版。
🌲 森林树木的 L2 抓手
Section titled “🌲 森林树木的 L2 抓手”- motif 恢复:模型对启动子的高关注区,应落在已知植物 TF motif(如 W-box、G-box)上。
- 已知调控边命中:预测的调控关系,应能召回你数据库里已验证的基因调控字段。
- 跨物种一致性:同源基因在近缘树种间的预测应大体一致(配 OrthologTransformer 思路)。
3.10 开题 Go/No-Go:一页纸决定”要不要上 Transformer”
Section titled “3.10 开题 Go/No-Go:一页纸决定”要不要上 Transformer””直觉:Transformer 不是默认答案,是”够复杂才请出来”的重武器
Section titled “直觉:Transformer 不是默认答案,是”够复杂才请出来”的重武器”很多生物问题用不上 Transformer——局部 motif 问题一个 PWM/CNN 就打平甚至更好,还省算力、更可解释。开题时先用下面这张清单过一遍(对齐你 RL 系列的 rl_go_nogo_checklist)。
flowchart TB
Q1{"信号是局部 motif 吗?"} -->|"是"| B1["先跑 PWM / CNN / GBDT<br/>baseline 打平就别上 TF"]
Q1 -->|"否, 长程/条件依赖"| Q2{"带标签数据多吗?"}
Q2 -->|"少"| B2["预训练底座 + 简单头<br/>(线性探测/PEFT)"]
Q2 -->|"多"| Q3{"要生成序列吗?"}
Q3 -->|"是"| B3["Decoder + 硬生物约束解码"]
Q3 -->|"否"| B4["Encoder-only + 分类/回归头"]
Q2 --> Q4{"算力够吗?"}
Q4 -->|"不够"| B5["PEFT / 小窗 / 检索增强"] 一页纸 Go/No-Go 决策表
Section titled “一页纸 Go/No-Go 决策表”| 你的情况 | 推荐方案 | 别做什么 |
|---|---|---|
| 局部 motif(TFBS、短元件) | PWM / CNN / GBDT baseline | 别一上来堆大 Transformer |
| 长程 / 条件依赖(增强子-启动子、多组学调控) | Transformer(稀疏/SSM 长上下文) | 别用切窗切断长程 |
| 标签少 🌲(树种注释稀缺) | 预训练底座 + 线性探测 / PEFT | 别从头训、别全量微调 |
| 要生成(设计启动子/蛋白) | Decoder(Evo 2/ESM-3)+ 硬生物约束解码 | 别让它生成非法序列 |
| 算力不匹配 | PEFT + 小窗 + 检索增强;或 SSM 骨架 | 别硬上百万上下文 |
开题铁律(可贴墙上):
- 先 baseline 后 Transformer——PWM/CNN 打不平再上重武器。
- 划分干净 > 换注意力——数据泄漏比架构选择更致命(3.6)。
- 双栏评估——L1 机器指标 + L2 生物合理性,缺一不可(3.9)。
- 底座 + CPT + LoRA——别从头训,复用 OmniGene 那套(3.8)。
- CPT ≠ RL——域适配用 CPT,别错请 RL(呼应 RL Phase 4)。
第3章 收尾:三张表带走
Section titled “第3章 收尾:三张表带走”① 三物理量 → 选型速查
| 物理量 | 小 → | 大 → |
|---|---|---|
| 序列长度 L | 常规注意力 Encoder | SSM/稀疏(Evo 2 路线) |
| 信号范围 | 局部→CNN/PWM baseline | 长程→Transformer |
| 带标签数据 | 少→底座+线性探测/PEFT | 多→可微调/从头 |
② 三支柱模型 → 用途速查
| 支柱 | 主用途 | 你的落点 |
|---|---|---|
| Evo 2 | 超长 DNA、生成、变异 | 树木大基因组、跨域 CPT |
| DNABERT-2 / NT | DNA 取嵌入 | 植物多物种迁移 |
| ESM-2 / ESM-3 | 蛋白表征 / 生成 | 蛋白功能、互作 |
③ 开题五铁律:baseline 先行 · 划分干净 · 双栏评估 · 底座+CPT+LoRA · CPT≠RL。
DNA / 基因组
Section titled “DNA / 基因组”- Genome modeling and design across all domains of life with Evo 2 — Evo 2,9.3T bp、100 万 token 上下文、单碱基、跨三域,注意力+SSM 混合骨架。
- DNABERT-2 · arXiv — 用 BPE 替换 k-mer 的多物种 DNA 编码器。
- Nucleotide Transformer · Nature Methods — 850 物种多物种 DNA 编码器,植物子集可作底座。
- AlphaGenome · DeepMind — 100 万碱基上下文用于变异效应预测。
- ESM-2 · Technology Networks — 纯序列 MLM 蛋白语言模型,取嵌入为下游主力。
- InstructPLM-mu · arXiv — 在 ESM-2 上 1 小时 PEFT 即追平 ESM-3,低成本适配典范。
单细胞 / 转录组
Section titled “单细胞 / 转录组”- TranscriptFormer · Science — 跨物种转录组基础模型。
- Plant single-cell with FM · Current Opinion in Plant Biology — 植物单细胞基础模型综述。
植物 / 树木(重点)
Section titled “植物 / 树木(重点)”- MTMixG-Net · Frontiers in Plant Science — 植物基因组 Transformer + Mamba 混合。
- OrthologTransformer · Nature Communications — 直系同源跨物种基因对齐,衔接比较基因组。
- NicheTrans · Nature Methods — 空间多组学多模态 Transformer,旁路分支融合。
说明:以上部分链接指向期刊主域或预印本平台;正文标注的年份/结论以对应论文摘要为准,落地前请以全文为准。🌲 植物/树木条目为本章重点,篇幅与举例均按 植物>人/医学>动物=微生物 的优先级组织。
第3章 完成 ✅ —— 至此,Transformer 系统学习路径「基础 → 进阶 → 生物向」三阶段正文全部展开。回到 总览 查看完整推荐顺序。
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。