DNA 基础模型 2026:AlphaGenome 与 Evo 2
到 2026 年,如果目标是理解当前 DNA 基础模型,最值得先分清的是两条主线:AlphaGenome 做 sequence-to-function,Evo 2 做长上下文基因组建模与生成。
二者都能处理很长 DNA,但训练目标、输出和证据含义完全不同。不要因为它们都能输入约百万级序列,就把它们当成同一类模型。
1. 当前两条主线
Section titled “1. 当前两条主线”| 模型 | 核心任务 | 上下文 | 主要输出 |
|---|---|---|---|
| AlphaGenome | DNA 序列 → 功能基因组信号 | 最长 1 Mb | 表达、转录起始、染色质可及性、组蛋白修饰、TF 结合、染色质接触、剪接等 |
| Evo 2 | 自回归基因组建模与生成 | 最长 1M token | 序列概率、零样本变异评分、长序列生成与设计 |
最简单的判断是:
- 你要问“这段 DNA 会产生什么分子功能信号?”——优先看 AlphaGenome。
- 你要问“这段序列在基因组分布中是否合理,或能否生成新的长 DNA?”——优先看 Evo 2。
2. AlphaGenome:把 1 Mb DNA 映射到多模态功能信号
Section titled “2. AlphaGenome:把 1 Mb DNA 映射到多模态功能信号”AlphaGenome 在 2026 年正式发表于 Nature。模型以最长 1 Mb DNA 序列为输入,同时预测数千条功能基因组轨迹,并在不同任务上提供最高到单碱基分辨率的输出。
覆盖的主要模态包括:
- gene expression;
- transcription initiation;
- chromatin accessibility;
- histone modifications;
- transcription factor binding;
- chromatin contact maps;
- splice-site usage;
- splice-junction coordinates and strength。
因此它的核心价值不是“上下文很长”,而是把长上下文、多模态输出和变异效应预测放进同一个模型。
AlphaGenome 最适合什么
Section titled “AlphaGenome 最适合什么”最直接的场景是非编码调控与变异优先级排序。对 reference / alternate allele 分别预测,再比较输出差异,可以得到某个变异对特定分子信号的预测效应。
但这个差值仍然是模型预测的分子效应,不是因果事实。一个 SNP 即使在模型中显著改变 TF binding 或 expression track,也还需要遗传、组学或扰动实验支持。
3. Evo 2:百万级上下文的生成式基因组模型
Section titled “3. Evo 2:百万级上下文的生成式基因组模型”Evo 2 于 2026 年发表于 Nature。训练数据来自所有生命域的非冗余核酸序列,总规模超过 8.8 万亿核苷酸,模型规模包括 7B 和 40B。
Evo 2 使用 StripedHyena 2,它不是标准 Transformer,而是一个 convolutional multi-hybrid architecture,将多种 Hyena 类 input-dependent convolution operators 与 attention 组合起来。
模型通过多阶段训练把上下文扩展到 100 万碱基/约 100 万 token,并展示了:
- 长上下文序列建模;
- 零样本变异效应评分;
- 对外显子—内含子边界、TF binding 等序列规律的学习;
- 跨原核、真核和细胞器基因组的序列生成;
- 在生成阶段结合搜索或外部评分施加约束。
这里最需要避免的误读是:能生成长 DNA 不等于生成序列具有目标功能。生成质量、功能预测和实验功能仍然是三个层级。
4. AlphaGenome 和 Evo 2 不应该直接比“谁更强”
Section titled “4. AlphaGenome 和 Evo 2 不应该直接比“谁更强””二者优化目标不同:
AlphaGenomeDNA sequence ──> measured molecular phenotypes
Evo 2DNA context ──> next-base distribution / sequence likelihood / generationAlphaGenome 更接近“从序列预测实验读出”;Evo 2 更接近“学习基因组序列分布并进行生成”。
因此评价也不同:
- AlphaGenome 重点看 track prediction、variant-effect benchmark 和不同模态的泛化;
- Evo 2 重点看 sequence likelihood、long-context retrieval、zero-shot scoring 和生成结果的独立功能评价。
5. 最大 context 不是科研结论
Section titled “5. 最大 context 不是科研结论”两个模型都把上下文推进到了百万级,但“模型能输入 1 Mb”不能自动翻译成“模型在你的任务里有效利用了 1 Mb”。
真正需要验证的是:
- 增加远端上下文是否提高目标任务性能;
- 模型是否利用了真实长程调控,而不是局部 motif;
- 测试划分是否避免同源序列、相邻窗口和重复区域泄漏;
- 输出是否经过与研究问题匹配的独立实验验证。
6. 植物和林木:不要直接假设人类调控模型可迁移
Section titled “6. 植物和林木:不要直接假设人类调控模型可迁移”对杨树、林木和非模式植物,最重要的问题不是“哪个模型参数更多”,而是 domain shift。
实际应用前至少检查:
- 训练数据是否覆盖植物或近缘谱系;
- 目标任务是局部 motif、TF 结合、表达、剪接还是染色体尺度调控;
- 是否采用染色体级、家族级或同源感知的 train/test split;
- 转座元件、基因家族扩张和倍性是否导致额外泄漏;
- 是否有本物种 ATAC-seq、DAP/ChIP-seq、RNA-seq、QTL/eQTL 或遗传数据做独立验证。
如果是植物功能预测,AlphaGenome 更适合作为迁移能力需要被验证的 sequence-to-function 架构;如果是跨生命域序列建模或生成,Evo 2 的训练范围更直接覆盖植物,但生成序列仍需要功能层验证。
7. 2026 年的最小选择规则
Section titled “7. 2026 年的最小选择规则”| 目标 | 当前起点 |
|---|---|
| 非编码变异、表达、染色质、剪接效应 | AlphaGenome |
| 长 DNA 概率建模、zero-shot sequence scoring | Evo 2 |
| 长序列生成与基因组设计探索 | Evo 2 |
| 植物/林木功能预测 | 先做目标物种 benchmark,再决定是否迁移 AlphaGenome |
| 植物/林木长序列生成 | Evo 2 可作为当前起点,但必须增加独立功能验证 |
- Avsec Ž, et al. (2026). Advancing regulatory variant effect prediction with AlphaGenome. Nature 649:1206–1218.
- Brixi G, et al. (2026). Genome modelling and design across all domains of life with Evo 2. Nature.
- Arc Institute Evo 2 官方仓库
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。