跳转到内容

DNA 基础模型 2026:AlphaGenome 与 Evo 2

到 2026 年,如果目标是理解当前 DNA 基础模型,最值得先分清的是两条主线:AlphaGenome 做 sequence-to-function,Evo 2 做长上下文基因组建模与生成。

二者都能处理很长 DNA,但训练目标、输出和证据含义完全不同。不要因为它们都能输入约百万级序列,就把它们当成同一类模型。

模型核心任务上下文主要输出
AlphaGenomeDNA 序列 → 功能基因组信号最长 1 Mb表达、转录起始、染色质可及性、组蛋白修饰、TF 结合、染色质接触、剪接等
Evo 2自回归基因组建模与生成最长 1M token序列概率、零样本变异评分、长序列生成与设计

最简单的判断是:

  • 你要问“这段 DNA 会产生什么分子功能信号?”——优先看 AlphaGenome。
  • 你要问“这段序列在基因组分布中是否合理,或能否生成新的长 DNA?”——优先看 Evo 2。

2. AlphaGenome:把 1 Mb DNA 映射到多模态功能信号

Section titled “2. AlphaGenome:把 1 Mb DNA 映射到多模态功能信号”

AlphaGenome 在 2026 年正式发表于 Nature。模型以最长 1 Mb DNA 序列为输入,同时预测数千条功能基因组轨迹,并在不同任务上提供最高到单碱基分辨率的输出。

覆盖的主要模态包括:

  • gene expression;
  • transcription initiation;
  • chromatin accessibility;
  • histone modifications;
  • transcription factor binding;
  • chromatin contact maps;
  • splice-site usage;
  • splice-junction coordinates and strength。

因此它的核心价值不是“上下文很长”,而是把长上下文、多模态输出和变异效应预测放进同一个模型。

最直接的场景是非编码调控与变异优先级排序。对 reference / alternate allele 分别预测,再比较输出差异,可以得到某个变异对特定分子信号的预测效应。

但这个差值仍然是模型预测的分子效应,不是因果事实。一个 SNP 即使在模型中显著改变 TF binding 或 expression track,也还需要遗传、组学或扰动实验支持。

3. Evo 2:百万级上下文的生成式基因组模型

Section titled “3. Evo 2:百万级上下文的生成式基因组模型”

Evo 2 于 2026 年发表于 Nature。训练数据来自所有生命域的非冗余核酸序列,总规模超过 8.8 万亿核苷酸,模型规模包括 7B 和 40B。

Evo 2 使用 StripedHyena 2,它不是标准 Transformer,而是一个 convolutional multi-hybrid architecture,将多种 Hyena 类 input-dependent convolution operators 与 attention 组合起来。

模型通过多阶段训练把上下文扩展到 100 万碱基/约 100 万 token,并展示了:

  • 长上下文序列建模;
  • 零样本变异效应评分;
  • 对外显子—内含子边界、TF binding 等序列规律的学习;
  • 跨原核、真核和细胞器基因组的序列生成;
  • 在生成阶段结合搜索或外部评分施加约束。

这里最需要避免的误读是:能生成长 DNA 不等于生成序列具有目标功能。生成质量、功能预测和实验功能仍然是三个层级。

4. AlphaGenome 和 Evo 2 不应该直接比“谁更强”

Section titled “4. AlphaGenome 和 Evo 2 不应该直接比“谁更强””

二者优化目标不同:

AlphaGenome
DNA sequence ──> measured molecular phenotypes
Evo 2
DNA context ──> next-base distribution / sequence likelihood / generation

AlphaGenome 更接近“从序列预测实验读出”;Evo 2 更接近“学习基因组序列分布并进行生成”。

因此评价也不同:

  • AlphaGenome 重点看 track prediction、variant-effect benchmark 和不同模态的泛化;
  • Evo 2 重点看 sequence likelihood、long-context retrieval、zero-shot scoring 和生成结果的独立功能评价。

两个模型都把上下文推进到了百万级,但“模型能输入 1 Mb”不能自动翻译成“模型在你的任务里有效利用了 1 Mb”。

真正需要验证的是:

  1. 增加远端上下文是否提高目标任务性能;
  2. 模型是否利用了真实长程调控,而不是局部 motif;
  3. 测试划分是否避免同源序列、相邻窗口和重复区域泄漏;
  4. 输出是否经过与研究问题匹配的独立实验验证。

6. 植物和林木:不要直接假设人类调控模型可迁移

Section titled “6. 植物和林木:不要直接假设人类调控模型可迁移”

对杨树、林木和非模式植物,最重要的问题不是“哪个模型参数更多”,而是 domain shift

实际应用前至少检查:

  • 训练数据是否覆盖植物或近缘谱系;
  • 目标任务是局部 motif、TF 结合、表达、剪接还是染色体尺度调控;
  • 是否采用染色体级、家族级或同源感知的 train/test split;
  • 转座元件、基因家族扩张和倍性是否导致额外泄漏;
  • 是否有本物种 ATAC-seq、DAP/ChIP-seq、RNA-seq、QTL/eQTL 或遗传数据做独立验证。

如果是植物功能预测,AlphaGenome 更适合作为迁移能力需要被验证的 sequence-to-function 架构;如果是跨生命域序列建模或生成,Evo 2 的训练范围更直接覆盖植物,但生成序列仍需要功能层验证。

目标当前起点
非编码变异、表达、染色质、剪接效应AlphaGenome
长 DNA 概率建模、zero-shot sequence scoringEvo 2
长序列生成与基因组设计探索Evo 2
植物/林木功能预测先做目标物种 benchmark,再决定是否迁移 AlphaGenome
植物/林木长序列生成Evo 2 可作为当前起点,但必须增加独立功能验证
本页导航

目录