跳转到内容

ESM3 与 ESM C:当前蛋白语言模型两条主线

到 2026 年,ESM 生态最值得直接关注的是两条当前路线:

  • ESM3:序列、结构和功能联合建模,核心用途是可控蛋白生成与设计;
  • ESM C(ESM Cambrian):面向蛋白序列表征和下游迁移学习。

二者不是“同一个模型大小不同”,而是目标不同的平行模型族。

目标当前更合适的入口
生成新蛋白ESM3
用序列/结构/功能条件控制生成ESM3
提取蛋白 embeddingESM C
少量标签的分类/回归ESM C + 简单下游模型
做蛋白序列聚类、检索或表示分析ESM C

最重要的不是模型名字,而是不要把表示学习结果和生成设计结果混成同一类证据。

2. ESM3:序列、结构、功能联合生成

Section titled “2. ESM3:序列、结构、功能联合生成”

ESM3 的正式论文发表于 Science 2025。模型同时处理三种主要模态:

  • protein sequence;
  • protein structure;
  • protein function annotations。

这使它可以接受跨模态 prompt,例如给定部分结构约束、功能描述或序列上下文,再生成满足条件的候选蛋白。

论文最著名的实验之一是生成远离已知天然序列的荧光蛋白,并对部分候选进行了真实合成和功能测试。这个结果的重要性在于:模型生成并不是只停留在 in silico score,而是至少对一个代表性设计任务做了实验闭环。

但这不能外推成“ESM3 生成的任意蛋白都具有目标功能”。不同任务仍需要单独实验验证。

3. ESM3 更适合“设计”,不是通用实验替代品

Section titled “3. ESM3 更适合“设计”,不是通用实验替代品”

ESM3 可以用于:

  • sequence completion;
  • structure-conditioned generation;
  • function-conditioned generation;
  • multimodal protein design;
  • 对已有蛋白进行条件化改造。

生成后的候选仍需要经过:

ESM3 generation
sequence / structure / function-specific filtering
independent structure prediction or biophysical checks
expression / stability / activity / binding experiments

模型生成分数、结构置信度和实验功能是不同证据层级。

ESM C 是 EvolutionaryScale 发布的蛋白表示模型族,与 ESM3 平行发展。其主要目标不是生成复杂多模态蛋白,而是从蛋白序列中得到可迁移的 contextual representation。

公开模型包括多个规模,适合提取:

  • residue-level embeddings;
  • protein-level embeddings;
  • 下游分类和回归特征。

对科研项目,最常见的使用方式是冻结模型提取 embedding,再用轻量分类器、回归器或任务特定 head 做训练。

这通常比直接对大模型做全参数微调更容易判断:性能提升究竟来自预训练表示,还是来自下游模型复杂度。

5. embedding 分开不等于机制被解释

Section titled “5. embedding 分开不等于机制被解释”

ESM C embedding 做 PCA、UMAP 或聚类时,如果不同功能类群分开,只能说明表示中存在可分信息。

它不能单独证明:

  • 模型找到了真正决定功能的残基;
  • 某个聚类对应独立生物学机制;
  • embedding 距离可以直接解释为进化距离;
  • 下游预测具有因果意义。

需要位点机制时,应进一步结合 mutagenesis、结构、保守性和实验数据。

6. 下游任务最重要的是防止同源泄漏

Section titled “6. 下游任务最重要的是防止同源泄漏”

蛋白数据中最常见的高估来源之一,是随机 train/test split。

高度相似的 homolog 如果同时进入训练集和测试集,模型可能只是利用近邻序列,而不是学习可泛化的功能规律。

更稳妥的评估包括:

  • sequence-identity clustering 后再划分;
  • family-aware split;
  • remote-homology split;
  • 时间切分;
  • 对目标蛋白家族做 leave-family-out 测试。

这往往比“换更大的 embedding model”更影响结果可信度。

7. ESM3 与 ESM C 的证据状态要分开写

Section titled “7. ESM3 与 ESM C 的证据状态要分开写”

ESM3 的核心模型和代表性生成实验已有 Science 同行评议论文。

ESM C 是当前官方表示学习模型族,并已经被多个后续研究采用;但在引用时应区分官方模型发布/预印本与正式同行评议论文,不应为了显得“更新”而把两者写成同一种证据等级。

对植物蛋白,当前最现实的两类入口是:

使用 ESM C 提取 embedding,再结合:

  • 亚细胞定位;
  • 酶类别;
  • 抗病相关蛋白分类;
  • TF / receptor / enzyme family 任务;
  • 突变或自然变异表型。

评估时必须做家族级或同源感知划分。

使用 ESM3 时,先明确可实验的目标,例如:

  • 特定结构约束;
  • 指定功能域或活性位点;
  • 稳定性优化;
  • 结合或催化任务。

没有明确实验 readout 时,生成大量序列的科研价值有限。

需要 embedding / 表示学习
ESM C
需要 sequence + structure + function 条件生成
ESM3

如果项目最终要声称“功能改变”,无论使用哪一条路线,都需要任务特异的独立验证。

本页导航

目录