ESM3 与 ESM C:当前蛋白语言模型两条主线
到 2026 年,ESM 生态最值得直接关注的是两条当前路线:
- ESM3:序列、结构和功能联合建模,核心用途是可控蛋白生成与设计;
- ESM C(ESM Cambrian):面向蛋白序列表征和下游迁移学习。
二者不是“同一个模型大小不同”,而是目标不同的平行模型族。
1. 先按任务选 ESM3 还是 ESM C
Section titled “1. 先按任务选 ESM3 还是 ESM C”| 目标 | 当前更合适的入口 |
|---|---|
| 生成新蛋白 | ESM3 |
| 用序列/结构/功能条件控制生成 | ESM3 |
| 提取蛋白 embedding | ESM C |
| 少量标签的分类/回归 | ESM C + 简单下游模型 |
| 做蛋白序列聚类、检索或表示分析 | ESM C |
最重要的不是模型名字,而是不要把表示学习结果和生成设计结果混成同一类证据。
2. ESM3:序列、结构、功能联合生成
Section titled “2. ESM3:序列、结构、功能联合生成”ESM3 的正式论文发表于 Science 2025。模型同时处理三种主要模态:
- protein sequence;
- protein structure;
- protein function annotations。
这使它可以接受跨模态 prompt,例如给定部分结构约束、功能描述或序列上下文,再生成满足条件的候选蛋白。
论文最著名的实验之一是生成远离已知天然序列的荧光蛋白,并对部分候选进行了真实合成和功能测试。这个结果的重要性在于:模型生成并不是只停留在 in silico score,而是至少对一个代表性设计任务做了实验闭环。
但这不能外推成“ESM3 生成的任意蛋白都具有目标功能”。不同任务仍需要单独实验验证。
3. ESM3 更适合“设计”,不是通用实验替代品
Section titled “3. ESM3 更适合“设计”,不是通用实验替代品”ESM3 可以用于:
- sequence completion;
- structure-conditioned generation;
- function-conditioned generation;
- multimodal protein design;
- 对已有蛋白进行条件化改造。
生成后的候选仍需要经过:
ESM3 generation ↓sequence / structure / function-specific filtering ↓independent structure prediction or biophysical checks ↓expression / stability / activity / binding experiments模型生成分数、结构置信度和实验功能是不同证据层级。
4. ESM C:当前的表示学习路线
Section titled “4. ESM C:当前的表示学习路线”ESM C 是 EvolutionaryScale 发布的蛋白表示模型族,与 ESM3 平行发展。其主要目标不是生成复杂多模态蛋白,而是从蛋白序列中得到可迁移的 contextual representation。
公开模型包括多个规模,适合提取:
- residue-level embeddings;
- protein-level embeddings;
- 下游分类和回归特征。
对科研项目,最常见的使用方式是冻结模型提取 embedding,再用轻量分类器、回归器或任务特定 head 做训练。
这通常比直接对大模型做全参数微调更容易判断:性能提升究竟来自预训练表示,还是来自下游模型复杂度。
5. embedding 分开不等于机制被解释
Section titled “5. embedding 分开不等于机制被解释”ESM C embedding 做 PCA、UMAP 或聚类时,如果不同功能类群分开,只能说明表示中存在可分信息。
它不能单独证明:
- 模型找到了真正决定功能的残基;
- 某个聚类对应独立生物学机制;
- embedding 距离可以直接解释为进化距离;
- 下游预测具有因果意义。
需要位点机制时,应进一步结合 mutagenesis、结构、保守性和实验数据。
6. 下游任务最重要的是防止同源泄漏
Section titled “6. 下游任务最重要的是防止同源泄漏”蛋白数据中最常见的高估来源之一,是随机 train/test split。
高度相似的 homolog 如果同时进入训练集和测试集,模型可能只是利用近邻序列,而不是学习可泛化的功能规律。
更稳妥的评估包括:
- sequence-identity clustering 后再划分;
- family-aware split;
- remote-homology split;
- 时间切分;
- 对目标蛋白家族做 leave-family-out 测试。
这往往比“换更大的 embedding model”更影响结果可信度。
7. ESM3 与 ESM C 的证据状态要分开写
Section titled “7. ESM3 与 ESM C 的证据状态要分开写”ESM3 的核心模型和代表性生成实验已有 Science 同行评议论文。
ESM C 是当前官方表示学习模型族,并已经被多个后续研究采用;但在引用时应区分官方模型发布/预印本与正式同行评议论文,不应为了显得“更新”而把两者写成同一种证据等级。
8. 植物和林木怎么用
Section titled “8. 植物和林木怎么用”对植物蛋白,当前最现实的两类入口是:
表示与功能预测
Section titled “表示与功能预测”使用 ESM C 提取 embedding,再结合:
- 亚细胞定位;
- 酶类别;
- 抗病相关蛋白分类;
- TF / receptor / enzyme family 任务;
- 突变或自然变异表型。
评估时必须做家族级或同源感知划分。
蛋白生成与设计
Section titled “蛋白生成与设计”使用 ESM3 时,先明确可实验的目标,例如:
- 特定结构约束;
- 指定功能域或活性位点;
- 稳定性优化;
- 结合或催化任务。
没有明确实验 readout 时,生成大量序列的科研价值有限。
9. 2026 年最小选择规则
Section titled “9. 2026 年最小选择规则”需要 embedding / 表示学习 ↓ ESM C
需要 sequence + structure + function 条件生成 ↓ ESM3如果项目最终要声称“功能改变”,无论使用哪一条路线,都需要任务特异的独立验证。
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。