扩散模型教程第5章:五大机制族
本章是系列第 5 章:把纷繁的扩散变体收编成五大机制族,讲清每族换了什么、代价是什么、何时该换。不罗列模型清单——那是导航页的活,本章讲原理与取舍。 前置:第 2 章(DDPM 机制)、第 3 章(三式)。读完本章你会有一张”看到任何新扩散论文都能快速归类”的地图。 系列内:具体模型清单见 扩散模型导航;采样加速的实战调参见 第 6 章 训练与采样旋钮;隐空间扩散深入见 隐空间扩散深入。
1. 本章目标与验收标准
Section titled “1. 本章目标与验收标准”学完本章,你应能在不看笔记的情况下完成下列自检:
- 说出”四维度替换”框架的四个维度,并用它归类任意一个扩散变体。
- 讲清连续高斯、离散、流匹配、少步蒸馏、几何等变五大机制族各自”换了什么”。
- 对流匹配、一致性模型,各说出”它换的是哪一维、代价是什么”。
- 解释为什么蛋白/分子生成必须用几何等变族,而不能直接套图像那套。
- 拿一个新论文标题,判断它大致属于哪一族、要付什么代价。
字数与深度定位:机制地图章(约 8500–12000 汉字)。不推导每族的完整数学、不罗列模型清单(去导航页)、不教具体实现。
2. 先建立一张地图:四维度替换框架
Section titled “2. 先建立一张地图:四维度替换框架”扩散模型的变体多到令人眩晕——DDPM、DDIM、Score SDE、EDM、D3PM、Flow Matching、Rectified Flow、Consistency Models、LCM、DiT、LDM、RFdiffusion……初学者最容易犯的错,是把每个名字当成一个独立的新模型去背。
正确的做法是建立一个”替换坐标系”。任何一个扩散变体,无论名字多花哨,本质都是在同一个基础框架(第 2、3 章讲的 DDPM 三式)上,换掉了四个维度里的一个或几个:
flowchart TB Base["DDPM 基础框架<br/>加噪 → 去噪 → 采样"] --> D1["维度① 建模空间<br/>像素 / latent / 结构 / 图"] Base --> D2["维度② 噪声→数据路径<br/>随机 SDE / 直线 ODE"] Base --> D3["维度③ 网络主干<br/>U-Net / Transformer(DiT)"] Base --> D4["维度④ 采样步数<br/>多步 / 少步 / 一步"]
| 维度 | 在换什么 | 代表性变化 |
|---|---|---|
| ① 建模空间 | 在什么空间上加噪去噪 | 像素 → latent(LDM)→ SE(3) 结构(RFdiffusion)→ 图(分子图扩散)→ 离散类别(D3PM) |
| ② 路径 | 噪声到数据怎么走 | 弯曲随机 SDE(DDPM)→ 尽量直的确定 ODE(Flow Matching / Rectified Flow) |
| ③ 主干 | 用什么网络去噪 | U-Net(经典)→ Transformer(DiT)→ 等变网络(结构/分子) |
| ④ 步数 | 采样跑几步 | 多步(DDPM 1000 步)→ 少步(DDIM 20 步)→ 一步(一致性模型、蒸馏) |
这张表是本章的总纲。接下来讲的五大机制族,其实就是这四个维度上几种最重要的替换组合。学会这个框架后,你读任何新论文的第一个动作就变成:“它在这四维里换了哪几个?换的代价是什么?“——而不是”又一个要背的新模型”。
为什么恰好是这四个维度:你可能会好奇,为什么不是五个、六个维度?答案是:这四个正好对应扩散框架的四个可独立替换的模块——①建模空间决定”在哪里表示数据、加什么样的噪声”,②路径决定”噪声到数据的演化方程”,③主干决定”用什么网络拟合去噪函数”,④步数决定”采样时积分这条路径的离散化程度”。它们大体正交(换其中一个不强制改动另外三个),且覆盖了从数学建模到网络架构到采样策略的完整链条。当然你也可以细分出更多维度(比如把”条件注入方式”单列),但那样分类会过细、记忆负担反增——这四维是”粗细适中、实用性最强”的切分。
2.1 五大机制族与四维度的对应
Section titled “2.1 五大机制族与四维度的对应”先给一张”族 × 维度”的对照,后面逐族展开:
| 机制族 | 主要换了哪一维 | 一句话定位 |
|---|---|---|
| 连续高斯(DDPM/Score SDE 系) | 都不换(基准族) | 最成熟、生态最好,默认起点 |
| 离散扩散 | ① 建模空间(连续→离散) | 序列 / 图 / 分类变量专用 |
| 流匹配 / Rectified Flow | ② 路径(弯→直) | 路径取直,采样更少步,SD3/Flux 在用 |
| 少步 / 蒸馏(一致性 / LCM) | ④ 步数(多→一) | 把多步压成 1–4 步,实时交互用 |
| 几何 / 等变 | ①③(结构空间 + 等变主干) | 蛋白、分子 3D 生成的必选项 |
注意:这五族不是互斥的。一个真实模型常常同时属于多族——比如 Stable Diffusion 3 = 流匹配(②)+ latent 空间(①)+ DiT 主干(③)。四维度框架的价值正在于此:它让你能把一个复合模型拆解成”在每一维上的选择”,而不是当成一个不可分解的黑箱。
3. 机制族一:连续高斯扩散(基准族)
Section titled “3. 机制族一:连续高斯扩散(基准族)”这是第 2、3 章讲的经典 DDPM 所属的族,也是所有其他族的参照系。理解它”没换什么”,才能理解别的族”换了什么”。
3.1 它的定位
Section titled “3.1 它的定位”- 建模空间:连续欧氏空间(像素、latent 向量、连续坐标)。
- 路径:高斯加噪,弯曲的随机路径(SDE 视角)。
- 主干:经典是 U-Net。
- 步数:训练 1000 步网格,采样 20–1000 步。
代表:DDPM、DDIM、ADM(Guided Diffusion)、EDM(Karras)、Score SDE。这些具体模型的清单在导航页,本章只需知道它们共享同一套连续高斯机制。
3.2 为什么它是”默认起点”
Section titled “3.2 为什么它是”默认起点””连续高斯族有三个别的族短期难以撼动的优势:
- 理论完备:离散马尔可夫链(DDPM)和连续 SDE(Score SDE)两套视角可以互相印证,数学基础最扎实(第 2 章 §8)。这一点值得多说一句——同一个连续高斯扩散,可以从两个完全不同的角度推导出来:一是把它看成”1000 步离散马尔可夫链”(DDPM 的原始视角,适合工程实现),二是把它看成”连续时间的随机微分方程”(Score SDE 视角,适合理论分析和设计高阶采样器)。两套视角得到的采样公式在极限下一致,互为验证。这种”多个独立推导殊途同归”的性质,是一个数学框架成熟稳固的标志,也是别的机制族短期难以追上的底气。
- 生态最好:diffusers 等主流框架的默认实现、绝大多数预训练权重、最多的教程和踩坑经验,都在这个族。
- 适配面最广:图像、隐空间、蛋白结构(配等变网络)、几乎所有连续型数据都能用。
一句话选择建议:不确定选什么时,从连续高斯族起步,尤其是配 latent 空间用(即 LDM)。等你明确遇到了它的软肋(太慢、数据是离散的、要 3D 等变),再考虑换族。
3.3 它的软肋,正是其他族的动机
Section titled “3.3 它的软肋,正是其他族的动机”| 连续高斯的软肋 | 催生了哪一族 |
|---|---|
| 采样多步、慢 | 少步 / 蒸馏族(§6)、流匹配族(§5) |
| 只能处理连续数据 | 离散扩散族(§4) |
| U-Net 难 scale 到超大模型 | DiT 主干(§7) |
| 直接在像素上算力爆炸 | latent 空间(LDM,§7) |
| 不保证 3D 旋转平移等变 | 几何等变族(§8) |
这张表把整章串起来了:后面每一族,都是在解连续高斯族的某一个具体痛点。
举两个具体例子帮你内化这张表:
-
蛋白骨架生成(RFdiffusion):蛋白是 3D 结构、整体旋转不改变意义——连续高斯的”不保证等变”这一软肋在这里是致命的,必须换到几何等变族。同时蛋白的原子数多、直接在坐标上扩散算力爆炸,所以 RFdiffusion 还换了建模空间(在 SE(3) frame 上而非裸坐标),解决了”算力爆炸”那条软肋。这是两个软肋同时命中、两个维度同时替换的例子。
-
Stable Diffusion:图像生成本身连续高斯族够用,但”512×512 像素直接扩散算力爆炸”——所以 SD 换了建模空间(先 VAE 压到 64×64 latent 再扩散),解决算力问题的同时保留了连续高斯族的成熟生态。它没换路径(仍是经典 SDE/ODE)、没换主干(SD 1.x/2.x 仍是 U-Net),只在空间这一维做了替换——这正是”四维度正交”的体现。
4. 机制族二:离散扩散(换建模空间的数据类型)
Section titled “4. 机制族二:离散扩散(换建模空间的数据类型)”4.1 换了什么
Section titled “4.1 换了什么”连续高斯扩散的前提是”数据在连续空间、能加高斯噪声”。但很多生物数据是离散的:
- 氨基酸序列(20 种氨基酸的类别序列);
- 分子图(原子类型是离散类别、键是离散的存在/类型);
- DNA/RNA 序列(4 种碱基);
- 任何分类变量。
对离散数据,“加一点高斯噪声”根本无从谈起——你没法给”丙氨酸”这个类别加 0.3 的高斯扰动。离散扩散换的就是”加噪”这个操作本身:
- 前向加噪:不是加高斯,而是按概率把当前类别翻转成其他类别,或翻成一个特殊的”吸收态 / 掩码态”。走到最后,整条序列变成纯随机类别或全是掩码。
- 反向去噪:网络预测”这个位置原本最可能是哪个类别”,逐步把随机/掩码恢复成有意义的序列。
这里的”加噪”具体怎么实现,有两种主流设计,理解它们的差别能帮你读懂离散扩散论文:
- 均匀翻转(uniform):每一步以某概率把当前类别随机换成任意其他类别,走到最后是”完全随机的类别序列”。类比连续高斯里的”加噪到纯噪声”。
- 吸收态 / 掩码(absorbing / masked):每一步以某概率把当前类别换成一个特殊的
[MASK]符号,且一旦变成[MASK]就不再改变(“吸收”),走到最后是”全[MASK]”。反向去噪就是逐步把[MASK]填回真实类别——这和 BERT 式的掩码预测非常像,也是为什么很多离散扩散能复用语言模型的工程经验。
两种设计对应不同的转移矩阵(描述”类别 i 变成类别 j 的概率”的表),掩码式往往更好训、和现有 NLP 基建更兼容,是近年更常见的选择。
flowchart LR subgraph 连续["连续高斯"] C0["真实向量"] -->|"加高斯噪声"| C1["带噪向量"] -->|"..."| C2["纯高斯噪声"] end subgraph 离散["离散扩散"] D0["真实序列 ACDEF"] -->|"按概率翻转类别"| D1["部分翻转 ACMEF"] -->|"..."| D2["纯随机/全掩码"] end
4.2 代表与代价
Section titled “4.2 代表与代价”代表:D3PM(离散去噪扩散概率模型)家族,以及各种序列/图上的离散扩散。具体清单见导航页 §3.4。
代价与取舍:
- 优点:离散约束天然满足——生成氨基酸序列不会冒出”半个氨基酸”,生成分子图化合价更容易合法。
- 代价:数学不如连续高斯优雅(转移矩阵的设计有很多选择),生态和预训练资源远少于连续族。
- 一个重要的对手:在序列生成上,离散扩散要和自回归模型(GPT 那套)竞争。很多任务上自回归更简单、更快、精度更高——所以离散扩散不是”离散数据的唯一选择”,而是”当你需要非自回归的、可并行的、可迭代精炼的离散生成”时的选项。
离散扩散 vs 自回归:何时该选哪个(这是生物序列生成里的真实决策):
自回归模型(Transformer decoder 那套)的优势在于有明确因果链的序列任务——每个位置依赖前面的、有清晰的左到右顺序、监督信号充足。典型场景:给定蛋白骨架反推序列(ProteinMPNN)、给定上文续写氨基酸、RNA 设计(每个碱基配对约束清晰)。这些任务上自回归训练简单、推理快(一次前向几十 token)、精度高。
离散扩散的优势在于需要全局一致性、无明确因果顺序、或需迭代精炼的任务——比如分子图生成(所有原子/键要同时满足化学约束,没有”先生成哪个原子”的自然顺序)、多约束序列优化(要同时满足几个冲突目标,迭代修改比一遍生成更合理)、或者需要”部分重采样”(只改一段、其他不动)的场景。这时离散扩散的”可并行、可迭代、可部分去噪”价值才体现。
一句话判断:序列有清晰因果链 + 监督充足 → 先试自回归;需要全局约束或迭代精炼 → 离散扩散。生物里这两条路都活跃,不是”扩散一定更好”。
4.3 一个必须澄清的边界:ProteinMPNN 不是离散扩散
Section titled “4.3 一个必须澄清的边界:ProteinMPNN 不是离散扩散”第 8 章讲过:RFdiffusion 产骨架后,序列由 ProteinMPNN 反推。ProteinMPNN 处理的是离散氨基酸,但它不是离散扩散——它是”消息传递 + 自回归解码”的监督模型。
这正好说明一件事:离散数据 ≠ 必须用离散扩散。当输出空间离散、监督信号明确、无需分布探索时(如给定骨架反推序列),一个自回归/监督模型往往比离散扩散更合适。这一点第 7 章”什么任务不该用扩散”里详细讲过。
5. 机制族三:流匹配 / Rectified Flow(换路径)
Section titled “5. 机制族三:流匹配 / Rectified Flow(换路径)”5.1 换了什么
Section titled “5.1 换了什么”这是 2024–2025 最热的一族——Stable Diffusion 3、Flux 都用了它。你会越来越频繁地撞见 “Flow Matching”、“Rectified Flow”、“velocity prediction” 这些词。
关键认知:它不是推翻扩散,而是换了一种”从噪声到数据的走法”。 用四维度框架看,它主要换的是维度②:路径。
| 维度 | 经典扩散(DDPM) | 流匹配 / Rectified Flow |
|---|---|---|
| 建模空间 | 像素 / latent / 结构 | 同 |
| 噪声→数据路径 | 随机 SDE、弯曲 | 直线 ODE、尽量取直 |
| 训练目标 | 预测噪声 ε | 预测速度场 v(把噪声搬向数据的方向) |
| 采样 | 多步 SDE / ODE 求解 | 少步 ODE 积分(路径更直 → 更少步) |
5.2 为什么”路径取直”能少步
Section titled “5.2 为什么”路径取直”能少步”flowchart LR subgraph 扩散["经典扩散:弯曲路径"] N1["噪声"] -.弯.-> M1["中间"] -.弯.-> DA1["数据"] end subgraph 流匹配["流匹配:尽量直"] N2["噪声"] --直--> DA2["数据"] end
直觉很简单:如果从噪声到数据的路径是一条弯弯曲曲的曲线,你用大步长的数值积分去走,很容易”冲出弯道”、积累误差,所以必须走很多小步。如果路径接近直线,那用很少几步、甚至一大步,都能走得很准。
流匹配的训练目标就是学一个速度场——在每个时刻、每个位置,告诉你”往哪个方向走、走多快”才能把噪声搬到数据。Rectified Flow 更进一步,用 “reflow” 技巧反复把路径拉直,最终可以做到极少步甚至一步采样。
把”速度场”这个词说得更具体一点:想象噪声空间里的每个点都是一滴水,数据分布是它们最终要流到的湖。速度场就是一张”水流地图”,告诉每一滴水在每个时刻该朝哪个方向、以多快速度移动。经典扩散学的是”这里有多少噪声”(预测 ε),流匹配学的是”这里的水该往哪流”(预测 v)——两者信息等价,但速度场的视角天然对应”沿一条路径积分”,而积分一条直路径显然比积分一条弯路径省步数。这也解释了为什么第 2 章讲的 v-prediction 是通向流匹配的桥:v 本身就是一种”速度”参数化。
5.3 代价与和扩散的关系
Section titled “5.3 代价与和扩散的关系”代价与取舍:
- 优点:路径更直 → 采样步数更少;训练目标(回归速度场)和扩散一样稳定;理论上和扩散同源(都是连续时间的生成过程),可以共享大部分工程基建。
- 代价:生态和生物领域基线还在追赶——绝大多数已发表的分子/蛋白/组学模型仍是连续高斯族,流匹配在生物领域还处于早期。这不是说流匹配在生物上不work(已有一些蛋白/分子的流匹配论文),而是说生态成熟度差距:连续高斯族有 RFdiffusion/AlphaFold/FrameDiff 这些经过大规模验证的基线、有明确的调参经验、有可复现的预训练权重;流匹配在生物上还处于”论文概念验证”阶段,缺少大规模基线和社区共识。如果你在做生物扩散且时间紧,先从连续高斯族起步是更稳的选择;如果你在做研究且愿意踩坑,把流匹配搬到蛋白/分子上是个有价值的方向。
- 和扩散的关系:同源而非对立。流匹配可以看成”用最优传输视角重新推导的扩散”,很多结论(条件注入、CFG)可以平移过来。第 2 章讲的 v-prediction,本身就是通向流匹配的一座桥。
一句话:如果你手上是连续高斯模型且苦于采样慢,流匹配是一个”换训练目标就能少步”的方向;但如果你的领域基线都还是 DDPM 系,别为了追新而冒然全换。
6. 机制族四:少步 / 蒸馏(换步数)
Section titled “6. 机制族四:少步 / 蒸馏(换步数)”6.1 换了什么
Section titled “6.1 换了什么”这一族的目标非常明确——把多步采样压成 1–4 步,用四维度框架看就是换维度④:步数。
和第 6 章讲的采样加速(DDIM/DPM++)不同:那些是”不重训、只换采样代码”的加速,下限大约 10–20 步;而这一族是从训练/蒸馏阶段就重新设计,把步数压到个位数甚至 1 步。
两条主要路线:
- 蒸馏路线(Progressive Distillation、LCM、SDXL Turbo、Hyper-SD):先有一个训好的多步”教师”模型,再训一个”学生”模型,让学生用 1–4 步复现教师几十步的效果。
- 重训路线(Consistency Models,一致性模型):从头设计训练目标,让网络学会”从轨迹上任意一点,直接跳回终点(数据)“——所以采样时一步就能到位。
6.2 一致性模型的核心直觉
Section titled “6.2 一致性模型的核心直觉”flowchart LR subgraph 多步["扩散:沿轨迹逐步走"] A1["噪声"] --> A2["x_t"] --> A3["x_t'"] --> A4["数据"] end subgraph 一致["一致性模型:任意点直接跳终点"] B1["噪声"] -.一步.-> B4["数据"] B2["x_t"] -.一步.-> B4 B3["x_t'"] -.一步.-> B4 end
一致性模型的名字来自它的核心约束:轨迹上任意两点,都应该映射到同一个终点(这就是”一致性”)。网络学会这个映射后,采样时从纯噪声出发,一步就能跳到数据;想要更好质量,也可以走 2–4 步做少量精修。
蒸馏路线的师生关系也值得说清楚。以 Progressive Distillation 为例:先有一个训好的多步教师(比如走 1000 步),训一个学生模型,让它用 500 步复现教师 1000 步的输出;然后把这个学生当新教师,再蒸馏出 250 步的学生……如此反复减半,最终压到个位数步。LCM(Latent Consistency Model)则是把一致性思想直接用在 latent 空间的预训练扩散上,蒸馏出能 1–4 步出图的学生,是当前实时图像生成的主力之一。这两条路线(重训一致性模型 vs 蒸馏已有模型)的共同点是:都把”少步”这件事从采样阶段挪到了训练/蒸馏阶段解决。
6.3 代价与何时该用
Section titled “6.3 代价与何时该用”代价与取舍:
- 优点:1–4 步出样,适合实时交互(边写 prompt 边看图)、超大批量高通量、移动端/端侧部署。
- 代价:需要重训或蒸馏,不是”换代码就能用”;蒸馏往往会损失一点多样性和细节(学生很难 100% 复现教师);生物领域这些方法还在早期。
何时该考虑换少步族(第 3、7 章的心法):
- 你已经有一个质量达标的多步模型,且采样吞吐成了真实瓶颈(比如百万级批量筛选、实时应用);
- 你能接受”用一点质量/多样性换几十倍速度”的交易;
- 你有重训/蒸馏的算力和数据。
如果这些都不满足,先老老实实用连续高斯族 + DPM++ 采样(第 6 章),别为了少步而少步。
生物领域的现实:截至 2025,少步/一致性模型在生物领域还处于早期——绝大多数已发表的蛋白/分子/组学扩散模型仍是”连续高斯 + 50–200 步采样”。原因不是生物不需要少步(筛选百万候选时当然需要),而是这些方法的训练成本和质量损失在生物任务上是否划得来,还没经过充分验证。图像上 LCM/Turbo 能 4 步逼近教师 50 步、且质量可接受,但蛋白/分子的”质量可接受”标准更严(结构要物理合理、功能要可验证),少步模型在这些硬约束下能保留多少教师的多样性和可折叠性,仍是开放问题。如果你在生物领域做扩散,目前更稳妥的路径是:先把连续高斯族 + DPM++ 采样跑通(第 6 章),等少步族在生物基线上成熟了再迁移。当然,如果你正在做这个方向的研究(把一致性/蒸馏搬到蛋白/分子上),那你就是在填这个空白——但要做好”比图像更难”的心理准备。
7. 机制族的两个”正交”维度:主干与空间
Section titled “7. 机制族的两个”正交”维度:主干与空间”流匹配和少步族换的是路径和步数。还有两个维度值得单独说,因为它们和上面几族正交——可以和任何一族组合。
7.1 换主干:DiT(Diffusion Transformer)
Section titled “7.1 换主干:DiT(Diffusion Transformer)”换了什么(维度③):把去噪骨干从 U-Net 换成 Transformer。
- 核心思想:U-Net 的卷积有很强的局部性先验,但难 scale 到超大模型;Transformer 的可扩展性更好,scale 到大模型、大数据时收益明显。
- 代表:DiT,以及以它为基础的 Sora、SD3 等。
- 为什么 scale 收益明显:DiT 的原始论文做过系统实验——在 ImageNet 生成上,把模型从 0.3B 参数 scale 到 3B,FID(生成质量指标)持续改善、没有饱和;而同等参数的 U-Net 在 1B 左右就不再显著受益。背后原因是 Transformer 的”全局自注意力 + 无归纳偏置”架构,在大数据regime下能更充分利用容量,而 U-Net 的卷积和跳连已经把很多先验(局部性、层级)硬编码进去,大模型的额外容量无处发挥。这也是为什么 OpenAI 的 Sora(视频扩散大模型)选 DiT 而非 U-Net 3D 版——视频数据量巨大、需要极致 scale。
- 代价:小数据上从零训 DiT 容易过拟合,不如 U-Net 稳;Transformer 的算力和显存需求更高。
- 何时用:你有大规模数据和算力、想训一个能持续 scale 的大模型时。小数据场景 U-Net 仍是更稳的选择。
7.2 换空间:LDM(Latent Diffusion)
Section titled “7.2 换空间:LDM(Latent Diffusion)”换了什么(维度①):不在原始像素上扩散,先用 VAE 把高维数据压到低维 latent,再在 latent 上做扩散。
- 核心思想:512×512 图像压到 64×64 latent,算力降约 40 倍。这是 Stable Diffusion 的基础,也是”扩散能跑在消费级显卡上”的关键。
- 代价:依赖 VAE 编码质量;latent 空间不如像素直观;细节上限受 VAE 解码器限制。
- 和生物的关系:latent 扩散思路也被搬到蛋白(潜空间蛋白扩散)、单细胞(scVI 风格 latent + 扩散)——凡是”原始空间太高维”的地方,都可以先压再扩。
LDM 的完整设计(为什么先压缩再扩散、自编码器怎么设计、压缩率怎么权衡)在 隐空间扩散深入 有专门展开,本章不重复。
7.3 几何等变族:结构生成的必选项
Section titled “7.3 几何等变族:结构生成的必选项”换了什么(维度①③一起换):建模空间换成 3D 结构(SE(3) frame 或原子坐标),主干换成等变网络。
这一族在第 8 章(蛋白、小分子 3D 生成)里详细讲过,这里只从”机制族”的角度定位:
- 为什么必须单独成族:蛋白、分子在 3D 空间里,整体旋转平移不改变物理意义。普通 U-Net/DiT 一旦旋转输入,输出全变。等变网络(SE(3)-Transformer、EGNN、IPA)保证”物理上等价的输入得到物理上等价的输出”。
- 代表:RFdiffusion(SE(3) 骨架扩散)、EDM/GeoLDM(分子 3D 扩散)。
- 代价:等变网络实现复杂、训练更难;建模空间的设计(坐标 vs frame vs 联合)直接影响质量(第 8 章讲过 SE(3) frame 为什么比裸坐标好)。
- 不可替代性:这是唯一一个”生物任务里没得选”的族——做 3D 结构生成,几何等变是硬要求,不是优化项。
为什么等变不能靠数据增广”凑”出来:有人会想,既然问题是”旋转输入输出就变”,那我训练时把每个样本随机旋转很多次、让网络”见过所有朝向”不就行了?这条路走得通但代价极高——你把本该由架构免费保证的对称性,转嫁成了对数据量和训练时间的巨大需求,而且只能做到”近似等变”(网络在没见过的朝向上仍可能出错)。等变网络把对称性直接焊死在架构里:无论输入怎么转,输出在数学上严格跟着转,一个样本顶数据增广的成千上万个旋转副本。对蛋白、分子这种”朝向本身无意义、但几何关系至关重要”的数据,这不是效率优化,而是能不能训得出来的分水岭。
建模空间的三种选择及其后果(第 8 章详述,这里从机制族角度总结):做 3D 结构生成时,你还要在”在什么几何量上加噪”这件事上做选择——直接在原子坐标上加高斯噪声最直观,但会拉长键、扭曲键角,网络要花大量容量去学”回到合理化学”;在 SE(3) frame(每个残基的位置+朝向)上加噪,键长键角天然保持,只在”每个残基往哪转、往哪挪”上扰动,训练效率高得多,这是 RFdiffusion 的选择;联合建模结构+序列(AF3 风格)则更进一步,同时生成几何和氨基酸类别。同属几何等变族,这三种建模空间的选择直接决定了训练难度和样本质量。
8. 把五族拼成一张选择地图
Section titled “8. 把五族拼成一张选择地图”现在把所有族放回四维度框架,给一张”遇到需求 → 该看哪一族”的地图:
| 你的处境 / 需求 | 该考虑的机制族 | 换的是哪一维 |
|---|---|---|
| 刚入门、不确定用什么 | 连续高斯(基准族) | 都不换 |
| 数据是序列 / 图 / 类别 | 离散扩散(或自回归) | ① 空间的数据类型 |
| 采样慢,想少步且能重训 | 流匹配 或 少步蒸馏 | ② 路径 / ④ 步数 |
| 要实时交互 / 1–4 步出样 | 少步蒸馏(一致性/LCM) | ④ 步数 |
| 要 scale 到超大模型 | DiT 主干 | ③ 主干 |
| 原始空间太高维、算力紧 | LDM(换空间) | ① 空间 |
| 做 3D 蛋白 / 分子结构 | 几何等变(必选) | ①③ |
读地图的心法:
- 先定基准:默认从连续高斯族起步。
- 再看硬约束:数据离散?必须离散扩散或自回归。要 3D 结构?必须几何等变。这两个是”没得选”的。
- 最后看优化项:采样慢就往流匹配/少步走,要 scale 就换 DiT,算力紧就上 latent。这些是”锦上添花”的替换,不是必须。
一个真实的现代模型往往是多族叠加——比如 SD3 = 流匹配(②)+ latent(①)+ DiT(③)三族的组合。用四维度框架,你能把任何一个复合模型拆成”每一维选了什么”,这就是本章想给你的核心能力。
8.1 一次完整的拆解走查
Section titled “8.1 一次完整的拆解走查”把框架用起来最好的方式,是拿一个真实场景走一遍。假设你读到一篇论文,说”我们用 latent flow matching + DiT 在蛋白口袋条件下生成配体分子,10 步采样”。乍看一堆术语,用四维度框架逐个拆:
- 建模空间(维度①):它说了”latent”——所以不是在原始原子坐标上扩散,而是先把分子压到潜空间。但它又是”配体分子 + 口袋条件”,涉及 3D 几何,所以这个 latent 大概率是等变编码器产出的、保留了几何信息的潜表示。→ 落在几何等变族 + LDM(换空间)的组合。
- 路径(维度②):“flow matching”——路径取直了,这是它能少步的原因之一。→ 流匹配族。
- 主干(维度③):“DiT”——用 Transformer 而非 U-Net 做去噪骨干。→ DiT 主干。
- 步数(维度④):“10 步采样”——比经典 DDPM 的几十上百步少,但没到一致性模型的 1–4 步。这个少步主要来自流匹配的直路径(维度②的红利),而非额外蒸馏。
拆完你就看清了:这个模型是”几何等变 + latent + 流匹配 + DiT”四个选择的叠加,每个选择解决一个具体痛点(几何合理性、算力、少步、可扩展性)。你甚至能立刻提出审稿问题:“既然用了 latent,VAE 的重建误差对最终配体的几何精度影响多大?“——这正是维度①换空间的已知代价。
这就是本章最想留给你的东西:面对任何新扩散模型,不再是”又一个要背的名字”,而是”四维度上的一组选择 + 每个选择的代价”。术语会不断更新,但这个拆解框架不会过时。
9. 本章 Checklist
Section titled “9. 本章 Checklist”- 能说出四维度替换框架的四个维度(空间 / 路径 / 主干 / 步数)
- 能用四维度框架归类一个给定的扩散变体
- 知道连续高斯族为什么是”默认起点”,以及它的五个软肋
- 能讲清离散扩散换了什么、和自回归的竞争关系
- 能讲清流匹配换的是”路径”,以及路径取直为什么能少步
- 能讲清少步/蒸馏族和第 6 章采样加速的区别(重训 vs 换代码)
- 知道几何等变族是 3D 结构生成的”硬要求”
- 能把 SD3 这类复合模型拆成”每一维的选择”
10. 自测 4 问
Section titled “10. 自测 4 问”Q1. 有人告诉你”Flow Matching 是取代扩散的下一代技术”。用四维度框架纠正这句话。
参考要点
不是”取代”,是”换了维度②路径”。流匹配和扩散同源,共享建模空间、条件注入、大部分工程基建,只是把弯曲随机路径换成尽量直的确定路径、训练目标从预测噪声换成预测速度场。它是扩散框架内的一种替换,不是另起炉灶。
Q2. 你要生成氨基酸序列(离散),有人建议用离散扩散,也有人建议用自回归模型。判断的关键问题是什么?
参考要点
关键看”是否需要非自回归的、可并行、可迭代精炼的生成”。如果输出空间离散、监督信号明确、自回归够用,自回归往往更简单快精度高(如 ProteinMPNN 就没用离散扩散)。离散扩散的价值在于需要迭代精炼或全局约束的场景。离散数据 ≠ 必须离散扩散。
Q3. 为什么”少步蒸馏族”和第 6 章讲的 DDIM/DPM++ 采样加速不是一回事?
参考要点
DDIM/DPM++ 是”不重训、只换采样代码”的加速,下限约 10–20 步;少步蒸馏族是从训练/蒸馏阶段重新设计,把步数压到 1–4 步,需要重训或蒸馏。前者动的是采样端,后者动的是训练端。代价也不同:蒸馏会损失一点多样性和细节。
Q4. Stable Diffusion 3 同时用了流匹配、latent 空间、DiT 主干。用四维度框架说明这是哪几维的组合,以及这说明五大机制族之间是什么关系。
参考要点
流匹配换维度②路径、latent 换维度①空间、DiT 换维度③主干——三维同时替换的复合模型。这说明五大机制族不是互斥的,而是可以在不同维度上自由组合。四维度框架的价值正在于能把复合模型拆成”每一维选了什么”,而不是当成不可分解的黑箱。
11. 与其他章节的关系
Section titled “11. 与其他章节的关系”- 第 2 章 前向加噪与反向去噪:本章的”连续高斯基准族”就是第 2 章讲的经典 DDPM,本章的所有替换都以它为参照系。
- 第 6 章 训练与采样旋钮:本章少步族讲的是”重训/蒸馏”式加速,第 6 章讲的是”不重训、换采样代码”式加速,两者互补。
- 第 8 章 生物读者轨道:本章的”几何等变族”在第 8 章有蛋白/分子 3D 生成的完整案例。
- 扩散模型导航:按机制族查具体模型清单,本章讲原理、导航页列模型,两者配合看。
- 隐空间扩散深入:本章 §7.2 的 LDM 换空间在这里有完整设计。
12. 延伸阅读
Section titled “12. 延伸阅读”| 文献 / 资源 | 为什么看 | 阅读深度建议 |
|---|---|---|
| Lipman et al., Flow Matching for Generative Modeling, 2023 | 流匹配的原始出处 | 读速度场目标与和扩散的关系 |
| Liu et al., Rectified Flow, 2023 | 路径取直、reflow 的来源 | 读”为什么直路径能少步” |
| Song et al., Consistency Models, 2023 | 一致性模型(一步生成)的出处 | 读”任意点跳终点”的一致性约束 |
| Peebles & Xie, DiT (Scalable Diffusion with Transformers), 2023 | DiT 主干的原始出处 | 读 Transformer 换 U-Net 的 scale 收益 |
| Austin et al., D3PM (Structured Denoising Diffusion in Discrete State-Spaces), 2021 | 离散扩散的代表 | 读离散加噪的转移矩阵设计 |
说明:本章以机制族的原理与取舍为主;具体模型清单与生物模态查表在导航页,各族的实战调参在第 6 章、生物落地在第 8 章。
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。