跳转到内容

扩散模型教程第5章:五大机制族

本章是系列第 5 章:把纷繁的扩散变体收编成五大机制族,讲清每族换了什么、代价是什么、何时该换。不罗列模型清单——那是导航页的活,本章讲原理与取舍。 前置:第 2 章(DDPM 机制)、第 3 章(三式)。读完本章你会有一张”看到任何新扩散论文都能快速归类”的地图。 系列内:具体模型清单见 扩散模型导航;采样加速的实战调参见 第 6 章 训练与采样旋钮;隐空间扩散深入见 隐空间扩散深入

学完本章,你应能在不看笔记的情况下完成下列自检:

  1. 说出”四维度替换”框架的四个维度,并用它归类任意一个扩散变体。
  2. 讲清连续高斯、离散、流匹配、少步蒸馏、几何等变五大机制族各自”换了什么”。
  3. 对流匹配、一致性模型,各说出”它换的是哪一维、代价是什么”。
  4. 解释为什么蛋白/分子生成必须用几何等变族,而不能直接套图像那套。
  5. 拿一个新论文标题,判断它大致属于哪一族、要付什么代价。

字数与深度定位:机制地图章(约 8500–12000 汉字)。推导每族的完整数学、罗列模型清单(去导航页)、教具体实现。


2. 先建立一张地图:四维度替换框架

Section titled “2. 先建立一张地图:四维度替换框架”

扩散模型的变体多到令人眩晕——DDPM、DDIM、Score SDE、EDM、D3PM、Flow Matching、Rectified Flow、Consistency Models、LCM、DiT、LDM、RFdiffusion……初学者最容易犯的错,是把每个名字当成一个独立的新模型去背

正确的做法是建立一个”替换坐标系”。任何一个扩散变体,无论名字多花哨,本质都是在同一个基础框架(第 2、3 章讲的 DDPM 三式)上,换掉了四个维度里的一个或几个:

四维度替换框架
维度在换什么代表性变化
① 建模空间在什么空间上加噪去噪像素 → latent(LDM)→ SE(3) 结构(RFdiffusion)→ 图(分子图扩散)→ 离散类别(D3PM)
② 路径噪声到数据怎么走弯曲随机 SDE(DDPM)→ 尽量直的确定 ODE(Flow Matching / Rectified Flow)
③ 主干用什么网络去噪U-Net(经典)→ Transformer(DiT)→ 等变网络(结构/分子)
④ 步数采样跑几步多步(DDPM 1000 步)→ 少步(DDIM 20 步)→ 一步(一致性模型、蒸馏)

这张表是本章的总纲。接下来讲的五大机制族,其实就是这四个维度上几种最重要的替换组合。学会这个框架后,你读任何新论文的第一个动作就变成:“它在这四维里换了哪几个?换的代价是什么?“——而不是”又一个要背的新模型”。

为什么恰好是这四个维度:你可能会好奇,为什么不是五个、六个维度?答案是:这四个正好对应扩散框架的四个可独立替换的模块——①建模空间决定”在哪里表示数据、加什么样的噪声”,②路径决定”噪声到数据的演化方程”,③主干决定”用什么网络拟合去噪函数”,④步数决定”采样时积分这条路径的离散化程度”。它们大体正交(换其中一个不强制改动另外三个),且覆盖了从数学建模到网络架构到采样策略的完整链条。当然你也可以细分出更多维度(比如把”条件注入方式”单列),但那样分类会过细、记忆负担反增——这四维是”粗细适中、实用性最强”的切分。

先给一张”族 × 维度”的对照,后面逐族展开:

机制族主要换了哪一维一句话定位
连续高斯(DDPM/Score SDE 系)都不换(基准族)最成熟、生态最好,默认起点
离散扩散① 建模空间(连续→离散)序列 / 图 / 分类变量专用
流匹配 / Rectified Flow② 路径(弯→直)路径取直,采样更少步,SD3/Flux 在用
少步 / 蒸馏(一致性 / LCM)④ 步数(多→一)把多步压成 1–4 步,实时交互用
几何 / 等变①③(结构空间 + 等变主干)蛋白、分子 3D 生成的必选项

注意:这五族不是互斥的。一个真实模型常常同时属于多族——比如 Stable Diffusion 3 = 流匹配(②)+ latent 空间(①)+ DiT 主干(③)。四维度框架的价值正在于此:它让你能把一个复合模型拆解成”在每一维上的选择”,而不是当成一个不可分解的黑箱。


3. 机制族一:连续高斯扩散(基准族)

Section titled “3. 机制族一:连续高斯扩散(基准族)”

这是第 2、3 章讲的经典 DDPM 所属的族,也是所有其他族的参照系。理解它”没换什么”,才能理解别的族”换了什么”。

  • 建模空间:连续欧氏空间(像素、latent 向量、连续坐标)。
  • 路径:高斯加噪,弯曲的随机路径(SDE 视角)。
  • 主干:经典是 U-Net。
  • 步数:训练 1000 步网格,采样 20–1000 步。

代表:DDPM、DDIM、ADM(Guided Diffusion)、EDM(Karras)、Score SDE。这些具体模型的清单在导航页,本章只需知道它们共享同一套连续高斯机制

连续高斯族有三个别的族短期难以撼动的优势:

  1. 理论完备:离散马尔可夫链(DDPM)和连续 SDE(Score SDE)两套视角可以互相印证,数学基础最扎实(第 2 章 §8)。这一点值得多说一句——同一个连续高斯扩散,可以从两个完全不同的角度推导出来:一是把它看成”1000 步离散马尔可夫链”(DDPM 的原始视角,适合工程实现),二是把它看成”连续时间的随机微分方程”(Score SDE 视角,适合理论分析和设计高阶采样器)。两套视角得到的采样公式在极限下一致,互为验证。这种”多个独立推导殊途同归”的性质,是一个数学框架成熟稳固的标志,也是别的机制族短期难以追上的底气。
  2. 生态最好:diffusers 等主流框架的默认实现、绝大多数预训练权重、最多的教程和踩坑经验,都在这个族。
  3. 适配面最广:图像、隐空间、蛋白结构(配等变网络)、几乎所有连续型数据都能用。

一句话选择建议:不确定选什么时,从连续高斯族起步,尤其是配 latent 空间用(即 LDM)。等你明确遇到了它的软肋(太慢、数据是离散的、要 3D 等变),再考虑换族。

3.3 它的软肋,正是其他族的动机

Section titled “3.3 它的软肋,正是其他族的动机”
连续高斯的软肋催生了哪一族
采样多步、慢少步 / 蒸馏族(§6)、流匹配族(§5)
只能处理连续数据离散扩散族(§4)
U-Net 难 scale 到超大模型DiT 主干(§7)
直接在像素上算力爆炸latent 空间(LDM,§7)
不保证 3D 旋转平移等变几何等变族(§8)

这张表把整章串起来了:后面每一族,都是在解连续高斯族的某一个具体痛点。

举两个具体例子帮你内化这张表

  1. 蛋白骨架生成(RFdiffusion):蛋白是 3D 结构、整体旋转不改变意义——连续高斯的”不保证等变”这一软肋在这里是致命的,必须换到几何等变族。同时蛋白的原子数多、直接在坐标上扩散算力爆炸,所以 RFdiffusion 还换了建模空间(在 SE(3) frame 上而非裸坐标),解决了”算力爆炸”那条软肋。这是两个软肋同时命中、两个维度同时替换的例子。

  2. Stable Diffusion:图像生成本身连续高斯族够用,但”512×512 像素直接扩散算力爆炸”——所以 SD 换了建模空间(先 VAE 压到 64×64 latent 再扩散),解决算力问题的同时保留了连续高斯族的成熟生态。它没换路径(仍是经典 SDE/ODE)、没换主干(SD 1.x/2.x 仍是 U-Net),只在空间这一维做了替换——这正是”四维度正交”的体现。


4. 机制族二:离散扩散(换建模空间的数据类型)

Section titled “4. 机制族二:离散扩散(换建模空间的数据类型)”

连续高斯扩散的前提是”数据在连续空间、能加高斯噪声”。但很多生物数据是离散的:

  • 氨基酸序列(20 种氨基酸的类别序列);
  • 分子图(原子类型是离散类别、键是离散的存在/类型);
  • DNA/RNA 序列(4 种碱基);
  • 任何分类变量。

对离散数据,“加一点高斯噪声”根本无从谈起——你没法给”丙氨酸”这个类别加 0.3 的高斯扰动。离散扩散换的就是”加噪”这个操作本身

  • 前向加噪:不是加高斯,而是按概率把当前类别翻转成其他类别,或翻成一个特殊的”吸收态 / 掩码态”。走到最后,整条序列变成纯随机类别或全是掩码。
  • 反向去噪:网络预测”这个位置原本最可能是哪个类别”,逐步把随机/掩码恢复成有意义的序列。

这里的”加噪”具体怎么实现,有两种主流设计,理解它们的差别能帮你读懂离散扩散论文:

  • 均匀翻转(uniform):每一步以某概率把当前类别随机换成任意其他类别,走到最后是”完全随机的类别序列”。类比连续高斯里的”加噪到纯噪声”。
  • 吸收态 / 掩码(absorbing / masked):每一步以某概率把当前类别换成一个特殊的 [MASK] 符号,且一旦变成 [MASK] 就不再改变(“吸收”),走到最后是”全 [MASK]”。反向去噪就是逐步把 [MASK] 填回真实类别——这和 BERT 式的掩码预测非常像,也是为什么很多离散扩散能复用语言模型的工程经验。

两种设计对应不同的转移矩阵(描述”类别 i 变成类别 j 的概率”的表),掩码式往往更好训、和现有 NLP 基建更兼容,是近年更常见的选择。

连续 vs 离散扩散的加噪

代表:D3PM(离散去噪扩散概率模型)家族,以及各种序列/图上的离散扩散。具体清单见导航页 §3.4。

代价与取舍

  • 优点:离散约束天然满足——生成氨基酸序列不会冒出”半个氨基酸”,生成分子图化合价更容易合法。
  • 代价:数学不如连续高斯优雅(转移矩阵的设计有很多选择),生态和预训练资源远少于连续族。
  • 一个重要的对手:在序列生成上,离散扩散要和自回归模型(GPT 那套)竞争。很多任务上自回归更简单、更快、精度更高——所以离散扩散不是”离散数据的唯一选择”,而是”当你需要非自回归的、可并行的、可迭代精炼的离散生成”时的选项。

离散扩散 vs 自回归:何时该选哪个(这是生物序列生成里的真实决策):

自回归模型(Transformer decoder 那套)的优势在于有明确因果链的序列任务——每个位置依赖前面的、有清晰的左到右顺序、监督信号充足。典型场景:给定蛋白骨架反推序列(ProteinMPNN)、给定上文续写氨基酸、RNA 设计(每个碱基配对约束清晰)。这些任务上自回归训练简单、推理快(一次前向几十 token)、精度高。

离散扩散的优势在于需要全局一致性、无明确因果顺序、或需迭代精炼的任务——比如分子图生成(所有原子/键要同时满足化学约束,没有”先生成哪个原子”的自然顺序)、多约束序列优化(要同时满足几个冲突目标,迭代修改比一遍生成更合理)、或者需要”部分重采样”(只改一段、其他不动)的场景。这时离散扩散的”可并行、可迭代、可部分去噪”价值才体现。

一句话判断:序列有清晰因果链 + 监督充足 → 先试自回归;需要全局约束或迭代精炼 → 离散扩散。生物里这两条路都活跃,不是”扩散一定更好”。

4.3 一个必须澄清的边界:ProteinMPNN 不是离散扩散

Section titled “4.3 一个必须澄清的边界:ProteinMPNN 不是离散扩散”

第 8 章讲过:RFdiffusion 产骨架后,序列由 ProteinMPNN 反推。ProteinMPNN 处理的是离散氨基酸,但它不是离散扩散——它是”消息传递 + 自回归解码”的监督模型。

这正好说明一件事:离散数据 ≠ 必须用离散扩散。当输出空间离散、监督信号明确、无需分布探索时(如给定骨架反推序列),一个自回归/监督模型往往比离散扩散更合适。这一点第 7 章”什么任务不该用扩散”里详细讲过。


5. 机制族三:流匹配 / Rectified Flow(换路径)

Section titled “5. 机制族三:流匹配 / Rectified Flow(换路径)”

这是 2024–2025 最热的一族——Stable Diffusion 3、Flux 都用了它。你会越来越频繁地撞见 “Flow Matching”、“Rectified Flow”、“velocity prediction” 这些词。

关键认知:它不是推翻扩散,而是换了一种”从噪声到数据的走法”。 用四维度框架看,它主要换的是维度②:路径

维度经典扩散(DDPM)流匹配 / Rectified Flow
建模空间像素 / latent / 结构
噪声→数据路径随机 SDE、弯曲直线 ODE、尽量取直
训练目标预测噪声 ε预测速度场 v(把噪声搬向数据的方向)
采样多步 SDE / ODE 求解少步 ODE 积分(路径更直 → 更少步)
弯曲路径 vs 直线路径

直觉很简单:如果从噪声到数据的路径是一条弯弯曲曲的曲线,你用大步长的数值积分去走,很容易”冲出弯道”、积累误差,所以必须走很多小步。如果路径接近直线,那用很少几步、甚至一大步,都能走得很准。

流匹配的训练目标就是学一个速度场——在每个时刻、每个位置,告诉你”往哪个方向走、走多快”才能把噪声搬到数据。Rectified Flow 更进一步,用 “reflow” 技巧反复把路径拉直,最终可以做到极少步甚至一步采样。

把”速度场”这个词说得更具体一点:想象噪声空间里的每个点都是一滴水,数据分布是它们最终要流到的湖。速度场就是一张”水流地图”,告诉每一滴水在每个时刻该朝哪个方向、以多快速度移动。经典扩散学的是”这里有多少噪声”(预测 ε),流匹配学的是”这里的水该往哪流”(预测 v)——两者信息等价,但速度场的视角天然对应”沿一条路径积分”,而积分一条直路径显然比积分一条弯路径省步数。这也解释了为什么第 2 章讲的 v-prediction 是通向流匹配的桥:v 本身就是一种”速度”参数化。

代价与取舍

  • 优点:路径更直 → 采样步数更少;训练目标(回归速度场)和扩散一样稳定;理论上和扩散同源(都是连续时间的生成过程),可以共享大部分工程基建。
  • 代价:生态和生物领域基线还在追赶——绝大多数已发表的分子/蛋白/组学模型仍是连续高斯族,流匹配在生物领域还处于早期。这不是说流匹配在生物上不work(已有一些蛋白/分子的流匹配论文),而是说生态成熟度差距:连续高斯族有 RFdiffusion/AlphaFold/FrameDiff 这些经过大规模验证的基线、有明确的调参经验、有可复现的预训练权重;流匹配在生物上还处于”论文概念验证”阶段,缺少大规模基线和社区共识。如果你在做生物扩散且时间紧,先从连续高斯族起步是更稳的选择;如果你在做研究且愿意踩坑,把流匹配搬到蛋白/分子上是个有价值的方向。
  • 和扩散的关系同源而非对立。流匹配可以看成”用最优传输视角重新推导的扩散”,很多结论(条件注入、CFG)可以平移过来。第 2 章讲的 v-prediction,本身就是通向流匹配的一座桥。

一句话:如果你手上是连续高斯模型且苦于采样慢,流匹配是一个”换训练目标就能少步”的方向;但如果你的领域基线都还是 DDPM 系,别为了追新而冒然全换。


6. 机制族四:少步 / 蒸馏(换步数)

Section titled “6. 机制族四:少步 / 蒸馏(换步数)”

这一族的目标非常明确——把多步采样压成 1–4 步,用四维度框架看就是换维度④:步数

和第 6 章讲的采样加速(DDIM/DPM++)不同:那些是”不重训、只换采样代码”的加速,下限大约 10–20 步;而这一族是从训练/蒸馏阶段就重新设计,把步数压到个位数甚至 1 步。

两条主要路线

  • 蒸馏路线(Progressive Distillation、LCM、SDXL Turbo、Hyper-SD):先有一个训好的多步”教师”模型,再训一个”学生”模型,让学生用 1–4 步复现教师几十步的效果。
  • 重训路线(Consistency Models,一致性模型):从头设计训练目标,让网络学会”从轨迹上任意一点,直接跳回终点(数据)“——所以采样时一步就能到位。
多步扩散 vs 一致性模型

一致性模型的名字来自它的核心约束:轨迹上任意两点,都应该映射到同一个终点(这就是”一致性”)。网络学会这个映射后,采样时从纯噪声出发,一步就能跳到数据;想要更好质量,也可以走 2–4 步做少量精修。

蒸馏路线的师生关系也值得说清楚。以 Progressive Distillation 为例:先有一个训好的多步教师(比如走 1000 步),训一个学生模型,让它用 500 步复现教师 1000 步的输出;然后把这个学生当新教师,再蒸馏出 250 步的学生……如此反复减半,最终压到个位数步。LCM(Latent Consistency Model)则是把一致性思想直接用在 latent 空间的预训练扩散上,蒸馏出能 1–4 步出图的学生,是当前实时图像生成的主力之一。这两条路线(重训一致性模型 vs 蒸馏已有模型)的共同点是:都把”少步”这件事从采样阶段挪到了训练/蒸馏阶段解决。

代价与取舍

  • 优点:1–4 步出样,适合实时交互(边写 prompt 边看图)、超大批量高通量、移动端/端侧部署。
  • 代价需要重训或蒸馏,不是”换代码就能用”;蒸馏往往会损失一点多样性和细节(学生很难 100% 复现教师);生物领域这些方法还在早期。

何时该考虑换少步族(第 3、7 章的心法):

  • 你已经有一个质量达标的多步模型,且采样吞吐成了真实瓶颈(比如百万级批量筛选、实时应用);
  • 你能接受”用一点质量/多样性换几十倍速度”的交易;
  • 你有重训/蒸馏的算力和数据。

如果这些都不满足,先老老实实用连续高斯族 + DPM++ 采样(第 6 章),别为了少步而少步。

生物领域的现实:截至 2025,少步/一致性模型在生物领域还处于早期——绝大多数已发表的蛋白/分子/组学扩散模型仍是”连续高斯 + 50–200 步采样”。原因不是生物不需要少步(筛选百万候选时当然需要),而是这些方法的训练成本和质量损失在生物任务上是否划得来,还没经过充分验证。图像上 LCM/Turbo 能 4 步逼近教师 50 步、且质量可接受,但蛋白/分子的”质量可接受”标准更严(结构要物理合理、功能要可验证),少步模型在这些硬约束下能保留多少教师的多样性和可折叠性,仍是开放问题。如果你在生物领域做扩散,目前更稳妥的路径是:先把连续高斯族 + DPM++ 采样跑通(第 6 章),等少步族在生物基线上成熟了再迁移。当然,如果你正在做这个方向的研究(把一致性/蒸馏搬到蛋白/分子上),那你就是在填这个空白——但要做好”比图像更难”的心理准备。


7. 机制族的两个”正交”维度:主干与空间

Section titled “7. 机制族的两个”正交”维度:主干与空间”

流匹配和少步族换的是路径和步数。还有两个维度值得单独说,因为它们和上面几族正交——可以和任何一族组合。

7.1 换主干:DiT(Diffusion Transformer)

Section titled “7.1 换主干:DiT(Diffusion Transformer)”

换了什么(维度③):把去噪骨干从 U-Net 换成 Transformer。

  • 核心思想:U-Net 的卷积有很强的局部性先验,但难 scale 到超大模型;Transformer 的可扩展性更好,scale 到大模型、大数据时收益明显。
  • 代表:DiT,以及以它为基础的 Sora、SD3 等。
  • 为什么 scale 收益明显:DiT 的原始论文做过系统实验——在 ImageNet 生成上,把模型从 0.3B 参数 scale 到 3B,FID(生成质量指标)持续改善、没有饱和;而同等参数的 U-Net 在 1B 左右就不再显著受益。背后原因是 Transformer 的”全局自注意力 + 无归纳偏置”架构,在大数据regime下能更充分利用容量,而 U-Net 的卷积和跳连已经把很多先验(局部性、层级)硬编码进去,大模型的额外容量无处发挥。这也是为什么 OpenAI 的 Sora(视频扩散大模型)选 DiT 而非 U-Net 3D 版——视频数据量巨大、需要极致 scale。
  • 代价:小数据上从零训 DiT 容易过拟合,不如 U-Net 稳;Transformer 的算力和显存需求更高。
  • 何时用:你有大规模数据和算力、想训一个能持续 scale 的大模型时。小数据场景 U-Net 仍是更稳的选择。

换了什么(维度①):不在原始像素上扩散,先用 VAE 把高维数据压到低维 latent,再在 latent 上做扩散。

  • 核心思想:512×512 图像压到 64×64 latent,算力降约 40 倍。这是 Stable Diffusion 的基础,也是”扩散能跑在消费级显卡上”的关键。
  • 代价:依赖 VAE 编码质量;latent 空间不如像素直观;细节上限受 VAE 解码器限制。
  • 和生物的关系:latent 扩散思路也被搬到蛋白(潜空间蛋白扩散)、单细胞(scVI 风格 latent + 扩散)——凡是”原始空间太高维”的地方,都可以先压再扩。

LDM 的完整设计(为什么先压缩再扩散、自编码器怎么设计、压缩率怎么权衡)在 隐空间扩散深入 有专门展开,本章不重复。

7.3 几何等变族:结构生成的必选项

Section titled “7.3 几何等变族:结构生成的必选项”

换了什么(维度①③一起换):建模空间换成 3D 结构(SE(3) frame 或原子坐标),主干换成等变网络

这一族在第 8 章(蛋白、小分子 3D 生成)里详细讲过,这里只从”机制族”的角度定位:

  • 为什么必须单独成族:蛋白、分子在 3D 空间里,整体旋转平移不改变物理意义。普通 U-Net/DiT 一旦旋转输入,输出全变。等变网络(SE(3)-Transformer、EGNN、IPA)保证”物理上等价的输入得到物理上等价的输出”。
  • 代表:RFdiffusion(SE(3) 骨架扩散)、EDM/GeoLDM(分子 3D 扩散)。
  • 代价:等变网络实现复杂、训练更难;建模空间的设计(坐标 vs frame vs 联合)直接影响质量(第 8 章讲过 SE(3) frame 为什么比裸坐标好)。
  • 不可替代性:这是唯一一个”生物任务里没得选”的族——做 3D 结构生成,几何等变是硬要求,不是优化项。

为什么等变不能靠数据增广”凑”出来:有人会想,既然问题是”旋转输入输出就变”,那我训练时把每个样本随机旋转很多次、让网络”见过所有朝向”不就行了?这条路走得通但代价极高——你把本该由架构免费保证的对称性,转嫁成了对数据量和训练时间的巨大需求,而且只能做到”近似等变”(网络在没见过的朝向上仍可能出错)。等变网络把对称性直接焊死在架构里:无论输入怎么转,输出在数学上严格跟着转,一个样本顶数据增广的成千上万个旋转副本。对蛋白、分子这种”朝向本身无意义、但几何关系至关重要”的数据,这不是效率优化,而是能不能训得出来的分水岭。

建模空间的三种选择及其后果(第 8 章详述,这里从机制族角度总结):做 3D 结构生成时,你还要在”在什么几何量上加噪”这件事上做选择——直接在原子坐标上加高斯噪声最直观,但会拉长键、扭曲键角,网络要花大量容量去学”回到合理化学”;在 SE(3) frame(每个残基的位置+朝向)上加噪,键长键角天然保持,只在”每个残基往哪转、往哪挪”上扰动,训练效率高得多,这是 RFdiffusion 的选择;联合建模结构+序列(AF3 风格)则更进一步,同时生成几何和氨基酸类别。同属几何等变族,这三种建模空间的选择直接决定了训练难度和样本质量。


现在把所有族放回四维度框架,给一张”遇到需求 → 该看哪一族”的地图:

你的处境 / 需求该考虑的机制族换的是哪一维
刚入门、不确定用什么连续高斯(基准族)都不换
数据是序列 / 图 / 类别离散扩散(或自回归)① 空间的数据类型
采样慢,想少步且能重训流匹配少步蒸馏② 路径 / ④ 步数
要实时交互 / 1–4 步出样少步蒸馏(一致性/LCM)④ 步数
要 scale 到超大模型DiT 主干③ 主干
原始空间太高维、算力紧LDM(换空间)① 空间
做 3D 蛋白 / 分子结构几何等变(必选)①③

读地图的心法

  1. 先定基准:默认从连续高斯族起步。
  2. 再看硬约束:数据离散?必须离散扩散或自回归。要 3D 结构?必须几何等变。这两个是”没得选”的。
  3. 最后看优化项:采样慢就往流匹配/少步走,要 scale 就换 DiT,算力紧就上 latent。这些是”锦上添花”的替换,不是必须。

一个真实的现代模型往往是多族叠加——比如 SD3 = 流匹配(②)+ latent(①)+ DiT(③)三族的组合。用四维度框架,你能把任何一个复合模型拆成”每一维选了什么”,这就是本章想给你的核心能力。

把框架用起来最好的方式,是拿一个真实场景走一遍。假设你读到一篇论文,说”我们用 latent flow matching + DiT 在蛋白口袋条件下生成配体分子,10 步采样”。乍看一堆术语,用四维度框架逐个拆:

  1. 建模空间(维度①):它说了”latent”——所以不是在原始原子坐标上扩散,而是先把分子压到潜空间。但它又是”配体分子 + 口袋条件”,涉及 3D 几何,所以这个 latent 大概率是等变编码器产出的、保留了几何信息的潜表示。→ 落在几何等变族 + LDM(换空间)的组合。
  2. 路径(维度②):“flow matching”——路径取直了,这是它能少步的原因之一。→ 流匹配族
  3. 主干(维度③):“DiT”——用 Transformer 而非 U-Net 做去噪骨干。→ DiT 主干
  4. 步数(维度④):“10 步采样”——比经典 DDPM 的几十上百步少,但没到一致性模型的 1–4 步。这个少步主要来自流匹配的直路径(维度②的红利),而非额外蒸馏。

拆完你就看清了:这个模型是”几何等变 + latent + 流匹配 + DiT”四个选择的叠加,每个选择解决一个具体痛点(几何合理性、算力、少步、可扩展性)。你甚至能立刻提出审稿问题:“既然用了 latent,VAE 的重建误差对最终配体的几何精度影响多大?“——这正是维度①换空间的已知代价。

这就是本章最想留给你的东西:面对任何新扩散模型,不再是”又一个要背的名字”,而是”四维度上的一组选择 + 每个选择的代价”。术语会不断更新,但这个拆解框架不会过时。


  • 能说出四维度替换框架的四个维度(空间 / 路径 / 主干 / 步数)
  • 能用四维度框架归类一个给定的扩散变体
  • 知道连续高斯族为什么是”默认起点”,以及它的五个软肋
  • 能讲清离散扩散换了什么、和自回归的竞争关系
  • 能讲清流匹配换的是”路径”,以及路径取直为什么能少步
  • 能讲清少步/蒸馏族和第 6 章采样加速的区别(重训 vs 换代码)
  • 知道几何等变族是 3D 结构生成的”硬要求”
  • 能把 SD3 这类复合模型拆成”每一维的选择”

Q1. 有人告诉你”Flow Matching 是取代扩散的下一代技术”。用四维度框架纠正这句话。

参考要点

不是”取代”,是”换了维度②路径”。流匹配和扩散同源,共享建模空间、条件注入、大部分工程基建,只是把弯曲随机路径换成尽量直的确定路径、训练目标从预测噪声换成预测速度场。它是扩散框架内的一种替换,不是另起炉灶。

Q2. 你要生成氨基酸序列(离散),有人建议用离散扩散,也有人建议用自回归模型。判断的关键问题是什么?

参考要点

关键看”是否需要非自回归的、可并行、可迭代精炼的生成”。如果输出空间离散、监督信号明确、自回归够用,自回归往往更简单快精度高(如 ProteinMPNN 就没用离散扩散)。离散扩散的价值在于需要迭代精炼或全局约束的场景。离散数据 ≠ 必须离散扩散。

Q3. 为什么”少步蒸馏族”和第 6 章讲的 DDIM/DPM++ 采样加速不是一回事?

参考要点

DDIM/DPM++ 是”不重训、只换采样代码”的加速,下限约 10–20 步;少步蒸馏族是从训练/蒸馏阶段重新设计,把步数压到 1–4 步,需要重训或蒸馏。前者动的是采样端,后者动的是训练端。代价也不同:蒸馏会损失一点多样性和细节。

Q4. Stable Diffusion 3 同时用了流匹配、latent 空间、DiT 主干。用四维度框架说明这是哪几维的组合,以及这说明五大机制族之间是什么关系。

参考要点

流匹配换维度②路径、latent 换维度①空间、DiT 换维度③主干——三维同时替换的复合模型。这说明五大机制族不是互斥的,而是可以在不同维度上自由组合。四维度框架的价值正在于能把复合模型拆成”每一维选了什么”,而不是当成不可分解的黑箱。


  • 第 2 章 前向加噪与反向去噪:本章的”连续高斯基准族”就是第 2 章讲的经典 DDPM,本章的所有替换都以它为参照系。
  • 第 6 章 训练与采样旋钮:本章少步族讲的是”重训/蒸馏”式加速,第 6 章讲的是”不重训、换采样代码”式加速,两者互补。
  • 第 8 章 生物读者轨道:本章的”几何等变族”在第 8 章有蛋白/分子 3D 生成的完整案例。
  • 扩散模型导航:按机制族查具体模型清单,本章讲原理、导航页列模型,两者配合看。
  • 隐空间扩散深入:本章 §7.2 的 LDM 换空间在这里有完整设计。

文献 / 资源为什么看阅读深度建议
Lipman et al., Flow Matching for Generative Modeling, 2023流匹配的原始出处读速度场目标与和扩散的关系
Liu et al., Rectified Flow, 2023路径取直、reflow 的来源读”为什么直路径能少步”
Song et al., Consistency Models, 2023一致性模型(一步生成)的出处读”任意点跳终点”的一致性约束
Peebles & Xie, DiT (Scalable Diffusion with Transformers), 2023DiT 主干的原始出处读 Transformer 换 U-Net 的 scale 收益
Austin et al., D3PM (Structured Denoising Diffusion in Discrete State-Spaces), 2021离散扩散的代表读离散加噪的转移矩阵设计

说明:本章以机制族的原理与取舍为主;具体模型清单与生物模态查表在导航页,各族的实战调参在第 6 章、生物落地在第 8 章。