跳转到内容

扩散模型教程第1章:生成直觉与问题设定

本章是系列第 1 章:只建立生成直觉与选型坐标系——扩散模型解决什么问题、和 VAE/GAN 差在哪、生物里何时值得用。不推导 DDPM、不讲采样调参。 面向读者:生物学 / 生物信息学背景,不要求计算机科班基础。若你刚学完强化学习,本章会主动帮你把两套概念划清边界。 系列内:机制与三式见 第 2 章 前向加噪与反向去噪第 3 章 DDPM 三式精讲;模型清单见 扩散模型导航

如果这一章你只记三句,记这三句:

  1. 生成模型的任务:从”已有数据的分布”里,学会再造出”像真的一样、又不完全照抄”的新样本。它要的不是一个标准答案,是一整片合理解。
  2. 扩散模型的核心直觉:先把数据一步步”搅成噪声”,再训练网络学会”一步步把噪声还原成数据”——像冲洗照片时影像慢慢显现,而不是一次印出整张。
  3. 为什么很多人转向它:相对 VAE 往往更清晰、相对 GAN 训练更稳、对”给定条件再生成”更友好;代价是采样慢、算力更贵——所以它用在”质量 / 可控性优先”的任务上最划算。

这三句是全章的骨架,后面每一节都在给其中一句填细节。读完回头看,你应该能对每句话补上”为什么”和”在生物里意味着什么”。


学完本章,你应能在不看笔记的情况下完成下列自检:

  1. 用自己的话说清”生成 ≠ 回归”:扩散输出的是分布上的一簇样本,不是单个最优答案。
  2. 质量、多样性、稳定性、速度、条件控制五个维度,口述 VAE / GAN / 扩散的差异。
  3. 举出你所在领域的一个任务,判断它”是否更像扩散场景”。
  4. 说出扩散全链条 9 步各自的主题(表示 → 加噪 → 网络 → 损失 → 训练 → 采样 → 条件 → 评估 → 下游)。
  5. 用 Go/No-Go 清单判断一个具体课题”先别急着上扩散”还是”值得一试”。

字数与深度定位:入门坐标章(约 8500–12000 汉字)。推导公式、训练模型、抄导航页的模型大全。


2.1 生物学里的”生成”长什么样

Section titled “2.1 生物学里的”生成”长什么样”

很多组学与结构问题,表面上写着”预测”,底层其实是生成条件生成

你习惯的说法更准确的生成表述输入(条件)输出(样本)
设计能结合某口袋的小分子在口袋条件下生成 3D 分子蛋白口袋结构分子构型 / 坐标
设计新蛋白骨架无条件或条件生成主链可选功能 / 二级结构约束主链坐标帧
对接姿态从哪来生成配体相对蛋白的位姿分布蛋白 + 配体多个候选姿态
显微图太少 / 缺标注生成或补全真实风格图像类别、掩膜、文本描述图像
缺失组学特征在约束下补全或增强样本部分观测、批次信息完整向量 / 矩阵

关键区分(评估章会反复用到):

  • 判别 / 回归:给输入,输出一个”最好答案”(如结合亲和力分数)。
  • 生成:给条件(或无条件),输出一整个分布上的样本——同一个问题可以有很多合理解。

扩散模型强在后者。你在药物设计、蛋白工程里真正需要的,往往不是唯一最优结构,而是一簇合理、可筛选的候选

一个具体情景能把这层区别钉死。假设你手上有一个新靶点的口袋结构,任务是”找能结合它的分子”。用回归的思路,你会训练一个模型:输入分子、输出预测亲和力,然后在已有化合物库里排序打分。这条路没错,但它有个天花板——你永远只能从库里挑,挑不出库里没有的东西。而用生成的思路,你训练模型去”理解结合这类口袋的分子长什么样”,然后让它从零画出一批库里从未有过、但化学上合理、几何上贴合口袋的新分子。前者是”检索 + 排序”,后者是”设计 + 生成”。真正的 de novo 药物设计需要后者,而扩散模型是当前做后者最稳的工具之一。

再强调一次这里的”多解”性质。同一个口袋,可能有完全不同的分子骨架都能结合(一个靠氢键网络、一个靠疏水堆叠)。回归模型被迫给每个分子一个分数,天然倾向于收敛到”平均意义上的好答案”;而好的生成模型应该能同时覆盖这几种不同的结合模式,给你一个多样的候选池,让后续的对接、合成可行性、湿实验去筛。这就是为什么”多样性”在生成任务里是一等公民,而在回归任务里几乎不被讨论。

2.2 为什么不直接”记答案”或只用回归

Section titled “2.2 为什么不直接”记答案”或只用回归”
  • 候选空间极大:分子图、构象、序列—结构映射的组合是天文数字。
  • 真值往往多峰:同一个口袋可以有多种结合模式,硬套一个”平均答案”反而谁都不像。
  • 实验数据稀疏、噪声大:需要模型在”像训练数据”的前提下,探索合理的新组合。

所以我们需要概率生成模型:显式或隐式地刻画 p(数据)p(\text{数据}) 或条件分布 p(数据条件)p(\text{数据}\mid\text{条件}),再从中采样。


扩散 ≈ 把一滴墨水在清水里搅匀(前向),再学”倒放录像”把墨水收回原来的形状(反向)。

网络不负责一次画出整只分子 / 整张细胞图,它只负责一件小事:在任意模糊程度下,判断”下一步该怎么变清晰一点”。

前向加噪与反向去噪

3.2 和”PCR / 杂交洗脱”的松散类比

Section titled “3.2 和”PCR / 杂交洗脱”的松散类比”

这个类比只帮你建立画面感,不是严格科学:

实验直觉扩散对应
逐步升高严格性,背景信号被洗掉前向:结构信息逐步被噪声淹没
在合适严格性下还能特异性结合中间时间步:仍保留部分全局形状
从粗到细优化实验条件反向:先恢复大形状,再补细节
一次到位的高通量筛选很难单步直接生成难;多步迭代更稳

真正的机制是高斯加噪 + 学习去噪(或学习分数),第 2 章会展开最小公式。

t = T(纯噪声) ████████████ 看不出分子/细胞
t 中等 ░░██░░██░░░░ 隐约轮廓、连通性
t 接近 0 清晰键角/纹理 细节到位
t = 0 可用样本 进入下游筛选

生物含义:

  • 早期去噪步像在决定整体折叠拓扑 / 图像构图。
  • 晚期去噪步像在精修侧链取向、局部纹理、键长键角合理性。
  • 所以步数不够时常见”大形状对了、局部化学不合理”——这个现象会在第 6 章对应到具体的采样调参旋钮。

3.4 为什么非要”拆成很多小步”

Section titled “3.4 为什么非要”拆成很多小步””

这是扩散最反直觉、也最核心的一点,值得单独想清楚。VAE 和 GAN 都试图一步从噪声跳到成品——编码器解码器一来一回,或生成器一次前向。扩散偏偏把这件事拆成几十上百个小步。为什么”慢”反而成了优势?

关键在于每一步要学的东西变简单了。让网络”从纯噪声一步画出一只完整的、化学合理的分子”,这是一个极难的映射——输入几乎不含信息,输出却要满足大量约束。而让网络”把一个稍微有点糊的分子变清晰一点点”,这是个容易得多的局部任务。扩散把一个几乎不可能的大跳跃,分解成一长串每步都可学、可监督的小跳跃。这也解释了为什么它训练稳定:每一小步都是一个有明确目标(预测这一档噪声)的回归问题,没有 GAN 那种”目标一直在移动”的对抗博弈。

一个有用的类比:让你凭空写出一篇完美论文很难,但让你在一份接近完成的草稿上”再改进一点点”就容易多了。扩散采样就像从一张全是涂改的白纸开始,反复做”再润色一步”,直到成稿。代价当然是你要润色很多次(多步 = 慢),第 6 章讲的加速方法本质都在问:能不能每步跨大一点、从而少润色几次而不明显掉质量。


4. 生成模型三大家族:VAE / GAN / 扩散

Section titled “4. 生成模型三大家族:VAE / GAN / 扩散”

这是本章最实用的一节。你不需要会推导任何一家,但要会用它们的差异做选型

4.1 各自”怎么造样本”(直觉版)

Section titled “4.1 各自”怎么造样本”(直觉版)”
家族一句话机制训练时主要在纠结什么采样时
VAE编码器压到潜变量,解码器重建;用 KL 把潜空间拉成简单分布重建清晰度 vs 潜空间规整(后验崩塌等)从简单分布抽 z,一次解码
GAN生成器造假,判别器抓假,两者对抗不稳定、模式崩塌、难收敛一次前向生成(快)
扩散固定加噪过程 + 学去噪 / 分数,多步还原主要是算力与超参,对抗少多步迭代(慢,可加速)
三大家族的生成路径

4.2 你真正关心的对比维度(生物选型表)

Section titled “4.2 你真正关心的对比维度(生物选型表)”
维度VAEGAN扩散(现代主流)生物里意味着什么
样本清晰度 / 保真常偏糊可以很锐通常很高结构细节、显微纹理要可信时倾向扩散
多样性中等易模式崩塌通常较好想要一库多样候选分子时重要
训练稳定性相对稳难调、易炸相对稳(无双玩家对抗)算力与人力有限时加分
似然 / 可解释概率有 ELBO 下界无显式似然可连接分数 / SDE 视角需要”密度”时另看指标,不必神话
条件控制条件 VAE 可行条件 GAN 可行但更脆CFG 等很强口袋、文本、属性条件生成友好
采样速度快(1 步)快(1 步)慢(默认几十至千步)高通量虚拟筛选要算账,可用蒸馏 / 少步法
实现与生态成熟成熟但坑多2020 后生态爆发预训练与开源实现多

4.3 三家族的”命门”各在哪(帮你记住机制)

Section titled “4.3 三家族的”命门”各在哪(帮你记住机制)”

对比表容易背,但真正要理解的是每家为什么会有它的强项和软肋。这里各给一句”命门”:

  • VAE 的命门是”信息瓶颈”。 它强制把数据压进一个低维、规整的潜空间再解码。压缩本身是优点(潜空间干净、可插值、采样一步到位),但也是它偏糊的根源——为了让潜空间规整(KL 项),解码器往往牺牲高频细节。所以 VAE 在”需要一个平滑、可操作的潜表示”时很香(很多扩散模型其实借用了 VAE 的潜空间,见第 5 章的隐空间扩散),但单独拿它做高保真生成常常不够锐。

  • GAN 的命门是”对抗博弈的不稳定”。 生成器和判别器互相追赶,没有一个稳定的、可以一路下降的损失函数。调好了它能出极锐的图,还快(一次前向);调不好就模式崩塌(只会出几种样本)或直接训练发散。生物任务里数据往往不像自然图像那样海量干净,GAN 的调参脆弱性会被进一步放大。

  • 扩散的命门是”多步迭代的成本”。 它把”一次生成”这个难题拆成几十上百个简单的去噪小步,每步只需网络回答”当前这点噪声该怎么擦”。这种拆分带来了训练稳定(每步都是有监督的回归,没有对抗)和强条件控制,但代价是采样要跑很多次网络前向。第 6 章讲的采样加速(DDIM、少步蒸馏)本质都在和这个命门作斗争。

记住这三句”命门”,你就能在任何新论文里快速定位它到底在优化哪一家的软肋。

4.4 为什么 2020 年后扩散”出圈”

Section titled “4.4 为什么 2020 年后扩散”出圈””

不用背诵,记住这是四个历史坐标即可:

  1. DDPM(Ho et al., 2020):用简洁的噪声预测目标,在图像上做到与 GAN 比肩的质量,训练流程更工程友好。这是”扩散真正好用”的引爆点——在此之前,加噪—去噪的思想早在 2015 年(Sohl-Dickstein 等的非平衡热力学表述)就有了,但目标复杂、难复现。DDPM 的贡献是把训练简化成”预测噪声的均方误差”,让训练像回归一样稳。
  2. Score-based / SDE 视角(Song 等):把”去噪”和”分数匹配、随机微分方程”连起来,理论与采样器设计统一。这条线的价值是把离散的”加噪 T 步”提升成连续时间的随机微分方程,后来的各种高阶采样器(第 6 章)都建立在这个统一视角上。
  3. 条件与引导(含 Classifier-Free Guidance):让”按文本 / 标签 / 结构条件生成”变得好用——这与生物里的条件设计高度同构。你想”对这个口袋设计分子""按这段掩膜补全图像”,靠的就是这套条件注入机制(第 6 章展开)。
  4. 加速与蒸馏(DDIM、一致性模型、LCM、Flow Matching 等):不断减步数,缩小与 GAN 的速度差距。这条线还在快速演进,第 7 章会作为”替代路线”专门评估。

教学提示:入门阶段不必先啃 SDE。你只需记住——“多步去噪 + 稳训练 + 强条件”是扩散的产品力来源。这三点也正好对应上面四个坐标里最要紧的部分。

误区更准确的说法
”扩散一定全面碾压 GAN/VAE”任务依赖:只要快、可接受中等质量,VAE/GAN 甚至更简单模型仍可能更合适
”扩散 = Stable Diffusion,只会做图”框架对任意可加噪对象都成立;分子坐标、密度图、潜向量都能扩
”有扩散就不用物理 / 化学约束了”生物里常要扩散 + 力场 / 对接 / ADMET / 实验反馈;生成是候选引擎不是终点
”步数越多一定越好”有收益递减,且与调度器、是否 DDIM / 蒸馏强相关(第 6 章)
“学会公式就会用”更关键的是数据表示、条件怎么喂、评估是否任务相关

5. 全链条鸟瞰(只认路,不深潜)

Section titled “5. 全链条鸟瞰(只认路,不深潜)”

后面每一章会拆其中一步。这里先建立流水线地图,避免学算法时”只见树木不见森林”。

扩散全链条 9 步

5.1 每一步”为什么存在”(一句话版)

Section titled “5.1 每一步”为什么存在”(一句话版)”
步骤为什么需要本章你只需记住深讲章节
数据与表示网络只能吃张量,分子 ≠ 天然像素表示选错,后面全白搭第 2、8 章
前向加噪制造”从清晰到噪声”的连续课表加噪规则通常固定不学第 2 章
网络在任意噪声水平预测”怎么还原”骨干决定归纳偏置(2D/3D/等变)第 2、5 章
损失告诉网络对错常见是预测噪声,简单好用第 2、3 章
采样从噪声走回数据质量—速度权衡的主战场第 6 章
条件 / 引导不要随机药,要”对这个靶点的药”生物价值大半在这里第 6 章
评估好看 ≠ 有用必须挂钩化学有效性、结合、表型第 7 章
下游生成不是发表终点闭环才出科学结论第 7、8 章

5.2 和你已学的强化学习对照(防概念串味)

Section titled “5.2 和你已学的强化学习对照(防概念串味)”

如果你刚学完强化学习系列,这里主动划界,避免两套语言混成一个”都叫训练”的黑箱:

强化学习扩散生成
核心对象策略与环境交互、回报数据分布、加噪—去噪
典型输出动作序列 / 决策新样本(分子、图、结构)
“好”的定义累积回报高像真 + 满足条件 + 任务指标
优化的是什么期望奖励的最大化对数据分布的拟合

一句话记忆:扩散拟合”数据长什么样”,RL 优化”怎么做能拿到更多奖励”。 开题时,生成候选用扩散;若还要在湿实验反馈下做长期决策,才讨论 RL。两者可以流水线串联,但不是一回事。

有三个具体场景最容易把两者混淆,值得先说破:

  1. “我给扩散模型加了个打分函数引导生成,这是不是 RL?” 不是。你在采样时用一个分数函数(比如对接分数)去引导去噪方向,本质仍是在”数据分布”上做条件采样或后验加权,没有”与环境交互、观察状态转移、累积回报”的闭环。它更接近”带约束的生成”,而不是”策略优化”。只有当你把”生成—湿实验—反馈—更新策略”串成一个真正的序贯决策循环时,RL 才登场。

  2. “扩散和 RLHF 里的对齐是一回事吗?” 不是同一层的事。语言模型的 RLHF 是用人类偏好当奖励去微调一个已有的生成模型;扩散是生成模型本身的建模范式。近年确实有”用 RL 微调扩散模型”(如按某个奖励优化生成图像)的工作,但那是在扩散这个底座之上再套一层 RL,两者是叠加关系,不是替代关系。入门阶段先把扩散这个底座学扎实。

  3. “预训练(比如蛋白语言模型的 CPT)算 RL 吗?” 不算。继续预训练、自监督学习都是在拟合数据分布,属于扩散所在的”生成 / 表示学习”大类,和”优化期望奖励”的 RL 是不同的优化目标。把它们分清楚,你在读跨领域论文时就不会被”训练”这个词绕晕。

记住这个判断标准:只要没有”动作—环境反馈—累积回报”这个闭环,就不是 RL,哪怕它也在”训练”、也在”优化”、也用到了神经网络。


6. 生物应用地图:适合什么、不适合什么

Section titled “6. 生物应用地图:适合什么、不适合什么”

第 8 章会按案例深讲。这里先做选型雷达,避免一上来就重训大模型。

生物生成需求的四类落点
领域扩散常扮演的角色成功时你看到什么主要坑
小分子设计在口袋 / 药效团条件下生成构型化学有效、多样性高、对接分数分布改善训练分布外靶点;合成不可及;指标刷分
蛋白 / 肽骨架或全原子坐标生成、构象采样几何合理、二级结构像样SE(3) / 等变实现复杂;可折叠性是另一回事
生物图像增强、超分、缺模态补全、稀有表型合成视觉与下游分割 / 分类提升伪影被当成生物学信号;隐私与批次效应
组学表格缺失补全、增强稀有细胞状态下游分类 / 聚类更稳泄漏与虚假相关;比图像更难肉眼验真

四类落点的难度和成熟度差别很大,值得逐一说清楚它们各自的”扩散长什么样”:

  • 小分子设计是目前生态最成熟的一类。分子可以表示成 3D 原子坐标、2D 分子图或 SMILES 序列,不同表示对应不同的扩散变体(坐标扩散、图上扩散、离散序列扩散)。带口袋条件的生成是当前热点——把靶点口袋作为条件喂进网络,让模型只生成”能塞进这个口袋”的分子。评估这类任务时,光看”分子看起来合理”远远不够,必须叠加化学有效性(价键是否合法)、合成可及性(能不能真的做出来)、对接分数分布这些硬指标,第 7、8 章会给完整清单。

  • 蛋白 / 肽是最能体现扩散威力、也最考验工程的一类。蛋白主链的几何有强对称性——整体平移、旋转不应改变结构的合理性,所以这里的网络通常要满足 SE(3) 等变性,实现比普通图像扩散复杂得多。RFdiffusion 这类工作证明了扩散能设计出全新的、可折叠的蛋白骨架,但要记住一个关键分工:扩散产的是骨架(坐标),骨架上填什么氨基酸序列是另一个模型(如 ProteinMPNN)的事,最后还要用 AlphaFold 之类的工具验证”这个序列真能折叠成这个骨架”。第 8 章会把这条流水线拆开讲。

  • 生物图像(显微、病理、电镜)在技术上最接近自然图像扩散,可以直接复用大量成熟实现,常用来做数据增强、超分辨率、缺失模态补全、稀有表型合成。但它有一个特有的、致命的坑:扩散模型很擅长生成”看起来很真”的纹理,而这些纹理可能是凭空捏造的。在自然图像里多画一根头发无伤大雅,在病理图像里凭空生成一个”病灶”却可能误导诊断。所以生物图像生成的评估必须格外谨慎,且往往需要领域专家盲评。

  • 组学表格(单细胞、空间转录组等)是四类里最难、最容易踩坑的。数据是高维、稀疏、带强批次效应的向量,既不像图像有空间结构可供肉眼验真,也不像分子有明确的物理化学约束兜底。扩散在这里能做缺失补全、稀有细胞状态增强,但数据泄漏和虚假相关的风险极高——你很容易训出一个”下游指标很漂亮、实则记住了批次信号”的模型。这类任务上,评估协议(如 TSTR,用合成数据训练、真实数据测试)比模型本身更重要。

更倾向考虑扩散,若:

  1. 你需要的是多样候选,不是单个回归分数;
  2. 样本有明显空间 / 几何 / 图像结构,或已有成熟表示(点云、体素、潜空间);
  3. 你能接受训练 + 采样算力,或可用预训练 / 少步方法;
  4. 条件信息明确(口袋、标签、掩膜),需要可控生成;
  5. 下游有独立于生成模型的评价指标(对接、湿实验、专家审核)。

先别急着上扩散,若:

  1. 任务本质是分类 / 回归,样本量还够传统模型用;
  2. 只要极致速度、百万级秒级吞吐,且质量要求一般(先看 VAE / 轻量模型 / 检索);
  3. 数据量极少又无可靠预训练可迁移;
  4. 你无法定义”好样本”的任务指标——会陷入”图好看 / 分子看起来像”的自我循环;
  5. 监管 / 可解释性要求必须逐步可审计的简单模型。

6.3 预期结果 vs 常见失败(建立正确期待)

Section titled “6.3 预期结果 vs 常见失败(建立正确期待)”
预期(合理)失败表象往往真正原因
得到一批可用候选供筛选全是训练集近邻复制数据窄、过拟合、无新颖性指标
条件改变时输出跟着变条件”不听使唤”条件注入弱、CFG 未调、条件质量差
指标略优于旧生成基线FID / 好看但对接一塌糊涂评估选错,分布匹配 ≠ 生物学有用
采样可在小时级出库等一晚上才出几个步数过大未加速,未用潜空间 / 蒸馏

7. 讲解用最小公式(只为”名字对上号”)

Section titled “7. 讲解用最小公式(只为”名字对上号”)”

本章不推导。 只让你在论文里看到符号时不慌。第 2、3 章会把每个符号变成可调参数。

约定 x0x_0 为干净数据(一张图、一组坐标)。前向在时间步 t=1,,Tt=1,\ldots,T 上逐步加高斯噪声。工程上常用闭式一步到位

xt=αˉtx0+1αˉtε,εN(0,I)x_t = \sqrt{\bar\alpha_t}\, x_0 + \sqrt{1-\bar\alpha_t}\,\varepsilon,\qquad \varepsilon \sim \mathcal{N}(0,I)
符号含义现在只需知道
x0x_0真实样本你的分子 / 图像表示
tt噪声强度档位tt 大则更接近纯噪声
αˉt\bar\alpha_t由噪声日程算出的”还剩多少信号”β\beta schedule 决定
ε\varepsilon标准高斯噪声训练时网络常去预测它

为什么需要前向? 没有”已知的、可采样的加噪课表”,就没有稳定的监督信号教网络如何去噪。

7.2 训练目标(DDPM 最常见写法)

Section titled “7.2 训练目标(DDPM 最常见写法)”

网络 ϵθ(xt,t)\epsilon_\theta(x_t, t)(可再加条件 cc)学习预测噪声:

LEx0,t,ε[εϵθ(xt,t)2]\mathcal{L} \approx \mathbb{E}_{x_0,t,\varepsilon}\Big[\big\| \varepsilon - \epsilon_\theta(x_t, t) \big\|^2 \Big]

直觉:随便抽一个真实样本、一个时间档、一份噪声,合成糊版 xtx_t,看网络能否说出”这份糊是怎么糊上去的”。至于为什么常预测 ε\varepsilon 而不是直接预测 x0x_0,以及 vv-prediction 变体,是第 2、3 章的核心内容。

xTN(0,I)x_T \sim \mathcal{N}(0,I) 出发,反复用网络减噪,得到 x0x_0。步数 TT、是否 DDIM、是否引导,决定慢而精还是快而糙——第 6 章专讲。

7.4 参数预告表(见名知意,调法后置)

Section titled “7.4 参数预告表(见名知意,调法后置)”

学扩散最容易迷路的地方,是论文里一堆参数名扑面而来,却不知道每个”住在流水线的哪一步、调坏了会怎样”。下面这张表把你未来会反复碰到的旋钮先做个索引——现在不用会调,只要看到名字能对上位置即可。

参数 / 选择出现在流水线哪一步为什么存在调坏了大概什么现象深讲章节
数据表示最前端决定几何与对称性学不会化学约束、几何崩坏第 2、8 章
TT / 噪声日程 β\beta前向加噪规定噪声课表快慢过噪或欠噪,细节难学第 2 章
预测目标 ε/x0/v\varepsilon / x_0 / v损失数值稳定性与质量收敛慢或样本糊第 2、3 章
网络结构(U-Net/DiT/等变)骨干归纳偏置3D 任务误用 2D 骨干第 2、5 章
采样步数 / 求解器推理精度—成本权衡糊、几何崩、太慢第 6 章
CFG scale条件引导听条件 vs 保多样性过饱和或忽视条件第 6 章
任务指标选择评估是否生物学有用只会刷分布指标第 7 章

这张表也是整个系列的”目录索引”:任何一章你都可以回来对照,确认自己正在学的是哪一个旋钮。

7.5 前沿替代路线地图(先认名字,不深挖)

Section titled “7.5 前沿替代路线地图(先认名字,不深挖)”

你在社群、arXiv 上会不断刷到一堆”比扩散更快 / 更强”的新名字。入门阶段不需要判断谁取代谁,只需要知道它们各自想优化经典扩散流水线里的哪一环。这样等你第 7 章正式评估替代路线时,就不会被术语淹没。

经典环节较新方向(名字级)想优化什么可能代价
多步 DDPM 采样DDIM、更优 ODE / SDE 采样器更少步数、可复现极端少步时质量掉
多步教师模型一致性模型 / LCM、逐步蒸馏1–4 步出样训练更复杂,分布覆盖变化
扩散 SDE / 分数Flow Matching / 整流流更直的路径、常更少步生态与生物基线仍在追赶
像素空间扩散隐空间扩散(Latent)省算力依赖编码器质量
纯数据驱动扩散 + 物理 / 化学约束结果更合理实现与权衡更难
对抗生成扩散作主生成器换稳定与质量换来速度变慢

选型心态:先会走完 DDPM 全链条,再谈替换哪一环,不要被论文标题牵着换模型。这句话会在第 7 章的选型决策里再次出现。


8. 动手前的思维练习(不需要代码)

Section titled “8. 动手前的思维练习(不需要代码)”

这一章不写代码,但有两个”纸上练习”能立刻检验你是否真的建立了直觉。第 9 章会把它们变成可运行脚本。

练习 A:给你的课题归类。 拿你手头一个真实问题,先问三句:

  1. 我要的是一个最优答案,还是一簇候选
  2. 我的对象有没有可加噪、可去噪的连续 / 结构表示?
  3. 我有没有独立于生成模型的方式判断”生成得好不好”?

三个都指向”候选 / 有结构 / 有独立评估”,才更像扩散场景。

练习 B:口述加噪—去噪。 不看本章,向同事用 30 秒讲清”墨水搅匀再倒放”这个比喻,并说明网络到底学的是哪一步(答案:在任意脏度下预测该去掉的噪声)。讲不顺,说明还没内化,回到第 3 节。

练习 C:读论文时快速定位机制。 随便找一篇你领域里用扩散的论文,只看摘要和方法图,尝试在两分钟内回答三个问题:(1)它把数据表示成什么(坐标 / 图 / 像素 / 潜向量)?(2)它的条件是什么(口袋 / 文本 / 掩膜 / 无条件)?(3)它在哪一环做了改进(前向课表 / 网络骨干 / 采样加速 / 评估)?如果你能用本章 §5.1 的九步流水线和 §7.4 的参数表把这篇论文”归位”,说明你已经建立起阅读扩散文献的坐标系——这正是第 1 章最想给你的东西。反过来,如果三个问题里有卡住的,正好标记出你接下来该重点补的章节。


  • 能用自己的话说明:生成 ≠ 回归,扩散输出的是分布上的样本
  • 能画出或口述:前向加噪 → 反向去噪 的双向箭头
  • 能从质量、多样性、稳定性、速度、条件控制五维比较 VAE / GAN / 扩散
  • 能举一个你领域里的生成任务,并判断是否”更像扩散场景”
  • 知道全链条 9 步各自的主题
  • 认识符号 x0,t,αˉt,ε,ϵθx_0, t, \bar\alpha_t, \varepsilon, \epsilon_\theta 的含义(不要求推导)
  • 明确:扩散是候选引擎,不能替代化学有效性 / 对接 / 实验验证
  • 知道 DDIM / LCM / Flow Matching 是”后面可替换加速的名字”,现阶段不深挖

Q1. 某课题要预测化合物对某靶点的 IC50IC_{50},数据表已有 8000 条。是否应首选扩散模型?为什么?

参考要点

这更像回归 / 判别。标签够用时优先梯度提升 / 图神经网络回归等。扩散适合”生成新分子 / 新构象再筛选”,不是默认的亲和力回归器。只有当数据严重不平衡、要做增强时,才可能把生成当辅助,且须严防数据泄漏。

Q2. 相对 GAN,扩散最常被强调的两个优点、一个主要代价是什么?

参考要点

优点:训练更稳条件控制 / 样本质量在许多设定下更友好(多样性也常更好)。代价:采样多步、更慢更贵,可用加速 / 蒸馏缓解。

Q3. “生成的分子对接分数很高”是否足以说明扩散模型成功?还缺什么?

参考要点

不够。还要看:化学有效性与价键合理、新颖性(非训练集复制)、合成可及性、特异性 / 脱靶风险,以及是否过拟合了对接程序本身的 quirk。任务闭环指标 + 多样性 + 实验三者齐全才算数。

Q4. 你的同事说”我们用扩散模型生成蛋白,一步就能出结构,比 AlphaFold 快多了”。这句话里藏着哪两个概念混淆?

参考要点

两个混淆。其一,扩散生成通常不是”一步出结构”,而是多步迭代去噪(除非用了专门的少步蒸馏模型),“一步”这个描述本身就不准确。其二,也是更根本的——扩散生成和 AlphaFold 做的不是同一件事,不该直接比”快”。AlphaFold 是结构预测:给定序列,预测它折叠成什么样(一个输入对一个最可能的答案,本质更像回归);扩散蛋白设计是生成:从零画出全新的骨架候选。一个是”预测已有序列的结构”,一个是”设计不存在的新结构”,任务目标不同,拿运行速度横向对比没有意义。这正是本章 §2 “生成 ≠ 回归”和 §5.2 “扩散 ≠ RL、也 ≠ 判别预测”两条边界的综合应用。


  • 第 2 章 前向加噪与反向去噪:把本章 §7 的最小公式展开成 βt/αˉt\beta_t / \bar\alpha_t 噪声课表与反向高斯建模。
  • 第 3 章 DDPM 三式精讲:闭式加噪 / ε 损失 / 采样三式的完整讲解。
  • 第 4 章 与 GAN、VAE 对照:把本章 §4 的对比表深化为机制级对照与历史脉络。
  • 第 7 章 按数据结构选型:把本章 §6 的 Go/No-Go 升级为四层评估框架与决策树。
  • 第 8 章 生物 / 分子读者轨道:把 §6 的四类落点逐一做成案例。
  • 扩散模型导航:按机制族查模型清单,本系列不重复罗列。

文献 / 资源为什么看阅读深度建议
Ho et al., DDPM, 2020现代工程扩散的起点读摘要 + 方法直觉,公式留到第 2、3 章对照
Song et al., Score-based / SDE 系列统一”分数—扩散—采样”先看综述图,再按需深挖
Song et al., DDIM, 2021少步、可确定采样第 6 章精读动机
Ho & Salimans, Classifier-Free Guidance, 2022条件生成主力技巧第 6 章
计算生物学 / 药物设计中的扩散综述应用版图与常见坑第 8 章对照你的课题

说明:本章以教学坐标系与选型逻辑为主;具体数值与应用对比在后续章节按主题引用原文结论。