跳转到内容

强化学习超详细教程:第3章 - 现代算法、对齐与生物边界(SAC/离线RL/RLHF/DPO/GRPO)

本章是强化学习系列第 3 章:现代算法、大模型对齐,以及「CPT 自监督 ≠ 对齐 RL」的硬边界。

风格专业 + 科普。关键步骤给出简单公式,并解释每个符号/参数在干什么;同时讲清「为什么 → 怎么调 → 效果 → 被什么取代/还能增强什么」。
目标:能区分 在线控制算法(SAC/TD3)、离线/模仿LLM 对齐(RLHF / DPO / GRPO),并严格划清它们与 生物 CPT 自监督 的边界。
预计时间:3–5 周(每天 2–4 小时)
前置:第2章 搞清 TD、Q-learning、DQN、REINFORCE、PPO clip;知道 on/off-policy。


学完后,你应能:

  1. 用 1~2 个核心公式说明 SAC、TD3 相对 PPO 的适用场景。
  2. 说清 行为克隆 / 离线 RL 各自吃什么数据、怕什么失败。
  3. 写出 RLHF-PPO、DPO、GRPO 各自在优化什么,并解释「PPO 已被 DPO 取代」何时对、何时错。
  4. 严格区分:生物 CPT(自监督 next-token)≠ 偏好对齐(回报/偏好最大化)。
  5. 对真实生物 / 多组学 / 序列任务给出:要不要 RL、用哪一类、第一推荐 + 备选 + 风险

配套代码:

文件作用
dpo_toy.py最小 DPO:偏好对 → 抬高赢序列、压低输序列
bc_offline_demo.py行为克隆 vs 朴素离线 Q 的直觉对比
ppo_cartpole_sb3.py第2章 已有;对齐前的 on-policy 基线

📥 配套代码可直接下载运行dpo_toy.py · bc_offline_demo.py

符号含义调它时你在改什么
πref\pi_{\mathrm{ref}} / πSFT\pi_{\mathrm{SFT}}参考策略(常为 SFT 模型)对齐时「不许跑太远」的锚点
rϕ(x,y)r_\phi(x,y)奖励模型给「提示+回复」的标量分RLHF 里 PPO 的外置评委
β\betaKL / 温度 / 正则强度越大越贴参考模型,越不敢改
yw,yly_w, y_l偏好对中的胜/负回复DPO 的监督信号
Doff\mathcal{D}_{\mathrm{off}}离线数据集(历史轨迹)你能看到的全部经验
α\alpha(SAC)熵温度探索 vs 回报的权衡
πθ(s)\pi_\theta(\cdot\|s)随机策略连续控制里输出分布,不只是动作
Qθ1,Qθ2Q_{\theta_1}, Q_{\theta_2}双 Q 网络抑制过估计

第2章 的 s,a,r,γ,V,Q,Gt,rt(θ),A^,ϵs,a,r,\gamma,V,Q,G_t,r_t(\theta),\hat{A},\epsilon 继续沿用。


1. 一张图:从「玩游戏」到「对齐模型」

Section titled “1. 一张图:从「玩游戏」到「对齐模型」”
图示
主线在干什么你手头要有什么代表
在线控制边交互边学策略可仿真/可采样环境SAC、TD3、PPO
模仿 / 离线从历史数据学专家轨迹或实验日志BC、CQL、IQL
偏好对齐让序列更符合人类/规则偏好偏好对或可打分信号RLHF-PPO、DPO、GRPO
自监督 CPT预测下一个 token大规模无标注序列不是本阶段算法

一句话记忆

第3章 = 把策略学得更稳(SAC/TD3)+ 没环境也能学(离线/模仿)+ 把「人觉得好」写进目标(对齐)+ 别把 CPT 误当成 RL


2. SAC:连续控制里「敢探索」的默认选项之一

Section titled “2. SAC:连续控制里「敢探索」的默认选项之一”

PPO 在离散/很多控制任务上稳,但:

  • on-policy,样本效率一般;
  • 连续动作空间里,有时更希望 off-policy + 强探索

SAC(Soft Actor-Critic) 的核心思想:不只最大化回报,还最大化策略熵——鼓励「有把握时果断,不确定时多试」。

J(π)=Eπ[tγt(r(st,at)+αH(π(st)))]J(\pi)=\mathbb{E}_{\pi}\Big[\sum_t \gamma^t\big(r(s_t,a_t)+\alpha\,\mathcal{H}\big(\pi(\cdot|s_t)\big)\big)\Big]
符号含义白话
J(π)J(\pi)要最大化的目标长期回报 + 探索奖励
r(st,at)r(s_t,a_t)环境奖励任务本身的分
H(π(s))\mathcal{H}(\pi(\cdot\|s))在状态 ss 的策略熵动作分布越「摊开」越大
α>0\alpha>0温度系数熵这项有多重要

软 Q 的贝尔曼备份直觉:

Q(s,a)r+γ(Q(s,a)αlogπ(as)),aπ(s)Q(s,a)\approx r+\gamma\Big(Q(s',a')-\alpha\log\pi(a'|s')\Big),\quad a'\sim\pi(\cdot|s')

即:下一状态价值要扣掉「我太确定」的惩罚(或等价地奖励「我还保持随机」)。

实践中 SAC 还常用 双 Q 取 min,抑制过估计(与 TD3 同类稳招)。

旋钮常见感调大/调小
α\alpha(或自动调 α\alpha自动调很常见太大:乱探索;太小:变保守、易局部最优
学习率3e-4 量级常见不稳就降
replay buffer尽量大太小 → 过拟合近期轨迹
目标网络软更新 τ\tau0.005 量级太大目标跳;太小学得慢
奖励尺度任务相关奖励数量级会间接改变有效 α\alpha
  • 强项:连续控制、需要探索、希望 sample-efficient(相对 PPO)。
  • 弱项:实现与调参比 PPO 绕;离散大动作空间 / LLM token 空间不是它的主场。
方向说明
机器人/控制默认SAC 与 TD3 仍是强基线;很多工作是改网络、改数据、改奖励
更稳的离线变体有数据无在线交互时 → CQL/IQL 等(见第 5 节)
语言对齐不要默认上 SAC;对齐主流是偏好优化族

3. TD3:确定性策略的「稳妥派」

Section titled “3. TD3:确定性策略的「稳妥派」”

DDPG 把 Q-learning 思想做到连续动作,但容易 Q 过估计 → 策略崩
TD3(Twin Delayed DDPG) 用三板斧把它稳住。

  1. 双 Q 取小(Clipped Double Q):
y=r+γmini=1,2Qθi(s,a~)y=r+\gamma\min_{i=1,2}Q_{\theta_i'}(s',\tilde{a})
  1. 目标动作加噪再截断(Target Policy Smoothing):
a~=clip(πϕ(s)+ϵ,  amin,amax),ϵclip(N(0,σ),c,c)\tilde{a}=\mathrm{clip}\big(\pi_{\phi'}(s')+\epsilon,\;a_{\min},a_{\max}\big),\quad \epsilon\sim\mathrm{clip}(\mathcal{N}(0,\sigma),-c,c)
  1. 延迟更新 Actor(Delayed Policy Update):Critic 多更几步,再改策略。
符号含义作用
Qθ1,Qθ2Q_{\theta_1'},Q_{\theta_2'}两个目标 Critic取 min 抑制乐观偏差
πϕ\pi_{\phi'}目标 Actor慢速跟踪当前策略
ϵ\epsilon平滑噪声别对尖峰 Q 过拟合
延迟频率每 d 步更一次 Actor避免在不准的 Q 上猛更新
旋钮直觉
策略噪声 σ\sigma、clip cc太大等于乱抹目标;太小平滑不足
Actor 延迟 d常用 2:Critic 更两步,Actor 更一步
探索噪声(与目标噪声不同)采集数据时的动作扰动
双 Q 结构尽量保留,别为「省算力」随手砍
PPOSACTD3
策略随机随机 + 熵确定性为主
数据on-policyoff-policyoff-policy
样本效率一般较好较好
调参体感相对友好中等中等
典型域通用、部分离散连续控制连续控制
LLM 对齐经典 RLHF 用它基本不用基本不用

白话

  • 稳、通用、实现简单 → 先 PPO。
  • 连续控制、能大量 off-policy 重用数据 → SAC / TD3。
  • 偏好对齐大模型 → 跳出这三者,看第 6–9 节。
  • 更好的探索噪声、模型基 RL、大规模演示预训练 + 微调。
  • 在「不可在线试错」场景,被 离线 RL / 模仿 接管问题设定。

4. 模仿学习:有专家日志时的最短路径

Section titled “4. 模仿学习:有专家日志时的最短路径”

很多生物 / 实验室场景:

  • 没有可随便试错的环境(贵、慢、有风险);
  • 但有 历史成功实验、操作记录、专家轨迹

这时第一工具往往不是 PPO,而是 模仿学习(Imitation Learning)

关键公式:行为克隆(Behavior Cloning, BC)

Section titled “关键公式:行为克隆(Behavior Cloning, BC)”

把专家动作当标签,做监督:

LBC(θ)=E(s,a)DE[logπθ(as)]\mathcal{L}_{\mathrm{BC}}(\theta)=-\mathbb{E}_{(s,a)\sim\mathcal{D}_E}\big[\log\pi_\theta(a|s)\big]
符号含义
DE\mathcal{D}_E专家状态–动作数据集
πθ(as)\pi_\theta(a\|s)学徒策略
LBC\mathcal{L}_{\mathrm{BC}}负对数似然(分类/回归损失)

白话:专家在状态 ss 做了 aa,你就提高 π(as)\pi(a|s)。不显式要奖励。

问题表现缓解
复合误差稍偏一点 → 状态出分布 → 越错越远多数据覆盖;DAgger 等交互式模仿
多模态专家同一 ss 有多种合理 aa用随机策略/更好架构,别强行单峰
只有成功轨迹学不会「失败边缘如何救」加负例、约束、或转离线 RL
观测不全日志缺关键状态先补特征/表征,再 BC
  • 强项:实现简单、常能快速得到可用策略。
  • 弱项:专家多好,上限就多高;难「青出于蓝」。
  • 增强方向:GAIL/AIRL 等对抗模仿;BC 预训练 + RL 微调;与离线 RL 结合。

5. 离线 RL:只有历史数据,还想比专家更好

Section titled “5. 离线 RL:只有历史数据,还想比专家更好”

BC 只是「学得像」;离线 RL 想在固定数据集 Doff\mathcal{D}_{\mathrm{off}}优化回报,还可能超过平均专家。

难点:不能与环境交互补数据。若 Q 对「没见过的动作」盲目乐观,策略会选 OOD 动作 → 一上线就崩。这叫 分布外外推(OOD extrapolation)

关键直觉公式(以保守 Q 为例)

Section titled “关键直觉公式(以保守 Q 为例)”

标准 TD 目标:

y=r+γmaxaQ(s,a)y=r+\gamma\max_{a'}Q(s',a')

离线时 maxa\max_{a'} 很危险。保守方法(如 CQL 类思想)额外惩罚「数据里少见的动作」的 Q:

minQ α EsD,aπ[Q(s,a)]E(s,a)D[Q(s,a)]+LTD(Q)\min_Q\ \alpha\ \mathbb{E}_{s\sim\mathcal{D},\,a\sim\pi}\big[Q(s,a)\big]-\mathbb{E}_{(s,a)\sim\mathcal{D}}\big[Q(s,a)\big]+\mathcal{L}_{\mathrm{TD}}(Q)
含义
Eaπ[Q]\mathbb{E}_{a\sim\pi}[Q]当前策略会选的动作之 Q
E(s,a)D[Q]\mathbb{E}_{(s,a)\sim\mathcal{D}}[Q]数据集真实动作之 Q
α\alpha保守强度
LTD\mathcal{L}_{\mathrm{TD}}正常时序差分拟合

白话:数据里常见的动作 Q 可以高;策略乱试的生疏动作,Q 被往下压。

另一类 IQL 等则避免显式对 OOD 动作 query max,改走更保守的价值拟合路径(细节实现各异,记住动机即可:别相信没数据支撑的高分)。

旋钮含义
保守系数 α\alpha / 同类超参太大学成「不敢动」;太小 ≈ 普通 off-policy 乱外推
数据集质量覆盖比算法花活更重要
归一化回报 / 状态常能明显稳训练
评估协议离线分数 ≠ 在线真实表现,务必保留真实回放评估
图示
你有的东西更像
成功湿实验步骤记录BC
大量历史条件 + 产量/活性数值离线 RL 或 contextual bandit(问题更简单时别上完整 RL)
只能文献/数据库、无交互先表征与监督,不要硬挂 PPO
可做少量仿真或机器人筛选离线预训练 + 小预算在线微调
  • 更好的不确定性估计、模型基离线 RL、扩散策略、决策 Transformer 等序列建模路线。
  • 偏好数据 结合时,问题会滑向对齐(下一节),而不是经典控制。

6. 对齐总览:后训练在优化什么?

Section titled “6. 对齐总览:后训练在优化什么?”

大模型常见流水线:

图示
阶段信号目标一句话是不是 RL
预训练 / CPT下一 token 是否正确拟合数据分布(自监督)
SFT标准答案序列模仿示范(监督)
RLHF-PPO奖励模型标量分 + KL高分且不离参考太远
DPO偏好对 ywyly_w \succ y_l直接抬赢压输常被称作隐式 RL / 偏好优化
GRPO 等组内相对奖励少维护价值网络的策略优化是(策略梯度族变体)

关键分水岭
有没有「按偏好/回报改写生成策略」?

  • 有 → 对齐。
  • 只有 next-token / 数据混合抗遗忘 → CPT,不是对齐 RL

SFT 只会「像训练答案」,不会自动优化「更有用、更安全、更符合人类排序」。
人类又很难给每个 token 写精确标签,但能说:回复 A 比 B 好

  1. SFT:得到 πSFT\pi_{\mathrm{SFT}}
  2. 奖励模型 RM:用偏好数据学 rϕ(x,y)r_\phi(x,y)
  3. PPO:把 rϕr_\phi 当奖励,优化策略,并用 KL 拴住参考模型。

(1)奖励模型(Bradley–Terry 直觉)

人类偏好 ywylxy_w \succ y_l \mid x 的概率:

P(ywylx)=σ(rϕ(x,yw)rϕ(x,yl))P(y_w \succ y_l\mid x)=\sigma\big(r_\phi(x,y_w)-r_\phi(x,y_l)\big)

训练 RM 就是让胜者分更高、负者分更低。

(2)RL 目标(带 KL 惩罚)

maxπ ExD,yπ[rϕ(x,y)]βKL(π(x)πref(x))\max_{\pi}\ \mathbb{E}_{x\sim\mathcal{D},\,y\sim\pi}\big[r_\phi(x,y)\big] -\beta\,\mathrm{KL}\big(\pi(\cdot|x)\,\|\,\pi_{\mathrm{ref}}(\cdot|x)\big)
符号含义调它在改什么
xx提示 / 问题任务分布
yy模型生成序列策略输出
rϕr_\phi奖励模型打分「什么叫好」
πref\pi_{\mathrm{ref}}常取 SFT防跑偏、防崩溃
β\betaKL 系数越大越保守、越像 SFT

白话
PPO 在采样回复 → RM 打分 → 高分模式被强化;同时若偏离 SFT 太远,KL 扣分。

旋钮风险
β\beta 太小奖励黑客、胡言、风格漂移
β\beta 太大几乎不学偏好,白对齐
RM 质量RM 有洞 → 策略专攻漏洞(reward hacking)
PPO 采样长度/批大小不稳、方差大、成本高
多次迭代 RM–PPO可能过拟合 RM,而非真偏好
  • 早期 ChatGPT 类系统的核心配方之一。
  • :要维护策略、参考、RM、PPO 采样,工程重。
  • 不稳:RM 与 PPO 都可能成为故障点。
方向关系
DPO / IPO / KTO 等很多场景替代 RLHF-PPO 的「第三段」,更简单
GRPO / RLOO 等在可验证奖励 / 推理任务上增强或替换经典 PPO 实现
更好 RM / 过程奖励 / 宪法 AI增强信号质量,不必然取消 RL
在线人类反馈持续对齐,而不是一次离线偏好

何时仍用 RLHF-PPO?
需要在线采样、奖励是黑箱模型/多源混合、或团队已有成熟 PPO 对齐栈时。


8. DPO:跳过奖励模型与 PPO 的捷径

Section titled “8. DPO:跳过奖励模型与 PPO 的捷径”

RLHF-PPO 重:RM 会错,PPO 难训。
DPO(Direct Preference Optimization) 证明:在常见 RLHF 目标下,最优策略与偏好数据之间存在闭式关系,可直接当分类问题训练策略。

LDPO(θ)=E(x,yw,yl)[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]\mathcal{L}_{\mathrm{DPO}}(\theta)=-\mathbb{E}_{(x,y_w,y_l)}\Big[ \log\sigma\Big( \beta\log\frac{\pi_\theta(y_w|x)}{\pi_{\mathrm{ref}}(y_w|x)} -\beta\log\frac{\pi_\theta(y_l|x)}{\pi_{\mathrm{ref}}(y_l|x)} \Big) \Big]
符号含义白话
yw,yly_w,y_l赢 / 输回复人(或更强模型)标注的偏好对
πθ\pi_\theta正在训练的策略你的 LLM
πref\pi_{\mathrm{ref}}参考(常 SFT)锚定,防跑飞
β\beta温度/KL 强度越大越不敢离开 ref
σ\sigmasigmoid把分差变成「赢的概率」

直觉拆解

  • logπθ(yx)πref(yx)\log\frac{\pi_\theta(y|x)}{\pi_{\mathrm{ref}}(y|x)} ≈「相对 ref,我有多偏爱这条回复」。
  • ywy_w 这项要变大,对 yly_l 要变小。
  • 没有显式 rϕr_\phi,也没有 PPO 采样环。
图示
旋钮建议直觉
β\beta常用 0.1 量级起步;过小易过拟合偏好噪声,过大学不动
偏好数据质量比换优化器更重要;标签反了会系统性学坏
是否冻结 refref 固定是标准设定
学习率 / epoch小 LR、少过拟合;盯 eval 偏好准确率与下游任务
长度偏置模型可能爱写长;需长度归一或数据平衡
  • 工程简单:近似「带 ref 的对比监督」。
  • 许多开源对齐默认 DPO 族。
  • 静态偏好对 很香;对需要多轮在线探索的奖励,未必够。

「PPO 已被 DPO 取代」何时对、何时错?

Section titled “「PPO 已被 DPO 取代」何时对、何时错?”
说法何时大致对何时错
DPO 取代 RLHF-PPO离线偏好对充足、要对齐聊天/格式/风格奖励在线可算、要多步探索、工具调用轨迹优化
PPO 过时了在「偏好对 → 对齐 LLM」这条产品线上常被绕过机器人、游戏、控制、可验证推理 RL 里 PPO/GRPO 仍活跃
DPO 不是 RL实现上像监督学习目标源自 RLHF 最优策略,是偏好目标下的策略优化
  • IPO、ORPO、KTO、SimPO 等变体:改正则、改是否要 ref、改损失形态。
  • 更好的偏好采集(AI feedback、多目标偏好)。
  • 可验证奖励 RL(数学/代码)并行:不是二选一。

9. GRPO:组相对策略优化(直觉版)

Section titled “9. GRPO:组相对策略优化(直觉版)”

在可验证任务(数学、代码、某些推理)上:

  • 往往有 规则奖励(对/错、测试通过),不一定先训 RM;
  • 经典 PPO 要价值网络 VV,占显存、也难训;
  • 希望对同一提示采 一组 回答,用组内相对好坏当基线。

GRPO(Group Relative Policy Optimization) 一类方法的精神是:
同一 xx 采样 {y1,,yG}\{y_1,\ldots,y_G\},用组内奖励标准化得到优势,再做策略梯度式更新(并常保留 KL 到 ref)。

对同一提示的一组样本,先标准化奖励:

A^i=rimean({rj})std({rj})+ε\hat{A}_i=\frac{r_i-\mathrm{mean}(\{r_j\})}{\mathrm{std}(\{r_j\})+\varepsilon}

策略目标直觉(示意,略去实现细节与 clip 变体):

L1Gi=1GA^ilogπθ(yix)+βKL(πθπref)\mathcal{L}\sim-\frac{1}{G}\sum_{i=1}^{G}\hat{A}_i\log\pi_\theta(y_i|x) +\beta\,\mathrm{KL}\big(\pi_\theta\|\pi_{\mathrm{ref}}\big)
符号含义
GG每个提示的采样组大小
rir_iii 条回复的奖励(可验证规则或模型)
A^i\hat{A}_i组内相对优势
β\betaKL 强度

白话
不用单独 Critic 估「这题平均能拿几分」;同题多答,比一比谁更好,更好的增加概率。

注:工业实现(如 DeepSeek 系列相关技术报告中的设定)在细节上更完整(裁剪、动态 KL、奖励塑形等)。你读论文时抓:组采样、相对基线、弱化/去掉价值网 三点即可。

旋钮直觉
GG太小基线噪声大;太大成本高
奖励设计对/错过于稀疏时要过程奖励或形状化
β\beta / KL防灾难性漂移
采样温度影响组内多样性
题目难度配比全对或全错 → 相对优势消失
RLHF-PPODPOGRPO 类
主信号RM 标量偏好对组内奖励(常可验证)
要不要价值网不要通常不要
要不要在线采样训练时不要
典型场景通用人类偏好静态偏好对齐数学/代码/可打分推理
工程复杂度
  • 过程奖励模型(PRM)、搜索(Best-of-N、MCTS)、工具反馈。
  • 更稳的组统计与课程学习(由易到难)。
  • 与 DPO 不是互斥:可先 DPO 对齐风格,再 GRPO 冲可验证能力。

10. 生物 CPT vs 对齐 RL:必须画清的边界

Section titled “10. 生物 CPT vs 对齐 RL:必须画清的边界”

这一节对应你真正会踩的坑:把「领域继续预训练」误叫成「强化学习」。

维度生物 CPT(如领域继续预训练)对齐 RL(RLHF/DPO/GRPO)
数据无标注或弱标注序列(基因组、文献、多组学文本等)偏好对 / 奖励 / 可验证分数
损失交叉熵 next-token(及变体)偏好对比、策略梯度、组相对优势等
目标重塑能力剖面、适应领域分布最大化偏好或任务回报
抗遗忘手段数据混合、回放、正则、重放通用语料KL 到 ref、偏好覆盖、多目标奖励
是否需要环境交互RLHF/GRPO 常要采样;DPO 用离线偏好
典型成功信号领域基准↑、通用能力不崩更符合人类/规则的输出

证据分层(写进你的研究笔记)

Section titled “证据分层(写进你的研究笔记)”

讨论某篇生物基础模型论文时,强制三层:

  1. 全文证据:方法节写了 reward / PPO / preference / RLHF 吗?
  2. 摘要级证据:只提 alignment、instruction 还是明确 RL?
  3. 推断:仅因「后训练」「human feedback」就猜有 RL —— 不够

OmniGene-4 类 CPT 工作 的默认判断框架:

  • 若方法是 self-supervised next-token + data mixing/replay不是 RL
  • 若另有 preference ranking 或 reward model 段 → 那一段才是对齐
  • 「能力剖面变化」可由 CPT 数据配比解释,不必调用 RL。

CPT:

LCPT=E[logpθ(xtx<t)](可加通用/领域混合采样)\mathcal{L}_{\mathrm{CPT}}=-\mathbb{E}\big[\log p_\theta(x_{t}|x_{<t})\big] \quad\text{(可加通用/领域混合采样)}

DPO 对齐:

LDPO=logσ(β[Δlogπθ(yw)Δlogπθ(yl)])\mathcal{L}_{\mathrm{DPO}}=-\log\sigma\big(\beta[\Delta\log\pi_\theta(y_w)-\Delta\log\pi_\theta(y_l)]\big)

两者都改 θ\theta,但 监督信号本质不同

图示

你的问题第一推荐备选主要风险
领域语料续训、抗遗忘CPT + 数据混合/回放正则、LoRA 分区误当成 RL;配比不当伤通用能力
让模型回答更符合专家偏好DPO 族RLHF-PPO偏好噪声、长度黑客
代码/工作流可自动验GRPO / PPO + 规则奖励Best-of-N奖励稀疏、过拟合测试
实验条件 → 产量优化,仅有历史表监督/高斯过程/贝叶斯优化离线 RL过度建模成 MDP
有专家操作轨迹BCBC→小预算在线复合误差
机器人实验站、可仿真SAC/TD3/PPO离线预训练+微调sim-to-real
分子/序列设计有 oracle模型基优化 / 在线 RL进化算法oracle 偏差、模式崩塌
多组学数据库检索与问答SFT + RAG;必要时 DPO别为了「用上 RL」而 RL
图示

12. 失败模式专题(第3章 必记)

Section titled “12. 失败模式专题(第3章 必记)”
  • 现象:分很高,真实目标很糟。
  • 例子:RM 爱长答案 → 模型注水;测试只查关键词 → 模型堆关键词。
  • 缓解:持出分布评估、多奖励、周期性人工抽检、保留 KL。
  • 现象:仿真完美,上真实实验站全崩。
  • 缓解:域随机化、真实数据微调、保守离线策略。
  • 现象:同一配置方差巨大。
  • 缓解:多 seed、记录数据版本与解码参数、固定 eval 协议。
  • 现象:论文/组会把 next-token 续训写成「强化学习优化领域能力」。
  • 缓解:用第 10 节对照表;无偏好/回报证据就别写 RL。
  • 现象:离线 Q 虚高,部署即崩。
  • 缓解:保守惩罚、BC 正则、真实小流量评估。

项目目标通过标准
A. dpo_toy.py跑通最小 DPO训练后 P(yw)>P(yl)P(y_w)>P(y_l) 在玩具集上升
B. bc_offline_demo.py理解 BC vs 乱外推能指出「无保守的 max-Q」为何虚高
C. 概念迁移把你的课题填进选型表写出:信号类型、是否 RL、第一算法、风险
D. 论文精读任选 DPO 或 RLHF 原文能复述 1 个核心式 + 1 个消融结论
E. 生物边界操练对一篇 CPT 论文做三层证据表明确「有/无 RL」及依据段落
  • 第 1 周:SAC/TD3 概念 + 模仿/离线;跑 B。
  • 第 2 周:RLHF → DPO → GRPO;跑 A;完成 C、E。
  • 第 3 周(可选):读一篇与你方向最近的对齐或离线 RL 论文;写一页「可迁移点 / 不可迁移点」。

  1. SAC 的目标比普通回报最大化多了哪一项?α\alpha 太大/太小会怎样?
  2. TD3 的三板斧各解决 DDPG 的什么问题?
  3. BC 的损失为什么像监督学习?它的上限由什么决定?
  4. 离线 RL 最怕的 OOD 外推是什么?保守项在惩罚谁?
  5. RLHF 三段各自输入输出是什么?KL 项为何存在?
  6. 默写 DPO 损失里 βlogπθπref\beta\log\frac{\pi_\theta}{\pi_{\mathrm{ref}}} 的含义。
  7. 「PPO 已被 DPO 取代」:给一个对的任务、一个错的任务。
  8. GRPO 为何可以弱化价值网络?组内全对/全错时会发生什么?
  9. 用公式或表格区分 CPT 与 DPO。
  10. 你的课题:信号是什么?第一推荐算法?最大失败模式?

连续控制 / 现代 off-policy

  • Haarnoja et al., SAC;Fujimoto et al., TD3
  • Spinning Up / CleanRL 中的对应实现(对照公式看代码)

离线 / 模仿

  • Behavior Cloning 经典讨论 + DAgger 直觉
  • CQL / IQL 原文:先读动机与算法框,再决定是否深挖

对齐

  • InstructGPT / RLHF 综述段落:建立三段式
  • Rafailov et al., DPO(必读核心式)
  • 可验证奖励与组相对方法的技术报告(抓组采样与基线,不先抠全部工程)

生物接口

  • 你的领域 CPT 论文方法节:只标注「数据、损失、抗遗忘」,检查有无 reward/preference
  • 第1–2章 文档中的翻译表,与本章第 11 节对照使用

读法依旧:

更新式 / 稳定技巧 / 数据假设 / 适用动作与信号类型 —— 四样抓到手再谈细节证明。


  • 能画清:在线控制 vs 离线/模仿 vs 对齐 vs CPT
  • 能解释 SAC 熵项、TD3 三板斧各 1 句 + 关键符号
  • 能写出 BC 损失、离线保守思想、RLHF 目标、DPO 损失(不必背全推导)
  • 能说明 GRPO 相对 PPO 的核心简化
  • 对「DPO 取代 PPO」给出正确边界
  • 对一篇生物 CPT 论文完成三层证据判断(有/无 RL)
  • 跑通 dpo_toy.py,并读懂 bc_offline_demo.py 的结论
  • 为自己课题填写:信号 → 算法 → 风险 → 评估

第4章 世界模型、Agent、评估与开题论证 将覆盖:

  1. 世界模型与模型基 RL
  2. 多智能体、工具使用 agent、过程监督
  3. 评估体系:离线指标、人类评估、生物学下游真指标
  4. 把对齐与 CPT 编进同一条训练课程的工程清单
  5. 开题级:你的多组学数据上「该不该上 RL」的书面论证模板

  1. Haarnoja et al., Soft Actor-Critic, 2018 — arXiv:1801.01290。最大熵目标与自动温度调节。
  2. Fujimoto et al., Addressing Function Approximation Error in Actor-Critic Methods (TD3), 2018 — arXiv:1802.09477。双 Q、目标平滑、延迟更新三板斧。
  3. Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), 2022 — arXiv:2203.02155。RLHF 三段式的原始工作。
  4. Rafailov et al., Direct Preference Optimization, 2023 — arXiv:2305.18290。DPO 闭式关系与损失,本章核心式来源。
  5. Shao et al., DeepSeekMath (GRPO), 2024 — arXiv:2402.03300。组相对策略优化的技术设定。
  6. Kumar et al., Conservative Q-Learning for Offline RL (CQL), 2020 — arXiv:2006.04779。离线 RL 保守惩罚思想。