强化学习超详细教程:第3章 - 现代算法、对齐与生物边界(SAC/离线RL/RLHF/DPO/GRPO)
本章是强化学习系列第 3 章:现代算法、大模型对齐,以及「CPT 自监督 ≠ 对齐 RL」的硬边界。
风格:专业 + 科普。关键步骤给出简单公式,并解释每个符号/参数在干什么;同时讲清「为什么 → 怎么调 → 效果 → 被什么取代/还能增强什么」。
目标:能区分 在线控制算法(SAC/TD3)、离线/模仿、LLM 对齐(RLHF / DPO / GRPO),并严格划清它们与 生物 CPT 自监督 的边界。
预计时间:3–5 周(每天 2–4 小时)
前置:第2章 搞清 TD、Q-learning、DQN、REINFORCE、PPO clip;知道 on/off-policy。
0. 本阶段你将得到什么
Section titled “0. 本阶段你将得到什么”学完后,你应能:
- 用 1~2 个核心公式说明 SAC、TD3 相对 PPO 的适用场景。
- 说清 行为克隆 / 离线 RL 各自吃什么数据、怕什么失败。
- 写出 RLHF-PPO、DPO、GRPO 各自在优化什么,并解释「PPO 已被 DPO 取代」何时对、何时错。
- 严格区分:生物 CPT(自监督 next-token)≠ 偏好对齐(回报/偏好最大化)。
- 对真实生物 / 多组学 / 序列任务给出:要不要 RL、用哪一类、第一推荐 + 备选 + 风险。
配套代码:
| 文件 | 作用 |
|---|---|
dpo_toy.py | 最小 DPO:偏好对 → 抬高赢序列、压低输序列 |
bc_offline_demo.py | 行为克隆 vs 朴素离线 Q 的直觉对比 |
ppo_cartpole_sb3.py | 第2章 已有;对齐前的 on-policy 基线 |
📥 配套代码可直接下载运行:dpo_toy.py · bc_offline_demo.py
本阶段新增符号约定
Section titled “本阶段新增符号约定”| 符号 | 含义 | 调它时你在改什么 |
|---|---|---|
| / | 参考策略(常为 SFT 模型) | 对齐时「不许跑太远」的锚点 |
| 奖励模型给「提示+回复」的标量分 | RLHF 里 PPO 的外置评委 | |
| KL / 温度 / 正则强度 | 越大越贴参考模型,越不敢改 | |
| 偏好对中的胜/负回复 | DPO 的监督信号 | |
| 离线数据集(历史轨迹) | 你能看到的全部经验 | |
| (SAC) | 熵温度 | 探索 vs 回报的权衡 |
| 随机策略 | 连续控制里输出分布,不只是动作 | |
| 双 Q 网络 | 抑制过估计 |
第2章 的 继续沿用。
1. 一张图:从「玩游戏」到「对齐模型」
Section titled “1. 一张图:从「玩游戏」到「对齐模型」”flowchart TB
subgraph 在线交互
SAC[SAC / TD3<br/>连续控制]
PPO2[PPO<br/>通用稳妥]
end
subgraph 只有日志
BC[行为克隆 BC]
OFF[离线 RL<br/>CQL / IQL 等]
end
subgraph 大模型后训练
SFT[SFT 监督微调]
RM[奖励模型 RM]
RLHFPPO[RLHF-PPO]
DPO[DPO]
GRPO[GRPO 等]
SFT --> RM --> RLHFPPO
SFT --> DPO
SFT --> GRPO
end
subgraph 不是 RL
CPT[生物 CPT<br/>自监督 next-token]
MIX[数据混合 / 回放<br/>抗遗忘]
end | 主线 | 在干什么 | 你手头要有什么 | 代表 |
|---|---|---|---|
| 在线控制 | 边交互边学策略 | 可仿真/可采样环境 | SAC、TD3、PPO |
| 模仿 / 离线 | 从历史数据学 | 专家轨迹或实验日志 | BC、CQL、IQL |
| 偏好对齐 | 让序列更符合人类/规则偏好 | 偏好对或可打分信号 | RLHF-PPO、DPO、GRPO |
| 自监督 CPT | 预测下一个 token | 大规模无标注序列 | 不是本阶段算法 |
一句话记忆:
第3章 = 把策略学得更稳(SAC/TD3)+ 没环境也能学(离线/模仿)+ 把「人觉得好」写进目标(对齐)+ 别把 CPT 误当成 RL。
2. SAC:连续控制里「敢探索」的默认选项之一
Section titled “2. SAC:连续控制里「敢探索」的默认选项之一”为什么需要它?
Section titled “为什么需要它?”PPO 在离散/很多控制任务上稳,但:
- 是 on-policy,样本效率一般;
- 连续动作空间里,有时更希望 off-policy + 强探索。
SAC(Soft Actor-Critic) 的核心思想:不只最大化回报,还最大化策略熵——鼓励「有把握时果断,不确定时多试」。
关键公式:最大熵目标
Section titled “关键公式:最大熵目标”| 符号 | 含义 | 白话 |
|---|---|---|
| 要最大化的目标 | 长期回报 + 探索奖励 | |
| 环境奖励 | 任务本身的分 | |
| 在状态 的策略熵 | 动作分布越「摊开」越大 | |
| 温度系数 | 熵这项有多重要 |
软 Q 的贝尔曼备份直觉:
即:下一状态价值要扣掉「我太确定」的惩罚(或等价地奖励「我还保持随机」)。
实践中 SAC 还常用 双 Q 取 min,抑制过估计(与 TD3 同类稳招)。
| 旋钮 | 常见感 | 调大/调小 |
|---|---|---|
| (或自动调 ) | 自动调很常见 | 太大:乱探索;太小:变保守、易局部最优 |
| 学习率 | 3e-4 量级常见 | 不稳就降 |
| replay buffer | 尽量大 | 太小 → 过拟合近期轨迹 |
| 目标网络软更新 | 0.005 量级 | 太大目标跳;太小学得慢 |
| 奖励尺度 | 任务相关 | 奖励数量级会间接改变有效 |
效果 / 适用
Section titled “效果 / 适用”- 强项:连续控制、需要探索、希望 sample-efficient(相对 PPO)。
- 弱项:实现与调参比 PPO 绕;离散大动作空间 / LLM token 空间不是它的主场。
被什么取代 / 还能增强什么?
Section titled “被什么取代 / 还能增强什么?”| 方向 | 说明 |
|---|---|
| 机器人/控制默认 | SAC 与 TD3 仍是强基线;很多工作是改网络、改数据、改奖励 |
| 更稳的离线变体 | 有数据无在线交互时 → CQL/IQL 等(见第 5 节) |
| 语言对齐 | 不要默认上 SAC;对齐主流是偏好优化族 |
3. TD3:确定性策略的「稳妥派」
Section titled “3. TD3:确定性策略的「稳妥派」”为什么需要它?
Section titled “为什么需要它?”DDPG 把 Q-learning 思想做到连续动作,但容易 Q 过估计 → 策略崩。
TD3(Twin Delayed DDPG) 用三板斧把它稳住。
关键公式与三板斧
Section titled “关键公式与三板斧”- 双 Q 取小(Clipped Double Q):
- 目标动作加噪再截断(Target Policy Smoothing):
- 延迟更新 Actor(Delayed Policy Update):Critic 多更几步,再改策略。
| 符号 | 含义 | 作用 |
|---|---|---|
| 两个目标 Critic | 取 min 抑制乐观偏差 | |
| 目标 Actor | 慢速跟踪当前策略 | |
| 平滑噪声 | 别对尖峰 Q 过拟合 | |
| 延迟频率 | 每 d 步更一次 Actor | 避免在不准的 Q 上猛更新 |
| 旋钮 | 直觉 |
|---|---|
| 策略噪声 、clip | 太大等于乱抹目标;太小平滑不足 |
| Actor 延迟 d | 常用 2:Critic 更两步,Actor 更一步 |
| 探索噪声(与目标噪声不同) | 采集数据时的动作扰动 |
| 双 Q 结构 | 尽量保留,别为「省算力」随手砍 |
SAC vs TD3 vs PPO(选型速记)
Section titled “SAC vs TD3 vs PPO(选型速记)”| PPO | SAC | TD3 | |
|---|---|---|---|
| 策略 | 随机 | 随机 + 熵 | 确定性为主 |
| 数据 | on-policy | off-policy | off-policy |
| 样本效率 | 一般 | 较好 | 较好 |
| 调参体感 | 相对友好 | 中等 | 中等 |
| 典型域 | 通用、部分离散 | 连续控制 | 连续控制 |
| LLM 对齐 | 经典 RLHF 用它 | 基本不用 | 基本不用 |
白话:
- 要 稳、通用、实现简单 → 先 PPO。
- 连续控制、能大量 off-policy 重用数据 → SAC / TD3。
- 要 偏好对齐大模型 → 跳出这三者,看第 6–9 节。
被什么增强?
Section titled “被什么增强?”- 更好的探索噪声、模型基 RL、大规模演示预训练 + 微调。
- 在「不可在线试错」场景,被 离线 RL / 模仿 接管问题设定。
4. 模仿学习:有专家日志时的最短路径
Section titled “4. 模仿学习:有专家日志时的最短路径”为什么需要它?
Section titled “为什么需要它?”很多生物 / 实验室场景:
- 没有可随便试错的环境(贵、慢、有风险);
- 但有 历史成功实验、操作记录、专家轨迹。
这时第一工具往往不是 PPO,而是 模仿学习(Imitation Learning)。
关键公式:行为克隆(Behavior Cloning, BC)
Section titled “关键公式:行为克隆(Behavior Cloning, BC)”把专家动作当标签,做监督:
| 符号 | 含义 |
|---|---|
| 专家状态–动作数据集 | |
| 学徒策略 | |
| 负对数似然(分类/回归损失) |
白话:专家在状态 做了 ,你就提高 。不显式要奖励。
怎么调 / 常见坑
Section titled “怎么调 / 常见坑”| 问题 | 表现 | 缓解 |
|---|---|---|
| 复合误差 | 稍偏一点 → 状态出分布 → 越错越远 | 多数据覆盖;DAgger 等交互式模仿 |
| 多模态专家 | 同一 有多种合理 | 用随机策略/更好架构,别强行单峰 |
| 只有成功轨迹 | 学不会「失败边缘如何救」 | 加负例、约束、或转离线 RL |
| 观测不全 | 日志缺关键状态 | 先补特征/表征,再 BC |
- 强项:实现简单、常能快速得到可用策略。
- 弱项:专家多好,上限就多高;难「青出于蓝」。
- 增强方向:GAIL/AIRL 等对抗模仿;BC 预训练 + RL 微调;与离线 RL 结合。
5. 离线 RL:只有历史数据,还想比专家更好
Section titled “5. 离线 RL:只有历史数据,还想比专家更好”为什么需要它?
Section titled “为什么需要它?”BC 只是「学得像」;离线 RL 想在固定数据集 上 优化回报,还可能超过平均专家。
难点:不能与环境交互补数据。若 Q 对「没见过的动作」盲目乐观,策略会选 OOD 动作 → 一上线就崩。这叫 分布外外推(OOD extrapolation)。
关键直觉公式(以保守 Q 为例)
Section titled “关键直觉公式(以保守 Q 为例)”标准 TD 目标:
离线时 很危险。保守方法(如 CQL 类思想)额外惩罚「数据里少见的动作」的 Q:
| 项 | 含义 |
|---|---|
| 当前策略会选的动作之 Q | |
| 数据集真实动作之 Q | |
| 保守强度 | |
| 正常时序差分拟合 |
白话:数据里常见的动作 Q 可以高;策略乱试的生疏动作,Q 被往下压。
另一类 IQL 等则避免显式对 OOD 动作 query max,改走更保守的价值拟合路径(细节实现各异,记住动机即可:别相信没数据支撑的高分)。
| 旋钮 | 含义 |
|---|---|
| 保守系数 / 同类超参 | 太大学成「不敢动」;太小 ≈ 普通 off-policy 乱外推 |
| 数据集质量 | 覆盖比算法花活更重要 |
| 归一化回报 / 状态 | 常能明显稳训练 |
| 评估协议 | 离线分数 ≠ 在线真实表现,务必保留真实回放评估 |
与 BC 怎么选?
Section titled “与 BC 怎么选?”flowchart TD
Q1{有奖励标签或可构造回报吗?}
Q1 -->|否| BC[先 BC / 偏好学习]
Q1 -->|是| Q2{数据覆盖够广吗?}
Q2 -->|窄、几乎纯专家| BC2[BC 往往更稳]
Q2 -->|有杂、有失败、有多样策略| OFF[试离线 RL]
OFF --> Q3{上线评估是否崩?}
Q3 -->|崩| C[加强保守 / 退回 BC 预训练]
Q3 -->|稳| OK[再考虑小规模在线微调] 生物场景翻译
Section titled “生物场景翻译”| 你有的东西 | 更像 |
|---|---|
| 成功湿实验步骤记录 | BC |
| 大量历史条件 + 产量/活性数值 | 离线 RL 或 contextual bandit(问题更简单时别上完整 RL) |
| 只能文献/数据库、无交互 | 先表征与监督,不要硬挂 PPO |
| 可做少量仿真或机器人筛选 | 离线预训练 + 小预算在线微调 |
被什么增强?
Section titled “被什么增强?”- 更好的不确定性估计、模型基离线 RL、扩散策略、决策 Transformer 等序列建模路线。
- 与 偏好数据 结合时,问题会滑向对齐(下一节),而不是经典控制。
6. 对齐总览:后训练在优化什么?
Section titled “6. 对齐总览:后训练在优化什么?”大模型常见流水线:
flowchart LR PT[预训练 / CPT<br/>next-token] --> SFT[SFT<br/>示范应答] SFT --> ALN[对齐<br/>偏好/奖励] ALN --> A1[RLHF-PPO] ALN --> A2[DPO] ALN --> A3[GRPO 等]
| 阶段 | 信号 | 目标一句话 | 是不是 RL |
|---|---|---|---|
| 预训练 / CPT | 下一 token 是否正确 | 拟合数据分布 | 否(自监督) |
| SFT | 标准答案序列 | 模仿示范 | 否(监督) |
| RLHF-PPO | 奖励模型标量分 + KL | 高分且不离参考太远 | 是 |
| DPO | 偏好对 | 直接抬赢压输 | 常被称作隐式 RL / 偏好优化 |
| GRPO 等 | 组内相对奖励 | 少维护价值网络的策略优化 | 是(策略梯度族变体) |
关键分水岭:
有没有「按偏好/回报改写生成策略」?
- 有 → 对齐。
- 只有 next-token / 数据混合抗遗忘 → CPT,不是对齐 RL。
7. RLHF-PPO:经典三段式
Section titled “7. RLHF-PPO:经典三段式”为什么需要它?
Section titled “为什么需要它?”SFT 只会「像训练答案」,不会自动优化「更有用、更安全、更符合人类排序」。
人类又很难给每个 token 写精确标签,但能说:回复 A 比 B 好。
- SFT:得到 。
- 奖励模型 RM:用偏好数据学 。
- PPO:把 当奖励,优化策略,并用 KL 拴住参考模型。
(1)奖励模型(Bradley–Terry 直觉)
人类偏好 的概率:
训练 RM 就是让胜者分更高、负者分更低。
(2)RL 目标(带 KL 惩罚)
| 符号 | 含义 | 调它在改什么 |
|---|---|---|
| 提示 / 问题 | 任务分布 | |
| 模型生成序列 | 策略输出 | |
| 奖励模型打分 | 「什么叫好」 | |
| 常取 SFT | 防跑偏、防崩溃 | |
| KL 系数 | 越大越保守、越像 SFT |
白话:
PPO 在采样回复 → RM 打分 → 高分模式被强化;同时若偏离 SFT 太远,KL 扣分。
| 旋钮 | 风险 |
|---|---|
| 太小 | 奖励黑客、胡言、风格漂移 |
| 太大 | 几乎不学偏好,白对齐 |
| RM 质量 | RM 有洞 → 策略专攻漏洞(reward hacking) |
| PPO 采样长度/批大小 | 不稳、方差大、成本高 |
| 多次迭代 RM–PPO | 可能过拟合 RM,而非真偏好 |
- 早期 ChatGPT 类系统的核心配方之一。
- 贵:要维护策略、参考、RM、PPO 采样,工程重。
- 不稳:RM 与 PPO 都可能成为故障点。
被什么取代 / 增强?
Section titled “被什么取代 / 增强?”| 方向 | 关系 |
|---|---|
| DPO / IPO / KTO 等 | 很多场景替代 RLHF-PPO 的「第三段」,更简单 |
| GRPO / RLOO 等 | 在可验证奖励 / 推理任务上增强或替换经典 PPO 实现 |
| 更好 RM / 过程奖励 / 宪法 AI | 增强信号质量,不必然取消 RL |
| 在线人类反馈 | 持续对齐,而不是一次离线偏好 |
何时仍用 RLHF-PPO?
需要在线采样、奖励是黑箱模型/多源混合、或团队已有成熟 PPO 对齐栈时。
8. DPO:跳过奖励模型与 PPO 的捷径
Section titled “8. DPO:跳过奖励模型与 PPO 的捷径”为什么需要它?
Section titled “为什么需要它?”RLHF-PPO 重:RM 会错,PPO 难训。
DPO(Direct Preference Optimization) 证明:在常见 RLHF 目标下,最优策略与偏好数据之间存在闭式关系,可直接当分类问题训练策略。
| 符号 | 含义 | 白话 |
|---|---|---|
| 赢 / 输回复 | 人(或更强模型)标注的偏好对 | |
| 正在训练的策略 | 你的 LLM | |
| 参考(常 SFT) | 锚定,防跑飞 | |
| 温度/KL 强度 | 越大越不敢离开 ref | |
| sigmoid | 把分差变成「赢的概率」 |
直觉拆解:
- ≈「相对 ref,我有多偏爱这条回复」。
- 对 这项要变大,对 要变小。
- 没有显式 ,也没有 PPO 采样环。
flowchart LR Pref[偏好对 y_w ≻ y_l] --> DPO[DPO 损失] Ref[π_ref] --> DPO DPO --> Pi[更新 π_θ] Pi -->|抬高| Yw[赢序列概率] Pi -->|压低| Yl[输序列概率]
| 旋钮 | 建议直觉 |
|---|---|
| 常用 0.1 量级起步;过小易过拟合偏好噪声,过大学不动 | |
| 偏好数据质量 | 比换优化器更重要;标签反了会系统性学坏 |
| 是否冻结 ref | ref 固定是标准设定 |
| 学习率 / epoch | 小 LR、少过拟合;盯 eval 偏好准确率与下游任务 |
| 长度偏置 | 模型可能爱写长;需长度归一或数据平衡 |
- 工程简单:近似「带 ref 的对比监督」。
- 许多开源对齐默认 DPO 族。
- 对 静态偏好对 很香;对需要多轮在线探索的奖励,未必够。
「PPO 已被 DPO 取代」何时对、何时错?
Section titled “「PPO 已被 DPO 取代」何时对、何时错?”| 说法 | 何时大致对 | 何时错 |
|---|---|---|
| DPO 取代 RLHF-PPO | 离线偏好对充足、要对齐聊天/格式/风格 | 奖励在线可算、要多步探索、工具调用轨迹优化 |
| PPO 过时了 | 在「偏好对 → 对齐 LLM」这条产品线上常被绕过 | 机器人、游戏、控制、可验证推理 RL 里 PPO/GRPO 仍活跃 |
| DPO 不是 RL | 实现上像监督学习 | 目标源自 RLHF 最优策略,是偏好目标下的策略优化 |
还能增强什么?
Section titled “还能增强什么?”- IPO、ORPO、KTO、SimPO 等变体:改正则、改是否要 ref、改损失形态。
- 更好的偏好采集(AI feedback、多目标偏好)。
- 与 可验证奖励 RL(数学/代码)并行:不是二选一。
9. GRPO:组相对策略优化(直觉版)
Section titled “9. GRPO:组相对策略优化(直觉版)”为什么需要它?
Section titled “为什么需要它?”在可验证任务(数学、代码、某些推理)上:
- 往往有 规则奖励(对/错、测试通过),不一定先训 RM;
- 经典 PPO 要价值网络 ,占显存、也难训;
- 希望对同一提示采 一组 回答,用组内相对好坏当基线。
GRPO(Group Relative Policy Optimization) 一类方法的精神是:
同一 采样 ,用组内奖励标准化得到优势,再做策略梯度式更新(并常保留 KL 到 ref)。
关键公式(教学简化)
Section titled “关键公式(教学简化)”对同一提示的一组样本,先标准化奖励:
策略目标直觉(示意,略去实现细节与 clip 变体):
| 符号 | 含义 |
|---|---|
| 每个提示的采样组大小 | |
| 第 条回复的奖励(可验证规则或模型) | |
| 组内相对优势 | |
| KL 强度 |
白话:
不用单独 Critic 估「这题平均能拿几分」;同题多答,比一比谁更好,更好的增加概率。
注:工业实现(如 DeepSeek 系列相关技术报告中的设定)在细节上更完整(裁剪、动态 KL、奖励塑形等)。你读论文时抓:组采样、相对基线、弱化/去掉价值网 三点即可。
| 旋钮 | 直觉 |
|---|---|
| 太小基线噪声大;太大成本高 | |
| 奖励设计 | 对/错过于稀疏时要过程奖励或形状化 |
| / KL | 防灾难性漂移 |
| 采样温度 | 影响组内多样性 |
| 题目难度配比 | 全对或全错 → 相对优势消失 |
与 PPO / DPO 对比
Section titled “与 PPO / DPO 对比”| RLHF-PPO | DPO | GRPO 类 | |
|---|---|---|---|
| 主信号 | RM 标量 | 偏好对 | 组内奖励(常可验证) |
| 要不要价值网 | 要 | 不要 | 通常不要 |
| 要不要在线采样 | 要 | 训练时不要 | 要 |
| 典型场景 | 通用人类偏好 | 静态偏好对齐 | 数学/代码/可打分推理 |
| 工程复杂度 | 高 | 低 | 中 |
被什么增强?
Section titled “被什么增强?”- 过程奖励模型(PRM)、搜索(Best-of-N、MCTS)、工具反馈。
- 更稳的组统计与课程学习(由易到难)。
- 与 DPO 不是互斥:可先 DPO 对齐风格,再 GRPO 冲可验证能力。
10. 生物 CPT vs 对齐 RL:必须画清的边界
Section titled “10. 生物 CPT vs 对齐 RL:必须画清的边界”这一节对应你真正会踩的坑:把「领域继续预训练」误叫成「强化学习」。
| 维度 | 生物 CPT(如领域继续预训练) | 对齐 RL(RLHF/DPO/GRPO) |
|---|---|---|
| 数据 | 无标注或弱标注序列(基因组、文献、多组学文本等) | 偏好对 / 奖励 / 可验证分数 |
| 损失 | 交叉熵 next-token(及变体) | 偏好对比、策略梯度、组相对优势等 |
| 目标 | 重塑能力剖面、适应领域分布 | 最大化偏好或任务回报 |
| 抗遗忘手段 | 数据混合、回放、正则、重放通用语料 | KL 到 ref、偏好覆盖、多目标奖励 |
| 是否需要环境交互 | 否 | RLHF/GRPO 常要采样;DPO 用离线偏好 |
| 典型成功信号 | 领域基准↑、通用能力不崩 | 更符合人类/规则的输出 |
证据分层(写进你的研究笔记)
Section titled “证据分层(写进你的研究笔记)”讨论某篇生物基础模型论文时,强制三层:
- 全文证据:方法节写了 reward / PPO / preference / RLHF 吗?
- 摘要级证据:只提 alignment、instruction 还是明确 RL?
- 推断:仅因「后训练」「human feedback」就猜有 RL —— 不够。
对 OmniGene-4 类 CPT 工作 的默认判断框架:
- 若方法是 self-supervised next-token + data mixing/replay → 不是 RL。
- 若另有 preference ranking 或 reward model 段 → 那一段才是对齐。
- 「能力剖面变化」可由 CPT 数据配比解释,不必调用 RL。
公式级一句话
Section titled “公式级一句话”CPT:
DPO 对齐:
两者都改 ,但 监督信号本质不同。
flowchart TB
subgraph 不是RL
CPT[CPT / 预训练]
SFT[SFT]
end
subgraph 是或源自偏好目标
RM[奖励模型]
PPOA[RLHF-PPO]
DPOA[DPO]
GRPOA[GRPO]
end
CPT --> SFT
SFT --> RM --> PPOA
SFT --> DPOA
SFT --> GRPOA 11. 生物 / 多组学任务选型表
Section titled “11. 生物 / 多组学任务选型表”| 你的问题 | 第一推荐 | 备选 | 主要风险 |
|---|---|---|---|
| 领域语料续训、抗遗忘 | CPT + 数据混合/回放 | 正则、LoRA 分区 | 误当成 RL;配比不当伤通用能力 |
| 让模型回答更符合专家偏好 | DPO 族 | RLHF-PPO | 偏好噪声、长度黑客 |
| 代码/工作流可自动验 | GRPO / PPO + 规则奖励 | Best-of-N | 奖励稀疏、过拟合测试 |
| 实验条件 → 产量优化,仅有历史表 | 先 监督/高斯过程/贝叶斯优化 | 离线 RL | 过度建模成 MDP |
| 有专家操作轨迹 | BC | BC→小预算在线 | 复合误差 |
| 机器人实验站、可仿真 | SAC/TD3/PPO | 离线预训练+微调 | sim-to-real |
| 分子/序列设计有 oracle | 模型基优化 / 在线 RL | 进化算法 | oracle 偏差、模式崩塌 |
| 多组学数据库检索与问答 | SFT + RAG;必要时 DPO | — | 别为了「用上 RL」而 RL |
决策树(实用版)
Section titled “决策树(实用版)”flowchart TD
A{能否定义清晰奖励或偏好?}
A -->|否,只有大规模无标序列| CPT[做 CPT/SFT,不是 RL]
A -->|有偏好对| DPO[DPO 族]
A -->|有可验证分数| GRPO[GRPO/PPO]
A -->|有专家动作日志| BC[BC → 再谈离线RL]
A -->|有交互环境| B{动作空间?}
B -->|连续控制| SAC[SAC/TD3]
B -->|离散/通用| PPO[PPO] 12. 失败模式专题(第3章 必记)
Section titled “12. 失败模式专题(第3章 必记)”12.1 奖励黑客(Reward Hacking)
Section titled “12.1 奖励黑客(Reward Hacking)”- 现象:分很高,真实目标很糟。
- 例子:RM 爱长答案 → 模型注水;测试只查关键词 → 模型堆关键词。
- 缓解:持出分布评估、多奖励、周期性人工抽检、保留 KL。
12.2 过拟合模拟器 / oracle
Section titled “12.2 过拟合模拟器 / oracle”- 现象:仿真完美,上真实实验站全崩。
- 缓解:域随机化、真实数据微调、保守离线策略。
12.3 不可复现
Section titled “12.3 不可复现”- 现象:同一配置方差巨大。
- 缓解:多 seed、记录数据版本与解码参数、固定 eval 协议。
12.4 把 CPT 当 RL 汇报
Section titled “12.4 把 CPT 当 RL 汇报”- 现象:论文/组会把 next-token 续训写成「强化学习优化领域能力」。
- 缓解:用第 10 节对照表;无偏好/回报证据就别写 RL。
12.5 离线乐观性
Section titled “12.5 离线乐观性”- 现象:离线 Q 虚高,部署即崩。
- 缓解:保守惩罚、BC 正则、真实小流量评估。
13. 动手项目(效果优先)
Section titled “13. 动手项目(效果优先)”| 项目 | 目标 | 通过标准 |
|---|---|---|
A. dpo_toy.py | 跑通最小 DPO | 训练后 在玩具集上升 |
B. bc_offline_demo.py | 理解 BC vs 乱外推 | 能指出「无保守的 max-Q」为何虚高 |
| C. 概念迁移 | 把你的课题填进选型表 | 写出:信号类型、是否 RL、第一算法、风险 |
| D. 论文精读 | 任选 DPO 或 RLHF 原文 | 能复述 1 个核心式 + 1 个消融结论 |
| E. 生物边界操练 | 对一篇 CPT 论文做三层证据表 | 明确「有/无 RL」及依据段落 |
建议两周节奏
Section titled “建议两周节奏”- 第 1 周:SAC/TD3 概念 + 模仿/离线;跑 B。
- 第 2 周:RLHF → DPO → GRPO;跑 A;完成 C、E。
- 第 3 周(可选):读一篇与你方向最近的对齐或离线 RL 论文;写一页「可迁移点 / 不可迁移点」。
14. 概念自测
Section titled “14. 概念自测”- SAC 的目标比普通回报最大化多了哪一项? 太大/太小会怎样?
- TD3 的三板斧各解决 DDPG 的什么问题?
- BC 的损失为什么像监督学习?它的上限由什么决定?
- 离线 RL 最怕的 OOD 外推是什么?保守项在惩罚谁?
- RLHF 三段各自输入输出是什么?KL 项为何存在?
- 默写 DPO 损失里 的含义。
- 「PPO 已被 DPO 取代」:给一个对的任务、一个错的任务。
- GRPO 为何可以弱化价值网络?组内全对/全错时会发生什么?
- 用公式或表格区分 CPT 与 DPO。
- 你的课题:信号是什么?第一推荐算法?最大失败模式?
15. 学习资源(少而精)
Section titled “15. 学习资源(少而精)”连续控制 / 现代 off-policy
- Haarnoja et al., SAC;Fujimoto et al., TD3
- Spinning Up / CleanRL 中的对应实现(对照公式看代码)
离线 / 模仿
- Behavior Cloning 经典讨论 + DAgger 直觉
- CQL / IQL 原文:先读动机与算法框,再决定是否深挖
对齐
- InstructGPT / RLHF 综述段落:建立三段式
- Rafailov et al., DPO(必读核心式)
- 可验证奖励与组相对方法的技术报告(抓组采样与基线,不先抠全部工程)
生物接口
- 你的领域 CPT 论文方法节:只标注「数据、损失、抗遗忘」,检查有无 reward/preference
- 第1–2章 文档中的翻译表,与本章第 11 节对照使用
读法依旧:
更新式 / 稳定技巧 / 数据假设 / 适用动作与信号类型 —— 四样抓到手再谈细节证明。
16. 第3章 完成标准
Section titled “16. 第3章 完成标准”- 能画清:在线控制 vs 离线/模仿 vs 对齐 vs CPT
- 能解释 SAC 熵项、TD3 三板斧各 1 句 + 关键符号
- 能写出 BC 损失、离线保守思想、RLHF 目标、DPO 损失(不必背全推导)
- 能说明 GRPO 相对 PPO 的核心简化
- 对「DPO 取代 PPO」给出正确边界
- 对一篇生物 CPT 论文完成三层证据判断(有/无 RL)
- 跑通
dpo_toy.py,并读懂bc_offline_demo.py的结论 - 为自己课题填写:信号 → 算法 → 风险 → 评估
17. 下一章预告
Section titled “17. 下一章预告”- 世界模型与模型基 RL
- 多智能体、工具使用 agent、过程监督
- 评估体系:离线指标、人类评估、生物学下游真指标
- 把对齐与 CPT 编进同一条训练课程的工程清单
- 开题级:你的多组学数据上「该不该上 RL」的书面论证模板
- Haarnoja et al., Soft Actor-Critic, 2018 — arXiv:1801.01290。最大熵目标与自动温度调节。
- Fujimoto et al., Addressing Function Approximation Error in Actor-Critic Methods (TD3), 2018 — arXiv:1802.09477。双 Q、目标平滑、延迟更新三板斧。
- Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), 2022 — arXiv:2203.02155。RLHF 三段式的原始工作。
- Rafailov et al., Direct Preference Optimization, 2023 — arXiv:2305.18290。DPO 闭式关系与损失,本章核心式来源。
- Shao et al., DeepSeekMath (GRPO), 2024 — arXiv:2402.03300。组相对策略优化的技术设定。
- Kumar et al., Conservative Q-Learning for Offline RL (CQL), 2020 — arXiv:2006.04779。离线 RL 保守惩罚思想。
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。