跳转到内容

强化学习超详细教程:第4章 - 世界模型、Agent、评估与开题论证

本章是强化学习系列第 4 章(终章):把前三章收成可写进开题/组会的决策能力。

风格专业 + 科普。关键步骤给出简单公式,并解释每个符号/参数在干什么;同时讲清「为什么 → 怎么调 → 效果 → 被什么取代/还能增强什么」。
目标:把前三章收成可写进开题/组会的决策能力——何时用世界模型、何时上 Agent、如何评估、如何把 CPT 与对齐排进同一条训练课,以及如何书面论证「该不该上 RL」。
预计时间:2–4 周(每天 2–4 小时)
前置:第1–3章 完成;尤其清楚 PPO / 离线 / DPO / GRPO 与 CPT ≠ RL 的边界。


学完后,你应能:

  1. 用 1 个框图 + 1 个公式说清 世界模型 / 模型基 RL 在省什么、怕什么。
  2. 区分 工具 Agent、多智能体、过程监督 各自吃什么信号。
  3. 设计一套评估栈:代理指标 → 人类/专家抽检 → 生物学真下游。
  4. 写出 CPT → SFT →(可选)对齐 的工程清单与防遗忘检查点。
  5. 用开题模板完成一页:该不该上 RL(信号、算法、风险、对照实验、否决条件)。

配套材料:

文件作用
rl_go_nogo_checklist.py交互式「该不该上 RL」决策清单(打印论证提纲)
toy_world_model.py最小世界模型:学转移 → 在想象中规划 vs 真环境
dpo_toy.py第3章 已有;本阶段复用评估思路

📥 配套代码可直接下载运行rl_go_nogo_checklist.py · toy_world_model.py

符号含义调它时你在改什么
pψ(ss,a)p_\psi(s'\|s,a)学到的动力学 / 世界模型想象轨迹靠不靠谱
r^ψ(s,a)\hat{r}_\psi(s,a)学到的奖励模型(可与 RM 不同)规划用的「假环境奖励」
HH想象地平线(rollout 步数)看得越远,模型误差越放大
τ\tau一条轨迹 / 工具调用轨迹Agent 的完整决策序列
rtprocr^{\mathrm{proc}}_t过程奖励(中间步是否合理)稀疏终局奖励的补充
M\mathcal{M}评估套件(metrics suite)你到底信哪几个数
λmix\lambda_{\mathrm{mix}}CPT 中通用/领域数据混合比抗遗忘 vs 领域特化

第1–3章 的 s,a,r,γ,π,V,Q,β,πref,yw,yls,a,r,\gamma,\pi,V,Q,\beta,\pi_{\mathrm{ref}},y_w,y_l 继续沿用。


1. 一张图:从「学策略」到「做系统」

Section titled “1. 一张图:从「学策略」到「做系统」”
图示
主线在干什么你何时需要它
世界模型用学到的环境在脑内试错真交互贵、慢、有风险
工具 Agent多步选工具、读结果、再决策工作流/数据库/湿实验协议编排
过程监督给中间推理/步骤打分终局奖励太稀疏
评估栈防止「分高、科学假」任何要对齐或 RL 的项目
训练课程把 CPT 与对齐排进同一流水线生物基础模型后训练
开题论证书面 Go/No-Go申请题、组会、合作谈判

一句话记忆

第4章 = 少在真环境里试错(世界模型)+ 会多步用工具(Agent)+ 会评真假好坏(评估)+ 会排训练课(CPT/对齐)+ 会写该不该上 RL(开题)


无模型方法(DQN/PPO/SAC)每更新一步都要真交互。生物、机器人、高通量筛选里:

  • 一次实验 = 钱、时间、伦理/安全约束;
  • 你更希望:先在脑子里(模型里)试 100 次,再上真实 1 次

世界模型(World Model) 学的是「环境怎么转」;模型基 RL(Model-Based RL, MBRL) 用这个模型做规划或造数据。

(1)学动力学(最简)

Ldyn(ψ)=E(s,a,s)D[logpψ(ss,a)]\mathcal{L}_{\mathrm{dyn}}(\psi)=-\mathbb{E}_{(s,a,s')\sim\mathcal{D}}\big[\log p_\psi(s'|s,a)\big]

或回归形式:

Ldyn=E[sfψ(s,a)2]\mathcal{L}_{\mathrm{dyn}}=\mathbb{E}\big[\|s'-f_\psi(s,a)\|^2\big]
符号含义白话
pψ/fψp_\psi / f_\psi世界模型参数猜下一状态
D\mathcal{D}真实交互数据模型的「教材」
ss'真实下一状态标准答案

(2)在想象中算回报(开环直觉)

s0s_0 出发,用策略 π\pi 与模型滚 HH 步:

G^=t=0H1γtr^ψ(st,at),atπ(st),  st+1pψ(st,at)\hat{G}=\sum_{t=0}^{H-1}\gamma^t\,\hat{r}_\psi(s_t,a_t),\quad a_t\sim\pi(\cdot|s_t),\; s_{t+1}\sim p_\psi(\cdot|s_t,a_t)

然后用 G^\hat{G} 改进 π\pi(策略梯度、CEM 规划、Dyna 式把想象转移塞进 replay 等)。

旋钮太大/太久太小/太短
地平线 HH模型误差指数放大,越想越偏变短视,像 bandit
模型容量过拟合噪声、幻觉动态学不动复杂转移
真实数据比例全信模型 → sim-to-real 崩全信真实 → 退回无模型
重训模型频率太勤不稳;太懒模型过时需与策略共进化
  • 强项:样本效率;适合「交互贵」。
  • 弱项:模型偏了,策略会专攻模型漏洞(另一种 reward/model hacking)。
  • 生物翻译:表型预测器 / 代理 oracle 若当世界模型用,必须留真实湿实验否决权。
方向说明
集成 / 不确定性多模型分歧大的动作别选
潜空间世界模型Dreamer 等:在 latent 里想象
决策 Transformer / 序列模型直接建模轨迹,弱化显式规划
无模型 + 更好探索数据够便宜时,未必上 MBRL
图示

3. 工具使用 Agent:把动作变成「API 调用」

Section titled “3. 工具使用 Agent:把动作变成「API 调用」”

经典 RL 动作是「左/右/力矩」。科研 Agent 的动作常常是:

  • 查多组学数据库、跑 BLAST、写 SQL、调分析脚本、读论文段落;
  • 再根据观察决定下一步。

这是 序贯决策 + 工具环境,不是单次聊天补全。

  • 状态 sts_t:对话/工作记忆 + 最近工具输出。
  • 动作 ata_t:选工具 + 填参数,或直接给最终答案。
  • 转移:由工具与外部环境决定(确定性或随机)。
  • 奖励:任务成功 / 测试通过 / 专家偏好(往往稀疏)。

轨迹

τ=(s0,a0,o1,a1,o2,,aT)\tau=(s_0,a_0,o_1,a_1,o_2,\ldots,a_T)

其中 oo 是工具观察(observation)。

信号方法何时用
成功示范轨迹BC / SFT on tool traces有专家日志
终局对错GRPO / PPO + 规则奖励可自动验
偏好DPO on 完整轨迹或最终答难自动打分
无偏好无奖励不要硬 RL;先做好检索与工作流多数早期生物问答
表现缓解
幻觉调用编造工具结果强制真实执行;结果写回上下文
过长轨迹成本爆、上下文爆步数上限、中间摘要
稀疏奖励学不会中间步过程奖励、分阶段 SFT
工具侧副作用误写库、误下单沙箱、写权限、人工门禁
  • 单轮 RAG 问答:未必是 RL
  • 多步工具 + 按成功率优化策略:才进入 RL/Agent 训练
  • 只做 prompt 编排与规则路由:工程系统,不要写成强化学习论文贡献(除非你真优化了策略目标)。

很多任务只在最后给分(答案对错、实验成败)。中间 20 步全错,最后撞对,或中间对了最后写错——终局奖励都说不清。

过程监督(Process Supervision)每一步或关键步骤打分;PRM(Process Reward Model) 是学出来的过程打分器。

结果奖励(ORM):

RORM(τ)=r(sT,aT)或只看最终答案R_{\mathrm{ORM}}(\tau)=r(s_T,a_T)\quad\text{或只看最终答案}

过程奖励:

Rproc(τ)=trtproc(st,at)R_{\mathrm{proc}}(\tau)=\sum_t r^{\mathrm{proc}}_t(s_t,a_t)

训练策略时可混合:

R=λRORM+(1λ)RprocR=\lambda R_{\mathrm{ORM}}+(1-\lambda)R_{\mathrm{proc}}
符号含义
rtprocr^{\mathrm{proc}}_ttt 步是否合理(人工/规则/PRM)
λ\lambda终局 vs 过程的权重
旋钮直觉
标注粒度逐步标最贵;可标「关键推理节点」
PRM 过拟合策略讨好 PRM 文风,而非真逻辑
λ\lambda过程权过大 → 形式正确但答案错
与搜索结合PRM 引导 Best-of-N / beam,常比纯 RL 先试
任务过程信号例子
变异致病性解释证据链是否引用正确位点/文献
实验方案生成步骤是否缺对照、试剂顺序是否合理
分析流水线中间 QC 图是否合格

注意:过程标签本身是新的昂贵监督;没有标注预算时,优先可验证中间断言(单元测试、模式校验),而不是空谈 PRM。


5. 多智能体:何时真的需要「多」?

Section titled “5. 多智能体:何时真的需要「多」?”

为什么(以及为什么不)需要它?

Section titled “为什么(以及为什么不)需要它?”

多智能体(MARL / multi-agent systems)在游戏、交通、分布式控制里天然存在。
科研写作里却容易把「多个 LLM 角色提示」夸张成「多智能体 RL」。

层级是什么要不要 MARL
多角色 prompt同一模型分饰辩手/审稿人否,是推理编排
多工具流水线固定 DAG 调用否,是工作流
多策略博弈真有对手/协作回报耦合才考虑 MARL
  • 非平稳性:别人的策略在变,你的环境也在变。
  • 信用分配:团队赢了,哪次动作有功?
  • 通信协议:传什么、传多少。
  • 默认:单 Agent + 工具 + 清晰奖励
  • 只有当问题本身是博弈/分布式控制,再上 MARL 文献。
  • 生物信息学组会里,优先把「多智能体」写成可审计的流水线角色,别先上 MARL 公式。

6. 评估体系:代理指标 → 专家 → 真下游

Section titled “6. 评估体系:代理指标 → 专家 → 真下游”

算法再漂亮,若评估只剩「训练曲线向上」,你会被自己骗。
生物与 LLM 场景尤其危险:代理指标涨 ≠ 科学结论对

图示
层级例子能证明什么不能证明什么
L1 代理RM 分、DPO 偏好准确率、GSM8K、内部 QA优化目标在动没黑客、没科学正确
L2 专家林学/组学专家盲评 50 条领域可信度大规模泛化、因果
L3 真下游实验命中率、外部独立数据、上线成功率有用单点成功可复现仍要设计

至少同时跟踪:

M={mtask,mref,msafety,mcost}\mathcal{M}=\{m_{\mathrm{task}},\,m_{\mathrm{ref}},\,m_{\mathrm{safety}},\,m_{\mathrm{cost}}\}
分量含义生物例子
mtaskm_{\mathrm{task}}主任务位点注释 F1、方案可执行率
mrefm_{\mathrm{ref}}相对参考/旧模型相对 SFT 的胜率
msafetym_{\mathrm{safety}}安全/胡编/有害建议虚构文献率、危险实验建议率
mcostm_{\mathrm{cost}}延迟、金额、实验预算平均工具调用次数
  1. 冻结测试集(时间切割 / 基因家族切割 / 物种切割,防泄漏)。
  2. 多 seed / 多解码温度(对齐与采样方法对温度敏感)。
  3. 固定对照:随机、SFT、CPT-only、+DPO、+RL —— 缺谁就别宣称谁必要。
  4. 错误类型学:不是只报准确率,还要分「编造 DOI、坐标错、逻辑跳」。
  5. 否决指标:任一红线(安全、数据泄漏、不可复现)触发则模型不可部署。
假象机制拆穿办法
奖励黑客钻 RM/规则空子保留人工集;换 RM 再测
长度偏置更长更高分长度控制的对照
基准过拟合针对公开题刷分私有/新题;污染检查
离线虚高Q 乐观真实小流量 / 真环境
CPT 误报为 RL叙述偷换三层证据表(第3章)

7. 训练课程工程清单:CPT → SFT →(可选)对齐

Section titled “7. 训练课程工程清单:CPT → SFT →(可选)对齐”

把「模型怎么训」写成可执行课程,而不是口号。

图示

A. CPT(不是 RL)

  • 数据来源、许可、去污(测试集基因/文献是否泄漏)
  • 混合比 λmix\lambda_{\mathrm{mix}}:领域 vs 通用/回放
  • 保存:token 数、学习率、上下文长、checkpoint 哈希
  • 监控:领域基准 ↑ 且通用基准不崩(或可接受跌幅写明)
  • 论文表述:self-supervised next-token,不写 RL

B. SFT

  • 指令格式统一;工具轨迹是否可执行复现
  • 难例 / 拒答 / 安全例占比
  • 与 CPT 数据是否风格冲突

C. 对齐(仅当有信号)

  • 信号类型:偏好对 / 规则奖励 / 人类排序
  • 算法:DPO 默认;可验证再用 GRPO/PPO
  • β\beta / KL、长度偏置、奖励黑客预案
  • ref 模型版本锁定

D. 发布门禁

  • L1+L2 通过;L3 有计划或已完成小规模
  • 已知失败模式写进 model card
  • 回滚到 SFT/CPT 的路径存在

混合采样的期望损失:

L=(1λmix)Ldomain+λmixLreplay\mathcal{L}=(1-\lambda_{\mathrm{mix}})\mathcal{L}_{\mathrm{domain}} +\lambda_{\mathrm{mix}}\mathcal{L}_{\mathrm{replay}}
符号含义
Ldomain\mathcal{L}_{\mathrm{domain}}领域语料 next-token
Lreplay\mathcal{L}_{\mathrm{replay}}通用或旧领域回放
λmix\lambda_{\mathrm{mix}}回放比例

白话λmix\lambda_{\mathrm{mix}} 太小 → 领域尖、通用崩;太大 → 领域化不够。
这是 CPT 抗遗忘,不是 RL 的 KL 项;别混着写。

条件插入点
只有语料停在 CPT/SFT
有专家示范SFT/BC 后评估
有偏好对SFT 后 DPO
有自动验证器SFT 后 GRPO/PPO
有贵交互环境考虑世界模型 + 小预算在线

8. 开题级论证模板:该不该上 RL?

Section titled “8. 开题级论证模板:该不该上 RL?”

下面可直接粘贴进开题报告 / 组会一页纸。配套脚本 rl_go_nogo_checklist.py 会按你的选项生成同结构提纲。

1. 科学问题(非算法问题)
我们要回答/优化的生物学或信息学问题是:________。

2. 决策对象
状态 / 上下文:________
动作:(token / 工具 / 实验参数)
一步还是多步:

3. 可用监督信号(最关键)

信号有无规模噪声
无标注序列
标准答案 SFT
专家轨迹 BC
偏好对
可验证奖励
在线环境

4. Go / No-Go 规则

  • No-Go(默认):仅有无标注序列 → CPT/SFT,不上 RL
  • Go-DPO:有可靠偏好对,且主诉求是风格/安全性/专家偏好。
  • Go-GRPO/PPO:有自动验证器或可重复打分,且需要超过 SFT。
  • Go-BC/Offline:有日志;交互贵。
  • Go-MBRL:真环境极贵,且能建可检验的代理模型。

5. 第一推荐与对照

  • 第一推荐:________
  • 强基线对照:________(必须强过的非 RL 方法)
  • 消融:去 KL / 去过程奖励 / 仅 SFT / 仅 CPT

6. 风险与否决条件

风险监测否决线
奖励黑客人工集、换奖励再测主任务↑但红线指标↓
遗忘通用/旧任务套件超过约定跌幅
不可复现多 seed方差淹没效应
科学错误专家盲评虚构关键事实率 > 阈值

7. 资源与里程碑

  • 数据周:________
  • 算法周:________
  • L2 专家评估:________
  • L3 下游:________

8. 表述纪律

  • 若方法损失是 next-token,则文中写 CPT/自监督,不写强化学习。
  • 若只有 DPO,写 偏好优化 / 对齐,并说明与 RLHF 目标关系。
  • 「Agent」仅在存在多步环境交互或工具轨迹优化时使用。
图示

8.3 填空示例(林木 / 多组学虚构示意)

Section titled “8.3 填空示例(林木 / 多组学虚构示意)”
示例填写
科学问题跨物种转录因子结合假设的文献+组学证据整合问答
信号文献与数据库无标文本 + 少量专家偏好对
第一推荐CPT(领域文献/组学文本)→ SFT(问答)→ 小规模 DPO
不上端到端 PPO(无稳定奖励、无环境)
对照RAG+SFT;无 CPT 的 SFT;无 DPO 的 CPT+SFT
否决虚构引用率 > 5%;通用分子生物问答跌幅 > 约定

9. 全系列算法 × 场景速查(第1–4章 总表)

Section titled “9. 全系列算法 × 场景速查(第1–4章 总表)”
场景第一推荐备选明确不推荐
游戏/简单控制入门DQN / PPO一上来 MARL
连续控制SAC / TD3PPO硬套 DPO
只有专家日志BC离线 RL无保守的 Q max
静态人类偏好DPORLHF-PPOSAC
数学/代码可验证GRPO/PPOBest-of-N假 RM 刷分
领域语料续训CPT+回放LoRA 分区称其为 RL
工具工作流早期SFT 轨迹 + 规则空谈多智能体 RL
交互极贵世界模型 + 小预算真机贝叶斯优化纯 on-policy 狂采样
开题前信号不清先评估与数据为创新而上 RL

模式症状对策
模型黑客策略专攻世界模型 bug不确定性惩罚;定期真环境校准
评估自欺只报 reward强制 M\mathcal{M} 四元组
课程倒置先 RL 后脏数据 CPT先数据与 CPT/SFT,有信号再对齐
叙事膨胀工作流写成 MARL用第 5、8 节表述纪律
下游缺失论文只有 benchmark至少 L2;L3 写进计划与合作
门禁缺失无法回滚每个对齐阶段留 checkpoint

项目目标通过标准
A. toy_world_model.py理解模型误差随 HH 放大能解释想象回报与真实回报分叉
B. rl_go_nogo_checklist.py生成你课题的 Go/No-Go 提纲输出完整 8 节论证草稿
C. 评估栈设计为你的任务写 L1/L2/L3每层 ≥2 指标 + 1 否决线
D. 训练课程表填 CPT/SFT/对齐检查清单标出「非 RL」步骤
E. 一页开题用第 8 节模板组会 5 分钟能讲清
  • 第 1 周:世界模型 + Agent/过程监督概念;跑 A。
  • 第 2 周:评估栈 + 训练课程 + 开题纸;跑 B、完成 C–E。

  1. 世界模型的 HH 增大时,主要风险是什么?
  2. 工具 Agent 的动作与经典 CartPole 动作有何本质不同?
  3. ORM 与 PRM 差在哪里?没有标注预算时怎么办?
  4. 什么情况下「多智能体」只是角色扮演而非 MARL?
  5. 写出评估四元组 M\mathcal{M} 的四个分量。
  6. CPT 混合损失里 λmix\lambda_{\mathrm{mix}} 与 DPO 的 β\beta 能否互相替代?为什么?
  7. 给出三条 No-Go 上 RL 的条件。
  8. 你的课题 L3 真下游是什么?若没有,计划如何补?
  9. 训练课程中,哪一步开始才允许写「强化学习」?
  10. 用总表为你的课题选第一推荐与对照。

世界模型 / MBRL

  • Ha & Schmidhuber 世界模型直觉;Dreamer 系列(抓 latent 想象)
  • 经典 Dyna 思路:模型造数据 + 无模型更新

Agent / 过程监督

  • Tool-use / ReAct 轨迹思想(先分清工程 vs 训练)
  • 过程奖励 vs 结果奖励的对比实验论文(读设置不先抠全部证明)

评估

  • HELM 类「多指标评估」思想
  • 你领域的金标准下游(湿实验、外部队列)文献

开题与科研写作

  • 第3章 第 10 节三层证据法
  • 本阶段第 8 节模板 + rl_go_nogo_checklist.py

读法:

问题信号 → 算法 → 评估否决线 → 论文能诚实写的贡献句


  • 能画世界模型闭环,并解释 HH 与模型误差
  • 能判断一个「Agent」项目是否真需要 RL
  • 能为自己任务写出 L1/L2/L3 与否决线
  • 能列出 CPT→SFT→对齐课程与每阶段检查项
  • 完成一页 Go/No-Go 开题论证(脚本生成后人工改)
  • 跑通 toy_world_model.pyrl_go_nogo_checklist.py
  • 回顾第1–3章:总表选型不依赖记忆幻觉

图示

之后不必再开「第5章 教程」,而是:

  1. 用你的真实数据填第 8 节模板;
  2. 先把 非 RL 强基线 做到位;
  3. 有信号再上 DPO/GRPO/MBRL 之一;
  4. 写论文时严格执行 CPT ≠ RL 表述纪律。

图示

四章走完,工具箱已经齐全。真正的下一步不是再学一个算法,而是:用真实数据填第 8 节模板,先把非 RL 强基线做到位,有明确信号再上 DPO/GRPO/MBRL 之一,写论文时严格执行 CPT ≠ RL 的表述纪律。


  1. Ha & Schmidhuber, World Models, 2018 — arXiv:1803.10122。用学到的环境在潜空间里想象试错。
  2. Hafner et al., Dream to Control (Dreamer), 2020 — arXiv:1912.01603。latent 想象中的策略学习。
  3. Lightman et al., Let’s Verify Step by Step, 2023 — arXiv:2305.20050。过程监督与 PRM 对比结果奖励。
  4. Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, 2022 — arXiv:2210.03629。工具使用 Agent 的推理-行动轨迹。
  5. Liang et al., Holistic Evaluation of Language Models (HELM), 2022 — arXiv:2211.09110。多指标评估思想。