强化学习超详细教程:第4章 - 世界模型、Agent、评估与开题论证
本章是强化学习系列第 4 章(终章):把前三章收成可写进开题/组会的决策能力。
风格:专业 + 科普。关键步骤给出简单公式,并解释每个符号/参数在干什么;同时讲清「为什么 → 怎么调 → 效果 → 被什么取代/还能增强什么」。
目标:把前三章收成可写进开题/组会的决策能力——何时用世界模型、何时上 Agent、如何评估、如何把 CPT 与对齐排进同一条训练课,以及如何书面论证「该不该上 RL」。
预计时间:2–4 周(每天 2–4 小时)
前置:第1–3章 完成;尤其清楚 PPO / 离线 / DPO / GRPO 与 CPT ≠ RL 的边界。
0. 本阶段你将得到什么
Section titled “0. 本阶段你将得到什么”学完后,你应能:
- 用 1 个框图 + 1 个公式说清 世界模型 / 模型基 RL 在省什么、怕什么。
- 区分 工具 Agent、多智能体、过程监督 各自吃什么信号。
- 设计一套评估栈:代理指标 → 人类/专家抽检 → 生物学真下游。
- 写出 CPT → SFT →(可选)对齐 的工程清单与防遗忘检查点。
- 用开题模板完成一页:该不该上 RL(信号、算法、风险、对照实验、否决条件)。
配套材料:
| 文件 | 作用 |
|---|---|
rl_go_nogo_checklist.py | 交互式「该不该上 RL」决策清单(打印论证提纲) |
toy_world_model.py | 最小世界模型:学转移 → 在想象中规划 vs 真环境 |
dpo_toy.py 等 | 第3章 已有;本阶段复用评估思路 |
📥 配套代码可直接下载运行:rl_go_nogo_checklist.py · toy_world_model.py
本阶段新增符号约定
Section titled “本阶段新增符号约定”| 符号 | 含义 | 调它时你在改什么 |
|---|---|---|
| 学到的动力学 / 世界模型 | 想象轨迹靠不靠谱 | |
| 学到的奖励模型(可与 RM 不同) | 规划用的「假环境奖励」 | |
| 想象地平线(rollout 步数) | 看得越远,模型误差越放大 | |
| 一条轨迹 / 工具调用轨迹 | Agent 的完整决策序列 | |
| 过程奖励(中间步是否合理) | 稀疏终局奖励的补充 | |
| 评估套件(metrics suite) | 你到底信哪几个数 | |
| CPT 中通用/领域数据混合比 | 抗遗忘 vs 领域特化 |
第1–3章 的 继续沿用。
1. 一张图:从「学策略」到「做系统」
Section titled “1. 一张图:从「学策略」到「做系统」”flowchart TB
subgraph 前三章
ALG[算法选型<br/>PPO/SAC/DPO/GRPO/BC]
BND[CPT ≠ RL 边界]
end
subgraph 第4章系统层
WM[世界模型<br/>想象中试错]
AG[工具 Agent<br/>多步调用]
PRM[过程监督<br/>中间步打分]
EV[评估栈<br/>代理→专家→真下游]
PIPE[训练课程<br/>CPT→SFT→对齐]
PROP[开题论证<br/>Go / No-Go]
end
ALG --> WM
ALG --> AG
ALG --> PRM
BND --> PIPE
BND --> PROP
WM --> EV
AG --> EV
PRM --> EV
PIPE --> PROP
EV --> PROP | 主线 | 在干什么 | 你何时需要它 |
|---|---|---|
| 世界模型 | 用学到的环境在脑内试错 | 真交互贵、慢、有风险 |
| 工具 Agent | 多步选工具、读结果、再决策 | 工作流/数据库/湿实验协议编排 |
| 过程监督 | 给中间推理/步骤打分 | 终局奖励太稀疏 |
| 评估栈 | 防止「分高、科学假」 | 任何要对齐或 RL 的项目 |
| 训练课程 | 把 CPT 与对齐排进同一流水线 | 生物基础模型后训练 |
| 开题论证 | 书面 Go/No-Go | 申请题、组会、合作谈判 |
一句话记忆:
第4章 = 少在真环境里试错(世界模型)+ 会多步用工具(Agent)+ 会评真假好坏(评估)+ 会排训练课(CPT/对齐)+ 会写该不该上 RL(开题)。
2. 世界模型与模型基 RL
Section titled “2. 世界模型与模型基 RL”为什么需要它?
Section titled “为什么需要它?”无模型方法(DQN/PPO/SAC)每更新一步都要真交互。生物、机器人、高通量筛选里:
- 一次实验 = 钱、时间、伦理/安全约束;
- 你更希望:先在脑子里(模型里)试 100 次,再上真实 1 次。
世界模型(World Model) 学的是「环境怎么转」;模型基 RL(Model-Based RL, MBRL) 用这个模型做规划或造数据。
(1)学动力学(最简)
或回归形式:
| 符号 | 含义 | 白话 |
|---|---|---|
| 世界模型参数 | 猜下一状态 | |
| 真实交互数据 | 模型的「教材」 | |
| 真实下一状态 | 标准答案 |
(2)在想象中算回报(开环直觉)
从 出发,用策略 与模型滚 步:
然后用 改进 (策略梯度、CEM 规划、Dyna 式把想象转移塞进 replay 等)。
| 旋钮 | 太大/太久 | 太小/太短 |
|---|---|---|
| 地平线 | 模型误差指数放大,越想越偏 | 变短视,像 bandit |
| 模型容量 | 过拟合噪声、幻觉动态 | 学不动复杂转移 |
| 真实数据比例 | 全信模型 → sim-to-real 崩 | 全信真实 → 退回无模型 |
| 重训模型频率 | 太勤不稳;太懒模型过时 | 需与策略共进化 |
效果 / 适用
Section titled “效果 / 适用”- 强项:样本效率;适合「交互贵」。
- 弱项:模型偏了,策略会专攻模型漏洞(另一种 reward/model hacking)。
- 生物翻译:表型预测器 / 代理 oracle 若当世界模型用,必须留真实湿实验否决权。
被什么增强 / 取代?
Section titled “被什么增强 / 取代?”| 方向 | 说明 |
|---|---|
| 集成 / 不确定性 | 多模型分歧大的动作别选 |
| 潜空间世界模型 | Dreamer 等:在 latent 里想象 |
| 决策 Transformer / 序列模型 | 直接建模轨迹,弱化显式规划 |
| 无模型 + 更好探索 | 数据够便宜时,未必上 MBRL |
flowchart LR Real[真实环境少量交互] --> Data[数据集 D] Data --> WM[学世界模型 p_ψ] WM --> Imag[想象 rollout H 步] Imag --> Improve[改进策略 π] Improve --> Real
3. 工具使用 Agent:把动作变成「API 调用」
Section titled “3. 工具使用 Agent:把动作变成「API 调用」”为什么需要它?
Section titled “为什么需要它?”经典 RL 动作是「左/右/力矩」。科研 Agent 的动作常常是:
- 查多组学数据库、跑 BLAST、写 SQL、调分析脚本、读论文段落;
- 再根据观察决定下一步。
这是 序贯决策 + 工具环境,不是单次聊天补全。
- 状态 :对话/工作记忆 + 最近工具输出。
- 动作 :选工具 + 填参数,或直接给最终答案。
- 转移:由工具与外部环境决定(确定性或随机)。
- 奖励:任务成功 / 测试通过 / 专家偏好(往往稀疏)。
轨迹:
其中 是工具观察(observation)。
训练信号从哪来?
Section titled “训练信号从哪来?”| 信号 | 方法 | 何时用 |
|---|---|---|
| 成功示范轨迹 | BC / SFT on tool traces | 有专家日志 |
| 终局对错 | GRPO / PPO + 规则奖励 | 可自动验 |
| 偏好 | DPO on 完整轨迹或最终答 | 难自动打分 |
| 无偏好无奖励 | 不要硬 RL;先做好检索与工作流 | 多数早期生物问答 |
怎么调 / 常见坑
Section titled “怎么调 / 常见坑”| 坑 | 表现 | 缓解 |
|---|---|---|
| 幻觉调用 | 编造工具结果 | 强制真实执行;结果写回上下文 |
| 过长轨迹 | 成本爆、上下文爆 | 步数上限、中间摘要 |
| 稀疏奖励 | 学不会中间步 | 过程奖励、分阶段 SFT |
| 工具侧副作用 | 误写库、误下单 | 沙箱、写权限、人工门禁 |
与「普通 Chat」边界
Section titled “与「普通 Chat」边界”- 单轮 RAG 问答:未必是 RL。
- 多步工具 + 按成功率优化策略:才进入 RL/Agent 训练。
- 只做 prompt 编排与规则路由:工程系统,不要写成强化学习论文贡献(除非你真优化了策略目标)。
4. 过程监督与 PRM
Section titled “4. 过程监督与 PRM”为什么需要它?
Section titled “为什么需要它?”很多任务只在最后给分(答案对错、实验成败)。中间 20 步全错,最后撞对,或中间对了最后写错——终局奖励都说不清。
过程监督(Process Supervision) 给每一步或关键步骤打分;PRM(Process Reward Model) 是学出来的过程打分器。
关键公式(直觉)
Section titled “关键公式(直觉)”结果奖励(ORM):
过程奖励:
训练策略时可混合:
| 符号 | 含义 |
|---|---|
| 第 步是否合理(人工/规则/PRM) | |
| 终局 vs 过程的权重 |
| 旋钮 | 直觉 |
|---|---|
| 标注粒度 | 逐步标最贵;可标「关键推理节点」 |
| PRM 过拟合 | 策略讨好 PRM 文风,而非真逻辑 |
| 过程权过大 → 形式正确但答案错 | |
| 与搜索结合 | PRM 引导 Best-of-N / beam,常比纯 RL 先试 |
| 任务 | 过程信号例子 |
|---|---|
| 变异致病性解释 | 证据链是否引用正确位点/文献 |
| 实验方案生成 | 步骤是否缺对照、试剂顺序是否合理 |
| 分析流水线 | 中间 QC 图是否合格 |
注意:过程标签本身是新的昂贵监督;没有标注预算时,优先可验证中间断言(单元测试、模式校验),而不是空谈 PRM。
5. 多智能体:何时真的需要「多」?
Section titled “5. 多智能体:何时真的需要「多」?”为什么(以及为什么不)需要它?
Section titled “为什么(以及为什么不)需要它?”多智能体(MARL / multi-agent systems)在游戏、交通、分布式控制里天然存在。
科研写作里却容易把「多个 LLM 角色提示」夸张成「多智能体 RL」。
| 层级 | 是什么 | 要不要 MARL |
|---|---|---|
| 多角色 prompt | 同一模型分饰辩手/审稿人 | 否,是推理编排 |
| 多工具流水线 | 固定 DAG 调用 | 否,是工作流 |
| 多策略博弈 | 真有对手/协作回报耦合 | 才考虑 MARL |
关键难点(知道即可)
Section titled “关键难点(知道即可)”- 非平稳性:别人的策略在变,你的环境也在变。
- 信用分配:团队赢了,哪次动作有功?
- 通信协议:传什么、传多少。
- 默认:单 Agent + 工具 + 清晰奖励。
- 只有当问题本身是博弈/分布式控制,再上 MARL 文献。
- 生物信息学组会里,优先把「多智能体」写成可审计的流水线角色,别先上 MARL 公式。
6. 评估体系:代理指标 → 专家 → 真下游
Section titled “6. 评估体系:代理指标 → 专家 → 真下游”为什么评估是第4章 的核心?
Section titled “为什么评估是第4章 的核心?”算法再漂亮,若评估只剩「训练曲线向上」,你会被自己骗。
生物与 LLM 场景尤其危险:代理指标涨 ≠ 科学结论对。
flowchart TB L1[L1 代理指标<br/>loss / reward / 偏好准确率 / 基准题] L2[L2 专家抽检<br/>盲评、错误类型学、可引用性] L3[L3 真下游<br/>湿实验 / 外部队列 / 用户任务成功] L1 --> L2 --> L3
| 层级 | 例子 | 能证明什么 | 不能证明什么 |
|---|---|---|---|
| L1 代理 | RM 分、DPO 偏好准确率、GSM8K、内部 QA | 优化目标在动 | 没黑客、没科学正确 |
| L2 专家 | 林学/组学专家盲评 50 条 | 领域可信度 | 大规模泛化、因果 |
| L3 真下游 | 实验命中率、外部独立数据、上线成功率 | 有用 | 单点成功可复现仍要设计 |
关键公式:别只报一个数
Section titled “关键公式:别只报一个数”至少同时跟踪:
| 分量 | 含义 | 生物例子 |
|---|---|---|
| 主任务 | 位点注释 F1、方案可执行率 | |
| 相对参考/旧模型 | 相对 SFT 的胜率 | |
| 安全/胡编/有害建议 | 虚构文献率、危险实验建议率 | |
| 延迟、金额、实验预算 | 平均工具调用次数 |
怎么设计评估协议?
Section titled “怎么设计评估协议?”- 冻结测试集(时间切割 / 基因家族切割 / 物种切割,防泄漏)。
- 多 seed / 多解码温度(对齐与采样方法对温度敏感)。
- 固定对照:随机、SFT、CPT-only、+DPO、+RL —— 缺谁就别宣称谁必要。
- 错误类型学:不是只报准确率,还要分「编造 DOI、坐标错、逻辑跳」。
- 否决指标:任一红线(安全、数据泄漏、不可复现)触发则模型不可部署。
对齐/RL 特有的假象
Section titled “对齐/RL 特有的假象”| 假象 | 机制 | 拆穿办法 |
|---|---|---|
| 奖励黑客 | 钻 RM/规则空子 | 保留人工集;换 RM 再测 |
| 长度偏置 | 更长更高分 | 长度控制的对照 |
| 基准过拟合 | 针对公开题刷分 | 私有/新题;污染检查 |
| 离线虚高 | Q 乐观 | 真实小流量 / 真环境 |
| CPT 误报为 RL | 叙述偷换 | 三层证据表(第3章) |
7. 训练课程工程清单:CPT → SFT →(可选)对齐
Section titled “7. 训练课程工程清单:CPT → SFT →(可选)对齐”把「模型怎么训」写成可执行课程,而不是口号。
7.1 标准流水线
Section titled “7.1 标准流水线”flowchart LR
PT[通用预训练 checkpoint] --> CPT[领域 CPT<br/>混合回放]
CPT --> SFT[SFT / 指令 / 工具轨迹]
SFT --> DEC{需要偏好或可验证优化?}
DEC -->|否| SHIP[评估后发布]
DEC -->|偏好对| DPO[DPO 族]
DEC -->|可验证| GRPO[GRPO / PPO]
DPO --> EV[评估栈 L1-L3]
GRPO --> EV
EV --> SHIP 7.2 每阶段检查清单
Section titled “7.2 每阶段检查清单”A. CPT(不是 RL)
- 数据来源、许可、去污(测试集基因/文献是否泄漏)
- 混合比 :领域 vs 通用/回放
- 保存:token 数、学习率、上下文长、checkpoint 哈希
- 监控:领域基准 ↑ 且通用基准不崩(或可接受跌幅写明)
- 论文表述:self-supervised next-token,不写 RL
B. SFT
- 指令格式统一;工具轨迹是否可执行复现
- 难例 / 拒答 / 安全例占比
- 与 CPT 数据是否风格冲突
C. 对齐(仅当有信号)
- 信号类型:偏好对 / 规则奖励 / 人类排序
- 算法:DPO 默认;可验证再用 GRPO/PPO
- / KL、长度偏置、奖励黑客预案
- ref 模型版本锁定
D. 发布门禁
- L1+L2 通过;L3 有计划或已完成小规模
- 已知失败模式写进 model card
- 回滚到 SFT/CPT 的路径存在
7.3 抗遗忘:公式级直觉
Section titled “7.3 抗遗忘:公式级直觉”混合采样的期望损失:
| 符号 | 含义 |
|---|---|
| 领域语料 next-token | |
| 通用或旧领域回放 | |
| 回放比例 |
白话: 太小 → 领域尖、通用崩;太大 → 领域化不够。
这是 CPT 抗遗忘,不是 RL 的 KL 项;别混着写。
7.4 何时在课程里插入 RL?
Section titled “7.4 何时在课程里插入 RL?”| 条件 | 插入点 |
|---|---|
| 只有语料 | 停在 CPT/SFT |
| 有专家示范 | SFT/BC 后评估 |
| 有偏好对 | SFT 后 DPO |
| 有自动验证器 | SFT 后 GRPO/PPO |
| 有贵交互环境 | 考虑世界模型 + 小预算在线 |
8. 开题级论证模板:该不该上 RL?
Section titled “8. 开题级论证模板:该不该上 RL?”下面可直接粘贴进开题报告 / 组会一页纸。配套脚本 rl_go_nogo_checklist.py 会按你的选项生成同结构提纲。
8.1 一页结构
Section titled “8.1 一页结构”1. 科学问题(非算法问题)
我们要回答/优化的生物学或信息学问题是:________。
2. 决策对象
状态 / 上下文:________
动作:(token / 工具 / 实验参数)
一步还是多步:
3. 可用监督信号(最关键)
| 信号 | 有无 | 规模 | 噪声 |
|---|---|---|---|
| 无标注序列 | |||
| 标准答案 SFT | |||
| 专家轨迹 BC | |||
| 偏好对 | |||
| 可验证奖励 | |||
| 在线环境 |
4. Go / No-Go 规则
- No-Go(默认):仅有无标注序列 → CPT/SFT,不上 RL。
- Go-DPO:有可靠偏好对,且主诉求是风格/安全性/专家偏好。
- Go-GRPO/PPO:有自动验证器或可重复打分,且需要超过 SFT。
- Go-BC/Offline:有日志;交互贵。
- Go-MBRL:真环境极贵,且能建可检验的代理模型。
5. 第一推荐与对照
- 第一推荐:________
- 强基线对照:________(必须强过的非 RL 方法)
- 消融:去 KL / 去过程奖励 / 仅 SFT / 仅 CPT
6. 风险与否决条件
| 风险 | 监测 | 否决线 |
|---|---|---|
| 奖励黑客 | 人工集、换奖励再测 | 主任务↑但红线指标↓ |
| 遗忘 | 通用/旧任务套件 | 超过约定跌幅 |
| 不可复现 | 多 seed | 方差淹没效应 |
| 科学错误 | 专家盲评 | 虚构关键事实率 > 阈值 |
7. 资源与里程碑
- 数据周:________
- 算法周:________
- L2 专家评估:________
- L3 下游:________
8. 表述纪律
- 若方法损失是 next-token,则文中写 CPT/自监督,不写强化学习。
- 若只有 DPO,写 偏好优化 / 对齐,并说明与 RLHF 目标关系。
- 「Agent」仅在存在多步环境交互或工具轨迹优化时使用。
8.2 快速决策树(开题版)
Section titled “8.2 快速决策树(开题版)”flowchart TD
Q1{有可自动验证的成功标准?}
Q1 -->|是| G1[考虑 GRPO/PPO<br/>+ 强 SFT 基线]
Q1 -->|否| Q2{有偏好对?}
Q2 -->|是| G2[DPO 族]
Q2 -->|否| Q3{有专家轨迹?}
Q3 -->|是| G3[BC / SFT 轨迹]
Q3 -->|否| Q4{有大规模无标领域语料?}
Q4 -->|是| G4[CPT + 混合回放]
Q4 -->|否| G5[先建数据与评估<br/>不要上 RL] 8.3 填空示例(林木 / 多组学虚构示意)
Section titled “8.3 填空示例(林木 / 多组学虚构示意)”| 项 | 示例填写 |
|---|---|
| 科学问题 | 跨物种转录因子结合假设的文献+组学证据整合问答 |
| 信号 | 文献与数据库无标文本 + 少量专家偏好对 |
| 第一推荐 | CPT(领域文献/组学文本)→ SFT(问答)→ 小规模 DPO |
| 不上 | 端到端 PPO(无稳定奖励、无环境) |
| 对照 | RAG+SFT;无 CPT 的 SFT;无 DPO 的 CPT+SFT |
| 否决 | 虚构引用率 > 5%;通用分子生物问答跌幅 > 约定 |
9. 全系列算法 × 场景速查(第1–4章 总表)
Section titled “9. 全系列算法 × 场景速查(第1–4章 总表)”| 场景 | 第一推荐 | 备选 | 明确不推荐 |
|---|---|---|---|
| 游戏/简单控制入门 | DQN / PPO | — | 一上来 MARL |
| 连续控制 | SAC / TD3 | PPO | 硬套 DPO |
| 只有专家日志 | BC | 离线 RL | 无保守的 Q max |
| 静态人类偏好 | DPO | RLHF-PPO | SAC |
| 数学/代码可验证 | GRPO/PPO | Best-of-N | 假 RM 刷分 |
| 领域语料续训 | CPT+回放 | LoRA 分区 | 称其为 RL |
| 工具工作流早期 | SFT 轨迹 + 规则 | — | 空谈多智能体 RL |
| 交互极贵 | 世界模型 + 小预算真机 | 贝叶斯优化 | 纯 on-policy 狂采样 |
| 开题前信号不清 | 先评估与数据 | — | 为创新而上 RL |
10. 失败模式(第4章 增补)
Section titled “10. 失败模式(第4章 增补)”| 模式 | 症状 | 对策 |
|---|---|---|
| 模型黑客 | 策略专攻世界模型 bug | 不确定性惩罚;定期真环境校准 |
| 评估自欺 | 只报 reward | 强制 四元组 |
| 课程倒置 | 先 RL 后脏数据 CPT | 先数据与 CPT/SFT,有信号再对齐 |
| 叙事膨胀 | 工作流写成 MARL | 用第 5、8 节表述纪律 |
| 下游缺失 | 论文只有 benchmark | 至少 L2;L3 写进计划与合作 |
| 门禁缺失 | 无法回滚 | 每个对齐阶段留 checkpoint |
11. 动手项目
Section titled “11. 动手项目”| 项目 | 目标 | 通过标准 |
|---|---|---|
A. toy_world_model.py | 理解模型误差随 放大 | 能解释想象回报与真实回报分叉 |
B. rl_go_nogo_checklist.py | 生成你课题的 Go/No-Go 提纲 | 输出完整 8 节论证草稿 |
| C. 评估栈设计 | 为你的任务写 L1/L2/L3 | 每层 ≥2 指标 + 1 否决线 |
| D. 训练课程表 | 填 CPT/SFT/对齐检查清单 | 标出「非 RL」步骤 |
| E. 一页开题 | 用第 8 节模板 | 组会 5 分钟能讲清 |
建议两周节奏
Section titled “建议两周节奏”- 第 1 周:世界模型 + Agent/过程监督概念;跑 A。
- 第 2 周:评估栈 + 训练课程 + 开题纸;跑 B、完成 C–E。
12. 概念自测
Section titled “12. 概念自测”- 世界模型的 增大时,主要风险是什么?
- 工具 Agent 的动作与经典 CartPole 动作有何本质不同?
- ORM 与 PRM 差在哪里?没有标注预算时怎么办?
- 什么情况下「多智能体」只是角色扮演而非 MARL?
- 写出评估四元组 的四个分量。
- CPT 混合损失里 与 DPO 的 能否互相替代?为什么?
- 给出三条 No-Go 上 RL 的条件。
- 你的课题 L3 真下游是什么?若没有,计划如何补?
- 训练课程中,哪一步开始才允许写「强化学习」?
- 用总表为你的课题选第一推荐与对照。
13. 学习资源(少而精)
Section titled “13. 学习资源(少而精)”世界模型 / MBRL
- Ha & Schmidhuber 世界模型直觉;Dreamer 系列(抓 latent 想象)
- 经典 Dyna 思路:模型造数据 + 无模型更新
Agent / 过程监督
- Tool-use / ReAct 轨迹思想(先分清工程 vs 训练)
- 过程奖励 vs 结果奖励的对比实验论文(读设置不先抠全部证明)
评估
- HELM 类「多指标评估」思想
- 你领域的金标准下游(湿实验、外部队列)文献
开题与科研写作
- 第3章 第 10 节三层证据法
- 本阶段第 8 节模板 +
rl_go_nogo_checklist.py
读法:
问题信号 → 算法 → 评估否决线 → 论文能诚实写的贡献句。
14. 第4章 完成标准
Section titled “14. 第4章 完成标准”- 能画世界模型闭环,并解释 与模型误差
- 能判断一个「Agent」项目是否真需要 RL
- 能为自己任务写出 L1/L2/L3 与否决线
- 能列出 CPT→SFT→对齐课程与每阶段检查项
- 完成一页 Go/No-Go 开题论证(脚本生成后人工改)
- 跑通
toy_world_model.py与rl_go_nogo_checklist.py - 回顾第1–3章:总表选型不依赖记忆幻觉
15. 全路径回顾与之后
Section titled “15. 全路径回顾与之后”flowchart LR S1[第1章 基础<br/>MDP/回报/实验] --> S2[第2章 经典<br/>DQN/PPO] S2 --> S3[第3章 现代<br/>SAC/离线/对齐/CPT边界] S3 --> S4[第4章 系统<br/>世界模型/Agent/评估/开题] S4 --> Next[真正课题<br/>数据·对照·论文表述]
之后不必再开「第5章 教程」,而是:
- 用你的真实数据填第 8 节模板;
- 先把 非 RL 强基线 做到位;
- 有信号再上 DPO/GRPO/MBRL 之一;
- 写论文时严格执行 CPT ≠ RL 表述纪律。
flowchart LR S1[第1章 基础<br/>MDP/回报/CartPole] --> S2[第2章 经典<br/>DP/TD/DQN/PPO] S2 --> S3[第3章 现代<br/>SAC/离线/对齐/CPT边界] S3 --> S4[第4章 系统<br/>世界模型/Agent/评估/开题] S4 --> Next[真正课题<br/>数据·对照·论文表述]
四章走完,工具箱已经齐全。真正的下一步不是再学一个算法,而是:用真实数据填第 8 节模板,先把非 RL 强基线做到位,有明确信号再上 DPO/GRPO/MBRL 之一,写论文时严格执行 CPT ≠ RL 的表述纪律。
- 回到 第1章 什么是强化学习 复习 MDP 与 Q-Learning。
- 回到 第3章 重看 CPT ≠ 对齐 RL 的三层证据法。
- Ha & Schmidhuber, World Models, 2018 — arXiv:1803.10122。用学到的环境在潜空间里想象试错。
- Hafner et al., Dream to Control (Dreamer), 2020 — arXiv:1912.01603。latent 想象中的策略学习。
- Lightman et al., Let’s Verify Step by Step, 2023 — arXiv:2305.20050。过程监督与 PRM 对比结果奖励。
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, 2022 — arXiv:2210.03629。工具使用 Agent 的推理-行动轨迹。
- Liang et al., Holistic Evaluation of Language Models (HELM), 2022 — arXiv:2211.09110。多指标评估思想。
主题色
字体
字号
视觉效果
即将离开本站
你将前往外部网站:
该网站与本站无关,本站不对其内容、安全性或可用性负责。确定后将在新标签页打开。