11.8 本章小结

配套代码:code/chapter11

在本章中,我们系统地学习了 Agentic RL 的理论和实践,从基础概念到完整的训练流程,从数据准备到模型部署。让我们回顾一下本章的主要内容。

(1)Agentic RL 的本质

Agentic RL 是将 LLM 作为可学习策略,嵌入到智能体的感知-决策-执行循环中,通过强化学习优化智能体在多步任务中的表现。它与传统的 PBRFT(Preference-Based Reinforcement Fine-Tuning)的核心区别在于:

  • 任务性质:从单轮对话优化扩展到多步序贯决策
  • 状态空间:从静态提示扩展到动态演化的环境状态
  • 行动空间:从纯文本生成扩展到文本+工具+环境操作
  • 奖励设计:从单步质量评估扩展到长期累积回报
  • 优化目标:从短期响应质量扩展到长期任务成功

(2)六大核心能力

Agentic RL 旨在提升智能体的六大核心能力:

  1. 推理(Reasoning):多步逻辑推导,学习推理策略
  2. 工具使用(Tool Use):API/工具调用,学会何时用、如何用
  3. 记忆(Memory):长期信息保持,学习记忆管理
  4. 规划(Planning):行动序列规划,学会动态规划
  5. 自我改进(Self-Improvement):自我反思优化,从错误中学习
  6. 感知(Perception):多模态理解,视觉推理和工具使用

(3)训练流程

完整的 Agentic RL 训练流程包括:

  1. 预训练(Pretraining):在大规模文本上学习语言知识(通常使用现成的预训练模型)
  2. 监督微调(SFT):学习任务格式和基础推理能力
  3. 强化学习(RL):通过试错优化推理策略,超越训练数据质量

其中,SFT 是基础,RL 是提升。没有 SFT 的基础,RL 很难成功;没有 RL 的优化,模型只能模仿训练数据。

如果你想深入学习 Agentic RL,建议按照以下路径:

基础阶段

  1. 强化学习基础:学习 MDP、策略梯度、PPO 等基本概念
  2. LLM 基础:了解 Transformer、预训练、微调等技术
  3. 实践 HelloAgents:运行本章的示例代码,理解完整流程

进阶阶段

  1. 深入 TRL:学习 TRL 库的实现,理解 SFT 和 GRPO 等算法的细节
  2. 自定义数据集:使用自己的数据集训练模型
  3. 自定义奖励函数:设计适合自己任务的奖励函数
  4. 参数调优:系统地调优超参数,提升模型性能

高级阶段

  1. 多步推理:研究长序列推理任务
  2. 工具学习:让智能体学会使用工具
  3. 多智能体:研究多智能体协作
  4. 前沿论文:阅读最新的研究论文,跟进前沿进展

希望本章能够帮助你理解和掌握 Agentic RL 技术,在自己的项目中应用这些知识,构建更智能的 Agent 系统!