强化学习 · 6

试错决策

从多臂老虎机到 PPO——智能体如何通过与环境交互学会决策。

1 / 6 published · 持续更新中

  • 01马尔可夫决策过程
  • 02多臂老虎机
  • 03价值方法:MC / TD / Q-learning
  • 04深度 Q 网络
  • 05策略梯度与 Actor-Critic
  • 06PPO 与 RLHF