机器学习
POD
数学基础
监督学习
无监督学习
深度学习
强化学习
大模型
前沿
强化学习 · 6 篇
试错决策
从多臂老虎机到 PPO——智能体如何通过与环境交互学会决策。
1 / 6 published · 持续更新中
01
马尔可夫决策过程
→
02
多臂老虎机
·
03
价值方法:MC / TD / Q-learning
·
04
深度 Q 网络
·
05
策略梯度与 Actor-Critic
·
06
PPO 与 RLHF
·