基础概念
介绍强化学习的智能体、环境、奖励与价值函数等基础概念
3 min
强化学习,价值函数,策略
以智能体与环境的交互为主线,先建立策略、奖励、状态转移等基础概念,再分两条路线展开:价值方法上的 DQN、经验回放与 TD 学习,以及策略梯度、Monte Carlo 与 Actor-Critic 等优化手段,系统呈现强化学习的理论与算法演进。
介绍强化学习的智能体、环境、奖励与价值函数等基础概念
介绍用Q网络近似最优价值函数及时间差分算法
用神经网络逼近策略函数,通过策略梯度直接最大化期望状态价值
基于TD目标与回溯标记,讲解sarsa、Q Learning及多步TD
策略网络与价值网络协同,通过TD误差联合更新策略与价值
经验回放、优先回放、目标网络、double与dueling等DQN优化方法
用随机采样近似计算圆周率、定积分与数学期望