基础概念
介绍强化学习的智能体、环境、奖励与价值函数等基础概念
3 min
强化学习,价值函数,策略
介绍强化学习的智能体、环境、奖励与价值函数等基础概念
介绍用Q网络近似最优价值函数及时间差分算法
用神经网络逼近策略函数,通过策略梯度直接最大化期望状态价值
基于TD目标与回溯标记,讲解sarsa、Q Learning及多步TD
策略网络与价值网络协同,通过TD误差联合更新策略与价值
经验回放、优先回放、目标网络、double与dueling等DQN优化方法
用随机采样近似计算圆周率、定积分与数学期望
覆盖强化学习基础概念、DQN、TD学习与梯度策略优化