基础概念
介绍强化学习的智能体、环境、奖励与价值函数等基础概念
3 min
强化学习,价值函数,策略
介绍强化学习的智能体、环境、奖励与价值函数等基础概念
介绍逻辑回归、损失函数、激活函数与反向传播等神经网络基础
介绍用Q网络近似最优价值函数及时间差分算法
介绍正则化、优化算法与批归一化等深层神经网络训练技巧
用神经网络逼近策略函数,通过策略梯度直接最大化期望状态价值
介绍机器学习训练调试策略、评价指标及迁移与多任务学习
基于TD目标与回溯标记,讲解sarsa、Q Learning及多步TD
介绍卷积运算、池化及经典卷积网络与目标检测算法
策略网络与价值网络协同,通过TD误差联合更新策略与价值
介绍支持向量机的大间隔、核函数与软间隔原理
经验回放、优先回放、目标网络、double与dueling等DQN优化方法
用随机采样近似计算圆周率、定积分与数学期望
覆盖强化学习基础概念、DQN、TD学习与梯度策略优化
涵盖神经网络、逻辑回归、支持向量机与卷积神经网络的模型原理