Hugo Narrow
Series Posts
Categories Tags Projects Archives
Series Posts
Categories Tags Projects Archives
  1. Home
  2. Posts
  3. 强化学习

强化学习

以智能体与环境的交互为主线,先建立策略、奖励、状态转移等基础概念,再分两条路线展开:价值方法上的 DQN、经验回放与 TD 学习,以及策略梯度、Monte Carlo 与 Actor-Critic 等优化手段,系统呈现强化学习的理论与算法演进。

7 pages

基础概念

介绍强化学习的智能体、环境、奖励与价值函数等基础概念

February 25, 2026
3 min
强化学习,价值函数,策略

价值学习

介绍用Q网络近似最优价值函数及时间差分算法

February 25, 2026
2 min
强化学习,DQN,时间差分

策略学习

用神经网络逼近策略函数,通过策略梯度直接最大化期望状态价值

February 25, 2026
2 min
策略梯度,策略学习,强化学习

TD算法

基于TD目标与回溯标记,讲解sarsa、Q Learning及多步TD

February 25, 2026
5 min
TD学习,sarsa,Q Learning

Actor-Critic算法

策略网络与价值网络协同,通过TD误差联合更新策略与价值

February 25, 2026
2 min
Actor-Critic,策略梯度

DQN优化

经验回放、优先回放、目标网络、double与dueling等DQN优化方法

February 25, 2026
3 min
DQN,经验回放,高估问题

蒙特卡洛

用随机采样近似计算圆周率、定积分与数学期望

February 25, 2026
1 min
蒙特卡洛,采样,数值计算
Projects About

© 2026 Hugo Narrow

Powered by Hugo & Narrow

Search

Start searching

Searching...

No results

↑↓ Navigate
↵ Select
ESC Close
⌘K Shortcut