2021 重启强化学习(2)—马尔可夫决策过程

作者 : 开心源码 本文共888个字,预计阅读时间需要3分钟 发布时间: 2022-05-13 共239人阅读

009.jpeg

假如想观看相关视频可以在西瓜视频(账号zidea)或者者哔哩哔哩(账号zidea2015)找到我发布视频解说,注意头像和简书使用头像一致。

马尔可夫决策过程 MDP(Markov Decision Processes)

马尔可夫决策过程是强化学习的一个基本框架,

马尔可夫链

在概率论更多时候我们都是研究随机变量,其中包括随机变量和随机变量之间的关系。有一种随机变量关系他们是在时序有一种相互关系。那么假如我们将这样时序相关关联一组随机变量看作一个整体来研究,这就是随机过程

马尔可夫链是一种特殊的随机过程,是具有马尔可夫属性的随机过程。在之前我们详情马尔可夫性质说到两个性质分别是

  • 马尔可夫假设
  • 观测独立假设

也就是下一个状态只取决于当前状态,而与当前状态的之间状态都没有关系。假如说某一个过程是满足马尔可夫特性的,在未来转移和过去是独立,只与现在状态有关,把具备这性质的随机过程就称为马尔可夫链

  • 过去状态集合 h_t = \{ S_1,S_2,S_3,\cdots, S_t \}
  • p(S_{t+1}|S_t) = p(S_{t+1}|h_t)

马尔可夫假设一个初衷就是为简化计算。

状态空间模型

  • HMM
  • Kalman Filter
  • Paticle Filter

p(S_{t+1}|S_t,a_t) = p(S_{t+1}|h_t,a_t)

状态转移矩阵

通常我们研究的对象都是离散的状态,其状态是有限的。形容马尔可夫状态转移矩阵是用来形容动态特性,可以可以将其称为状态转移函数、或者者状态转移概率都可以。

p = \begin{bmatrix} P(s_1|s_1) & P(s_2|s_1) & \cdots & P(s_N|s_1)\\ P(s_1|s_2) & P(s_2|s_2) & \cdots & P(s_N|s_2)\\ \end{bmatrix}

马尔可夫链实例

这就是轨迹概念,每一条链都是一条轨迹

  • S_3, S_4,S_5,S_6,S_6
  • S_3, S_2,S_3,S_2,S_1
  • S_3, S_4,S_4,S_5,S_5

马尔可夫奖励过程(MRPs)

马尔可夫奖励过程,就是马尔可夫链再加上一个奖励(Reward)函数

  • 定义马尔可夫奖励过程(MRP)
    • S 表示状态集合s \in S
    • P 是动态/转移模型可以表示为P(S_{t+1} = s^{\prime}|s_t = s)
    • R 是奖励函数 R(s_t = s) = \mathbb{E}[r_t|s_t = s]
    • Discount factor(折扣量)\gamma \in [0,1]

引入奖励R = [5,0,0,0,0,0,7],奖励过程看成随波逐流,随着事前定义好状态转移进行流动。

马尔可夫决策过程(MDPs)

马尔可夫决策过程(MDP),当我们买了某只股票,或者者投掷硬币进行下注,之后我们就能等待结果,根据结果来得到回报。马尔可夫决策过程(MDP) 会根据不同状态进行不同动作。

  • S 表示状态的集合
  • A 表示动作的集合,对于任意s \in S 通常来用 A(s) 表示动作集合是针对于某一个状态来说
  • \mathbb{P} 是 Action 是动态/转移模型 P(S_{t+1} = s^{\prime},R_{t+1}=r|s_t = s,a_t = a),也就是 MDP 动态特性
  • P 状态转移函数 P(S_{t+1} = s^{\prime}|s_t = s,a_t = a) = \sum_{r \in R} p(s^{\prime},r|s,a)
  • R 是奖励函数 R(s_t = s,a_t = a) = \mathbb{E}[r_t|s_t = s,a_t = a]
  • 折扣系数\gamma \in [0,1]
  • MDP 是(S,A,P,R,\gamma)
说明
1. 本站所有资源来源于用户上传和网络,如有侵权请邮件联系站长!
2. 分享目的仅供大家学习和交流,您必须在下载后24小时内删除!
3. 不得使用于非法商业用途,不得违反国家法律。否则后果自负!
4. 本站提供的源码、模板、插件等等其他资源,都不包含技术服务请大家谅解!
5. 如有链接无法下载、失效或广告,请联系管理员处理!
6. 本站资源售价只是摆设,本站源码仅提供给会员学习使用!
7. 如遇到加密压缩包,请使用360解压,如遇到无法解压的请联系管理员
开心源码网 » 2021 重启强化学习(2)—马尔可夫决策过程

发表回复