Skip to main content Link Menu Expand (external link) Document Search Copy Copied

Lecture 15 马尔可夫决策过程与随机博弈简述

马尔可夫决策过程

定义 一个马尔可夫决策过程(Markov Decision Process, MDP)由一个博弈图 $G_{v_0} = (V, E, pl, q, v_0, u)$ 给出,其中:

  • $V$ 是一个(有限)顶点集合。
  • $pl: V \mapsto \lbrace 0, 1\rbrace$ 将每个顶点映射到玩家 0(自然)或玩家 1。
    • 令 $V_0 = pl^{-1}(0)$,并令 $V_1 = pl^{-1}(1)$。
  • $E: V\mapsto 2^{V}$(成对集合)将每个顶点 $v$ 映射到一个“后继”(或 $v$ 处的“动作”)集合 $E(v)$。
  • 对每个“自然”顶点 $v\in V_0$,有一个定义在 $v$ 处“动作”集合上的概率分布 $q_v: E(v)\mapsto [0, 1]$,满足 $\sum _{v^\prime\in E(v)} q_v(v^\prime) = 1$。
  • 一个起始顶点 $v_0\in V$。
  • 一个收益函数:$u: \Psi_{T_{v_0}} \mapsto \mathbb{R}$,从对局映射到玩家 1 的收益。

玩家 1 想要最大化其期望收益

不同的收益函数

  1. 平均收益:为每个状态 $v\in V$ 关联一个收益。

    对于一条对局 $\pi = v_0v_1v_2v_3\cdots$,目标是最大化期望平均收益

    \[\mathbb{E}(\liminf_{n\to\infty}\frac{\sum_{i = 0}^{n-1}u(v_i)}{n})\]
  2. 折扣总收益:给定折扣因子 $0 < \beta < 1$,目标是最大化:

    \[\mathbb{E}(\lim_{n\to \infty}\sum_{i = 0}^n\beta^iu(v_i))\]
  3. 到达目标的概率:给定目标 $v_T\in V$,目标是最大化(或最小化)到达 $v_T$ 的概率。可以重新表述为:对于一条对局 $\pi = v_0v_1\cdots$,如果对某个 $i > 0$ 有 $v_i = v_T$,则令 $\mathcal{X}(\pi):= 1$;否则令 $\mathcal{X}(\pi) := 0$。目标:最大化/最小化 $\mathbb{E}(\mathcal{X}(\pi))$。

无记忆最优策略

回忆:一个策略仍然是任意函数,它把博弈中的每段历史(以玩家 1 控制的节点结束)映射到该节点处的一个动作(或动作上的概率分布)。

定理(无记忆最优策略)对于每个有限状态 MDP,只要目标是以下任意一种:

  • 平均收益,
  • 折扣总收益,或
  • 到达目标的概率,

玩家 1 都有一个纯无记忆最优策略

换句话说,玩家 1 有一个最优策略,它只需要对每个顶点 $v\in V_1$ 从 $E(v)$ 中选择一条边(动作)。

Bellman 最优性方程

对于最大化到达目标顶点 $v_t$ 的概率这一目标,考虑下面的方程组。令 $V = \lbrace v_1, \cdots, v_n\rbrace$ 为 MDP $G$ 的顶点集合。

考虑下面的方程组,其中每个顶点 $v_i$ 对应一个变量 $x_i$(表示玩家从顶点 $v_i$ 到达目标顶点 $v_T$ 的概率)。

\[\begin{align*}x_{T} &= 1 \\ x_i &= \max\lbrace x_j \mid v_j \in E(v_i)\rbrace \quad\text{for } v_i\in V_1 \\ x_i &= \sum_{v_j\in E(v_i)} q_{v_i}(v_j)\cdot x_j \quad\text{for } v_i\in V_0\end{align*}\]

定理 这些 MDP 的 max-linear Bellman 方程有一个(唯一的)最小非负解向量 $x^\ast = (x_1^\ast, \cdots, x_n^\ast) \in [0, 1]^n,$其中 $x_i^\ast$ 是玩家 1 从 $v_i$ 开始,在 MDP $G_{v_i}$ 中到达目标 $v_{T}$ 的最优概率。

计算最优值

计算 Bellman 方程 $x = L(x)$ 的解 $x^\ast$ 的一种方法是值迭代:考虑序列 $L(\mathbf{0}), L(L(\mathbf{0})), \cdots, L^m(\mathbf{0})$。

事实:$\lim_{m\to \infty} L^{m}(\mathbf{0}) = x^\ast$。

不幸的是,在最坏情况下,值迭代可能非常慢(需要指数多次迭代)。因此,我们可以改用 LP。令 $V = \lbrace v_1, \cdots, v_n\rbrace$ 为 MDP $G$ 的顶点。对每个顶点 $v_i \in V$,我们有一个 LP 变量 $x_i$。

最小化 $\sum_{i = 1}^n x_i$

满足约束

\[\begin{align*}x_{T} &= 1\\ x_i&\geq x_j, \text{ for each } v_i\in V_1, \text{ and } v_j \in E(v_i);\\ x_i &= \sum_{v_j\in E(v_i)}q_{v_i}(v_j) \cdot x_j, \text{ for each } v_i\in V_0; \\ x_i &\geq 0 \text{ for } i = 1, \cdots, n.\end{align*}\]

定理 对于这个 LP 的一个最优解 $(x_1^\ast, \cdots, x_n^\ast)\in \mathbb{R}^n$(它必然存在),每个 $x_i^\ast$ 都是玩家 1 在博弈 $G_{v_i}$ 中的最优值。

提取最优策略

对偶 LP。

随机博弈

如果我们在对抗自然的博弈中引入第二个玩家,会怎样?

在 Shapley 的随机博弈中,在每个状态下,两个玩家同时且独立地选择一个动作。他们的联合动作会同时产生一个 1 步奖励,以及下一状态上的概率分布。

定义 一个零和简单随机博弈由一个博弈图 $G_{v_0} = (V, E, pl, q, v_0, u)$ 给出,其中

  • $V$ 是一个(有限)顶点集合。
  • $pl: V \mapsto \lbrace 0, 1, 2\rbrace$,其中 0 表示“自然”。
    • 反函数 $pl^{-1}$ 与上面的定义相同。
  • $E:V\mapsto 2^V$ 将每个顶点 $v$ 映射到一个“后继”(或 $v$ 处的“动作”)集合 $E(V)$。
  • 令 $V_{\rm dead} = \lbrace v\in V \mid E(v) = \empty\rbrace$。
  • 对每个“自然”顶点 $v\in V_0$,有一个定义在 $v$ 处“动作”集合上的概率分布 $q_v: E(v)\mapsto [0, 1]$,满足 $\sum_{v^\prime\in E(v)}q_v(v^\prime) = 1$。
  • 一个起始顶点 $v_0 \in V$。
  • 一个目标顶点 $v_T \in V$。
Note:拥塞博弈和简单随机博弈是两种不同类型的博弈,不能等同。 拥塞博弈是一类玩家选择动作、并由这些动作共同影响一个全局拥塞函数的博弈。每个玩家的收益取决于他们选择的动作,以及所有玩家共同造成的拥塞。拥塞博弈通常是非合作的,并且存在纯纳什均衡。 另一方面,简单随机博弈是一种动态博弈,玩家轮流选择动作,博弈在状态之间以概率方式转移。每个玩家的收益取决于博弈状态以及所有玩家选择的动作。简单随机博弈可以是合作的或非合作的,并且每个玩家的最优策略可能依赖于其他玩家的策略。 因此,虽然拥塞博弈和简单随机博弈都涉及某种程度的随机性,但它们本质上是具有不同特征的不同博弈类型,不能彼此归约。

无记忆决定性

  • 玩家 1 的目标是最大化命中目标状态 $v_T$ 的概率。
  • 玩家 2 的目标是最小化这一概率。(因此该博弈是一个零和 2 人博弈。)
  • 如果两个玩家都有(确定性的)无记忆最优策略,那么称这个博弈是无记忆决定的。

定理([Condon’92])每个简单随机博弈都是无记忆决定的。

计算最优策略

  • 无记忆决定性立即给出一个计算最优策略的算法:
    • “猜”其中一个玩家的策略。
    • “剩余博弈”是一个 MDP;求解对应的 LP。
  • 这给出了一个用于求解简单随机博弈的 NP $\cap$ co-NP 过程。
  • [Hoffman-Karp’66] 研究了一种基于 LP 的随机博弈“策略改进算法”,它可以被改造用于简单随机博弈([Condon’92])。
  • 求解奇偶博弈和平均收益博弈可以归约为求解 SSG。