Skip to main content Link Menu Expand (external link) Document Search Copy Copied

Lecture 11 完美信息博弈

有限完美信息博弈

完美信息(PI)博弈:每个信息集只有 1 个节点。

定理([Kuhn’53]) 每个有限 $n$ 人扩展式 PI 博弈 $\mathcal{G}$ 都有一个 NE;事实上,它在纯策略中有一个子博弈完美 NE(SPNE)。也就是说,存在某个策略组合 $s^\ast = (s_1^\ast, \cdots, s^\ast_n)$,它是一个 SPNE。

定义:对于一个博弈树为 $T$ 的博弈 $\mathcal{G}$,以及 $w\in T$,定义子树 $T_w \subseteq T$($w$ 是该子树的根节点)为:

\[T_w=\lbrace w^{\prime} \in T \mid w^{\prime}=w w^{\prime \prime} \text { for } w^{\prime \prime} \in \Sigma^\ast \rbrace\]

由于树是有限的,我们可以只把收益关联到叶节点。因此,子树 $T_w$ 以显然的方式定义了一个“子博弈” $\mathcal{G}_w$,它同样是一个 PI 博弈。

节点 $w$ 在 $T$ 中的深度是它作为字符串的长度 $\lvert w \rvert$。树 $T$ 的深度是 $T$ 中任意节点的最大深度。博弈 $\mathcal{G}$ 的深度是其博弈树的深度。

证明 我们对一个子博弈 $\mathcal G_w$ 的深度作归纳,证明它有一个纯 SPNE,记为 $s^w = (s_1^w, \cdots, s_n^w)$。然后 $s^\ast:=s^{\epsilon}$。

基础情形,深度 0:此时我们位于一个叶节点 $w$。没有什么需要证明:每个玩家 $i$ 得到收益 $u_i(w)$,并且 SPNE $s^\ast$ 中的策略为空。

归纳步骤:假设 \(\mathcal{G}_w\) 的深度为 \(k + 1\)。令 \(Act(w) = \lbrace a^\prime_1, \cdots, a^\prime_r\rbrace\) 为 \(\mathcal{G}_w\) 根节点处可用的动作集合。对子树 \(T_{wa_j^\prime}\),其中 \(j = 1, \cdots, r\),每个都定义了一个深度 \(\leq k\) 的 PI 子博弈 \(\mathcal{G}_{wa_j^\prime}\)。

因此,由归纳假设,每个博弈 $\mathcal{G}_{wa_j^\prime}$ 都有一个纯策略 SPNE,记为 $s^{wa^\prime_j} = (s_1^{wa_j^\prime}, \cdots, s_n^{wa_j^\prime})$。

为了定义 $s^w = (s_1^w, \cdots, s^w_n)$,需要考虑两种情况:

  1. $w \in Pl_0$,也就是说,$T_w$ 的根节点 $w$ 是一个机会节点(属于“自然”)。

    令玩家 $i$ 的策略 $s_i^w$ 就是在各个子博弈中的纯策略的显然“并集” $\bigcup_{a^\prime\in Act(w)}s_i^{wa^\prime}$。(注意,这里 $Act(w)$ 表示概率集合。)

    命题:$s^w = (s_1^w, \cdots, s_n^w)$ 必然是 $\mathcal{G}_w$(深度 $k + 1$)的一个纯 SPNE。

    假设不是。那么某个玩家 $i$ 可以通过在某个子博弈中切换到另一个纯策略来提高其期望收益。但这违反了该子博弈上的归纳假设。

  2. $w \in Pl_i, i > 0$:$T_w$ 的根节点 $w$ 属于玩家 $i$。对于 $a \in Act(w)$,令 \(h_i^{wa}(s^{wa})\) 表示玩家 $i$ 在子博弈 $\mathcal{G}_{wa}$ 中的期望收益。令 \(a^\prime = \argmax_{a\in Act(w)}h_i^{wa}(s^{wa})\)。对于玩家 \(i^\prime \neq i\),定义 \(s_{i^\prime}^w = (\bigcup_{a\in Act(w)}s_{i^\prime}^{wa})\)。

    对于 $i$,定义 $s_i^{w} = (\bigcup_{a\in Act(w)}s_i^{wa}) \cup {w\to a^\prime}$。

    命题:$s^w = (s_1^w, \cdots, s_n^w)$ 是 $\mathcal{G}_w$ 的一个纯 SPNE。$\quad \text{Q.E.D}$

在有限 PI 博弈中计算 SPNE 的算法

这个证明给出了一个容易的“自底向上”算法,用于在有限 PI 博弈中计算一个纯 SPNE。

对有限零和 PI 博弈的推论

回忆一下,根据 Minimax 定理,对于每个有限零和博弈 $\Gamma$,存在一个值 $v^\ast$,使得对于 $\Gamma$ 的任意 NE $(x^\ast_1, x^\ast_2)$,都有 $v^\ast = U(x_1^\ast, x_2^\ast)$,并且

\[\max _{x_1 \in X_1} \min _{x_2 \in X_2} U\left(x_1, x_2\right)=v^*=\min _{x_2 \in X_2} \max _{x_1 \in X_1} U\left(x_1, x_2\right)\]

由 Kuhn 定理可知,对于扩展式 PI 博弈 $\mathcal{G}$,事实上存在一个纯 NE(事实上是 SPNE)$(s^\ast_1, s^\ast_2)$,使得 $v^\ast = u(s^\ast_1, s^\ast_2):= h(s^\ast_1, s^\ast_2)$,因此事实上

\[\max_{s_1\in S_1}\min_{s_2\in S_2}u(s_1, s_2) = v^\ast = \min_{s_2\in S_2}\max_{s_1\in S_1}u(s_1, s_2)\]

(P.S.,唯一的 $v^\ast$ + 关于纳什均衡的有用推论)

定义 如果一个有限零和博弈 $\Gamma$ 满足

\[\max_{s_1\in S_1}\min_{s_2\in S_2}u(s_1, s_2) = \min_{s_2\in S_2}\max_{s_1\in S_1}u(s_1, s_2)\]

那么称它是被决定的。

(注意,$s_1$ 和 $s_2$ 都是纯策略。)

命题([Zermelo’1912])每个有限零和 PI 博弈 $\mathcal{G}$ 都是被决定的。此外,可以从 $\mathcal{G}$ 中“高效地”计算出该值以及一个纯 minimax 策略组合。

国际象棋

国际象棋是一个有限 PI 博弈(如果 50 步内没有棋子被吃掉,它以平局结束)。事实上,它是一个胜负和 PI 博弈:没有机会节点,可能的收益是 1、-1 和 0。

命题([Zermelo’1912])在国际象棋中,要么:

  1. 白方有一个必胜策略,或
  2. 黑方有一个必胜策略,或
  3. 双方都有能强制平局的策略。

例如,对白方来说,一个必胜策略是一个纯策略 $s^\ast_1$,它保证对所有 $s_2$ 都有 $u(s^\ast_1, s_2) = 1$。

然而,树太大了,这就是为什么我们需要 $\alpha$-$\beta$ 剪枝。

带 $\alpha$-$\beta$ 剪枝的 Minimax 搜索

为简单起见,假设玩家轮流行动,根节点属于玩家 1(最大化玩家),并且

\[-1 \leq {\rm Eval}(w) \leq +1\]

分数 $-1$($+1$)表示玩家 1 必然输(赢)。通过调用 $\mathbf{MaxVal}(w, \alpha, \beta)$ 开始搜索;

$\mathbf{MaxVal}(w, \alpha, \beta)$

  1. 如果 $\text{depth}(w) \ge \text{MaxDepth}$,则返回 $\text{Eval}(w)$。

  2. 否则,对每个 $a\in Act(w)$:

    1. $\alpha:= \max\lbrace\alpha, \mathbf{MaxVal}(wa, \alpha, \beta)\rbrace$;

    2. 如果 $\alpha \geq \beta$,则返回 $\beta$

  3. 返回 $\alpha$

$\mathbf{MaxVal}(w, \alpha, \beta)$

  1. 如果 $\text{depth}(w) \ge \text{MaxDepth}$,则返回 $\text{Eval}(w)$。

  2. 否则,对每个 $a\in Act(w)$:

    1. $\alpha:= \max\lbrace\alpha, \mathbf{MaxVal}(wa, \alpha, \beta)\rbrace$;

    2. 如果 $\alpha \geq \beta$,则返回 $\alpha$

  3. 返回 $\beta$

推广到无限零和 PI 博弈

对于无限博弈,$\max \& \min$ 可能不存在!因此,我们称一个(无限)零和博弈是被决定的,如果:

\[\sup_{s_1\in S_1}\inf_{s_2\in S_2} u(s_1, s_2) = \inf_{s_2\in S_2}\sup_{s_1\in S_1} u(s_1, s_2)\]

在简单的无限胜负 PI 博弈设定中(2 个玩家、零和、没有机会节点,并且唯一收益为 1 和 -1),这个定义表示:一个博弈被决定,当且仅当某一方玩家有一个必胜策略:存在策略 $s^\ast_1 \in S_1$,使得对任意 $s_2\in S_2$,都有 $u(s^\ast_1, s_2) = 1$(玩家 2 的情况反之亦然)。

($\sup$,即 supremum,表示最小上界;$\inf$,即 infimum,表示最大下界。)存在策略 $s^\ast_1 \in S_1$,使得对任意 $s_2 \in S_2$,都有 $u(s^\ast_1, s_2) = 1$(玩家 2 的情况反之亦然)。

并非每个胜负 PI 博弈都是被决定的。

决定性及其边界

对于胜负 PI 博弈,我们可以通过给出集合 $Y = u_1^{-1}(1) \subseteq \Psi_T$ 来定义收益函数,其中 $Y$ 是玩家 1 获胜的完整对局集合(玩家 2 必然在所有其他对局中获胜)。