Lecture 11 完美信息博弈
有限完美信息博弈
完美信息(PI)博弈:每个信息集只有 1 个节点。
定理([Kuhn’53]) 每个有限 $n$ 人扩展式 PI 博弈 $\mathcal{G}$ 都有一个 NE;事实上,它在纯策略中有一个子博弈完美 NE(SPNE)。也就是说,存在某个纯策略组合 $s^\ast = (s_1^\ast, \cdots, s^\ast_n)$,它是一个 SPNE。
定义:对于一个博弈树为 $T$ 的博弈 $\mathcal{G}$,以及 $w\in T$,定义子树 $T_w \subseteq T$($w$ 是该子树的根节点)为:
\[T_w=\lbrace w^{\prime} \in T \mid w^{\prime}=w w^{\prime \prime} \text { for } w^{\prime \prime} \in \Sigma^\ast \rbrace\]由于树是有限的,我们可以只把收益关联到叶节点。因此,子树 $T_w$ 以显然的方式定义了一个“子博弈” $\mathcal{G}_w$,它同样是一个 PI 博弈。
节点 $w$ 在 $T$ 中的深度是它作为字符串的长度 $\lvert w \rvert$。树 $T$ 的深度是 $T$ 中任意节点的最大深度。博弈 $\mathcal{G}$ 的深度是其博弈树的深度。
证明 我们对一个子博弈 $\mathcal G_w$ 的深度作归纳,证明它有一个纯 SPNE,记为 $s^w = (s_1^w, \cdots, s_n^w)$。然后 $s^\ast:=s^{\epsilon}$。
基础情形,深度 0:此时我们位于一个叶节点 $w$。没有什么需要证明:每个玩家 $i$ 得到收益 $u_i(w)$,并且 SPNE $s^\ast$ 中的策略为空。
归纳步骤:假设 \(\mathcal{G}_w\) 的深度为 \(k + 1\)。令 \(Act(w) = \lbrace a^\prime_1, \cdots, a^\prime_r\rbrace\) 为 \(\mathcal{G}_w\) 根节点处可用的动作集合。对子树 \(T_{wa_j^\prime}\),其中 \(j = 1, \cdots, r\),每个都定义了一个深度 \(\leq k\) 的 PI 子博弈 \(\mathcal{G}_{wa_j^\prime}\)。
因此,由归纳假设,每个博弈 $\mathcal{G}_{wa_j^\prime}$ 都有一个纯策略 SPNE,记为 $s^{wa^\prime_j} = (s_1^{wa_j^\prime}, \cdots, s_n^{wa_j^\prime})$。
为了定义 $s^w = (s_1^w, \cdots, s^w_n)$,需要考虑两种情况:
-
$w \in Pl_0$,也就是说,$T_w$ 的根节点 $w$ 是一个机会节点(属于“自然”)。
令玩家 $i$ 的策略 $s_i^w$ 就是在各个子博弈中的纯策略的显然“并集” $\bigcup_{a^\prime\in Act(w)}s_i^{wa^\prime}$。(注意,这里 $Act(w)$ 表示概率集合。)
命题:$s^w = (s_1^w, \cdots, s_n^w)$ 必然是 $\mathcal{G}_w$(深度 $k + 1$)的一个纯 SPNE。
假设不是。那么某个玩家 $i$ 可以通过在某个子博弈中切换到另一个纯策略来提高其期望收益。但这违反了该子博弈上的归纳假设。
-
$w \in Pl_i, i > 0$:$T_w$ 的根节点 $w$ 属于玩家 $i$。对于 $a \in Act(w)$,令 \(h_i^{wa}(s^{wa})\) 表示玩家 $i$ 在子博弈 $\mathcal{G}_{wa}$ 中的期望收益。令 \(a^\prime = \argmax_{a\in Act(w)}h_i^{wa}(s^{wa})\)。对于玩家 \(i^\prime \neq i\),定义 \(s_{i^\prime}^w = (\bigcup_{a\in Act(w)}s_{i^\prime}^{wa})\)。
对于 $i$,定义 $s_i^{w} = (\bigcup_{a\in Act(w)}s_i^{wa}) \cup {w\to a^\prime}$。
命题:$s^w = (s_1^w, \cdots, s_n^w)$ 是 $\mathcal{G}_w$ 的一个纯 SPNE。$\quad \text{Q.E.D}$
在有限 PI 博弈中计算 SPNE 的算法
这个证明给出了一个容易的“自底向上”算法,用于在有限 PI 博弈中计算一个纯 SPNE。
对有限零和 PI 博弈的推论
回忆一下,根据 Minimax 定理,对于每个有限零和博弈 $\Gamma$,存在一个值 $v^\ast$,使得对于 $\Gamma$ 的任意 NE $(x^\ast_1, x^\ast_2)$,都有 $v^\ast = U(x_1^\ast, x_2^\ast)$,并且
\[\max _{x_1 \in X_1} \min _{x_2 \in X_2} U\left(x_1, x_2\right)=v^*=\min _{x_2 \in X_2} \max _{x_1 \in X_1} U\left(x_1, x_2\right)\]由 Kuhn 定理可知,对于扩展式 PI 博弈 $\mathcal{G}$,事实上存在一个纯 NE(事实上是 SPNE)$(s^\ast_1, s^\ast_2)$,使得 $v^\ast = u(s^\ast_1, s^\ast_2):= h(s^\ast_1, s^\ast_2)$,因此事实上
\[\max_{s_1\in S_1}\min_{s_2\in S_2}u(s_1, s_2) = v^\ast = \min_{s_2\in S_2}\max_{s_1\in S_1}u(s_1, s_2)\](P.S.,唯一的 $v^\ast$ + 关于纳什均衡的有用推论)
定义 如果一个有限零和博弈 $\Gamma$ 满足
\[\max_{s_1\in S_1}\min_{s_2\in S_2}u(s_1, s_2) = \min_{s_2\in S_2}\max_{s_1\in S_1}u(s_1, s_2)\]那么称它是被决定的。
(注意,$s_1$ 和 $s_2$ 都是纯策略。)
命题([Zermelo’1912])每个有限零和 PI 博弈 $\mathcal{G}$ 都是被决定的。此外,可以从 $\mathcal{G}$ 中“高效地”计算出该值以及一个纯 minimax 策略组合。
国际象棋
国际象棋是一个有限 PI 博弈(如果 50 步内没有棋子被吃掉,它以平局结束)。事实上,它是一个胜负和 PI 博弈:没有机会节点,可能的收益是 1、-1 和 0。
命题([Zermelo’1912])在国际象棋中,要么:
- 白方有一个必胜策略,或
- 黑方有一个必胜策略,或
- 双方都有能强制平局的策略。
例如,对白方来说,一个必胜策略是一个纯策略 $s^\ast_1$,它保证对所有 $s_2$ 都有 $u(s^\ast_1, s_2) = 1$。
然而,树太大了,这就是为什么我们需要 $\alpha$-$\beta$ 剪枝。
带 $\alpha$-$\beta$ 剪枝的 Minimax 搜索
为简单起见,假设玩家轮流行动,根节点属于玩家 1(最大化玩家),并且
\[-1 \leq {\rm Eval}(w) \leq +1\]分数 $-1$($+1$)表示玩家 1 必然输(赢)。通过调用 $\mathbf{MaxVal}(w, \alpha, \beta)$ 开始搜索;
$\mathbf{MaxVal}(w, \alpha, \beta)$
-
如果 $\text{depth}(w) \ge \text{MaxDepth}$,则返回 $\text{Eval}(w)$。
-
否则,对每个 $a\in Act(w)$:
-
$\alpha:= \max\lbrace\alpha, \mathbf{MaxVal}(wa, \alpha, \beta)\rbrace$;
-
如果 $\alpha \geq \beta$,则返回 $\beta$
-
-
返回 $\alpha$
$\mathbf{MaxVal}(w, \alpha, \beta)$
-
如果 $\text{depth}(w) \ge \text{MaxDepth}$,则返回 $\text{Eval}(w)$。
-
否则,对每个 $a\in Act(w)$:
-
$\alpha:= \max\lbrace\alpha, \mathbf{MaxVal}(wa, \alpha, \beta)\rbrace$;
-
如果 $\alpha \geq \beta$,则返回 $\alpha$
-
-
返回 $\beta$
推广到无限零和 PI 博弈
对于无限博弈,$\max \& \min$ 可能不存在!因此,我们称一个(无限)零和博弈是被决定的,如果:
\[\sup_{s_1\in S_1}\inf_{s_2\in S_2} u(s_1, s_2) = \inf_{s_2\in S_2}\sup_{s_1\in S_1} u(s_1, s_2)\]在简单的无限胜负 PI 博弈设定中(2 个玩家、零和、没有机会节点,并且唯一收益为 1 和 -1),这个定义表示:一个博弈被决定,当且仅当某一方玩家有一个必胜策略:存在策略 $s^\ast_1 \in S_1$,使得对任意 $s_2\in S_2$,都有 $u(s^\ast_1, s_2) = 1$(玩家 2 的情况反之亦然)。
($\sup$,即 supremum,表示最小上界;$\inf$,即 infimum,表示最大下界。)存在策略 $s^\ast_1 \in S_1$,使得对任意 $s_2 \in S_2$,都有 $u(s^\ast_1, s_2) = 1$(玩家 2 的情况反之亦然)。
并非每个胜负 PI 博弈都是被决定的。
决定性及其边界
对于胜负 PI 博弈,我们可以通过给出集合 $Y = u_1^{-1}(1) \subseteq \Psi_T$ 来定义收益函数,其中 $Y$ 是玩家 1 获胜的完整对局集合(玩家 2 必然在所有其他对局中获胜)。