Lecture 12 图上的博弈
同一个“位置或配置”可能在博弈中反复出现,但(无限)博弈树并不能反映这一点。
博弈图及其树
一个 2 人博弈图 $G = (V, E, pl)$ 由以下部分组成:
- 一个(有限)顶点集合 $V$。
- 一个边集合 $E \subseteq V\times V$。
- 顶点集合 $V = V_1 \cup V_2$ 的一个划分 $(V_1, V_2)$,其中 $V_1$ 和 $V_2$ 互不相交,分别属于玩家 1 和玩家 2。
一个博弈图 $G$ 与一个起始顶点 $v_0 \in V$ 一起,定义了一棵博弈树 $T_{v_0}$:
- 动作字母表 $\Sigma = V$。因此 $T_{v_0} \subseteq V^*$。
- $\epsilon \in T_{v_0}$,并且对 $v^{\prime\prime} \in V$,$wv^{\prime\prime} \in T_{v_0}$ 当且仅当:
- $w = \epsilon$ 且 $(v_0, v^{\prime\prime}) \in E$,或
- $w = w^{\prime\prime}$,对某个 $v^\prime\in V$ 成立,并且 $(v^\prime, v^{\prime\prime})\in E$。
(如果任意节点 $w$ 的最后一个顶点是 $v^\prime$,那么它有动作 $v^{\prime\prime}$,当且仅当 $(v^\prime, v^{\prime\prime})\in E$。)
图上的博弈
一个图上的博弈 $\mathcal{G}_{v_0}$ 由以下内容给出:
一个有限博弈图 $G$、顶点 $v_0\in V$,以及收益函数 $u: \Psi_{T_{v_0}} \mapsto \mathbb{R}$。
这些共同定义了一个 2 人零和 PI 博弈,其博弈树为 $T_{v_0}$。
注:有限图一般并不一定是被决定的。
历史无关收益
假设图 $G$ 中存在一个顶点 $v^\prime$ 是“死端”。例如,在国际象棋中,这可能是“玩家 I 将死对方”。
可能有很多方式到达 $v^\prime$,但对于任意有限对局 $wv^\prime \in V^\ast$,赢家都是相同的。也就是说,对所有 $wv^\prime, w^{\prime\prime} \in V^\ast$,都有 $u(wv^\prime) = u(w^\prime v^\prime)$。因此,收益是“历史无关的”。
那么对于无限对局 $\pi$ 呢?我们可以把 $\pi$ 看作一个无限序列 $v_0v_1v_2\cdots$,其中每个 $v_i \in V$。我们使用记号 $\pi \in V^\omega$。
对于 $\pi = v_0v_1v_2\cdots$,令
\[\inf(\pi) = \lbrace v\in V \mid \text{ for }\infty\text{-many } i \in \mathbb{N}, v_i = v\rbrace\]或
\[\inf(\pi) = \lbrace v\in V \mid \forall n\in \mathbb{N}, \exists j\ge n, v_j = v \rbrace\]也就是说,它是无限对局 $\pi$ 中循环部分的入口。
如果对于所有无限对局 $\pi\ \&\ \pi^\prime$,只要 $\inf(\pi) = \inf(\pi^\prime)$,就有 $u(\pi) = u(\pi^\prime)$;并且对于所有有限完整对局 $wv$ 和 $w^\prime v$,都有
\[u(wv) = u(w^\prime v)\]那么称收益函数 $u()$ 是历史无关的(h.o.)。
如果一个图博弈的收益是 h.o.,则称它是 h.o. 的。这里 $w$ 和 $w^\prime$ 表示历史。
有限式收益
注意,在国际象棋中,如果对局 $\pi$ 是无限的,那么该对局总是平局,即 $u(\pi) = 0$。
如果一个 h.o. 收益函数对所有无限对局 $\pi$ 和 $\pi^\prime$ 都满足 $u(\pi) = u(\pi^\prime)$,那么称它是有限式的。如果一个图上的博弈 $\mathcal{G}_{v_0}$ 的收益函数是有限式的,则称该博弈是有限式的。
因此,在胜负和有限式博弈中,对玩家 1 来说,无限对局要么全是胜,要么全是负,要么全是平局。
因此,所有图上的有限式博弈都是被决定的。 事实上,更强的结论成立:对于有限式博弈,每个玩家总是存在一个达到博弈值的无记忆策略,并且我们可以高效地计算这些策略。
无记忆策略与决定性
定义:对于一个博弈 $\mathcal{G}_{v_0}$,如果对所有 $wv, w^\prime v \in Pl^\prime_i$ 都有 $s_i(wv) = s_i(w^\prime v)$,并且如果 $wv_0\in Pl_i^\prime$,那么 $s_i(wv_0) = s_i(\epsilon)$,则称玩家 $i$ 的策略 $s_i$ 是无记忆策略。
也就是说,该策略总是从同一个顶点作出同样的移动,而不管它是如何到达该顶点的。
令 ${\rm MLS}_i$ 表示玩家 $i$ 的无记忆策略集合。即使 $S_i$ 不是有限集,${\rm MLS}_i$ 也是有限集。特别地,如果 $m = \lvert Pl_i\rvert$ 是属于玩家 $i$ 的顶点数量,那么 $\lvert {\rm MLS}_i \rvert \leq \lvert \Sigma \rvert ^m$。
定义:如果 $\mathcal{G}_{v_0}$ 中双方都有达到“博弈值”的无记忆策略,那么称它是无记忆决定的。也就是说,
\[\max_{s_1\in {\rm MLS}_1}\inf_{s_2\in S_2} u(s_1, s_2) = \min_{s_2\in {\rm MLS}_2}\sup_{s_1\in S_1} u(s_1, s_2)\]定理 A 有限图上的有限式博弈是无记忆决定的。此外,存在一个高效的(P-time)算法,可以在这样的博弈中计算无记忆达值策略。
胜负情形:简单的“不动点”算法
我们首先通过一个简单的自底向上不动点算法,为有限式胜负博弈证明该定理。
$\text{Input}$:博弈图 $G = (V, E, pl, v_0)$。
不失一般性,假设所有无限对局都是玩家 1 获胜(另一种情况是对称的)。“死端”:没有外出边的顶点。
- $\text{Good} := \lbrace v\in V \mid v \text{ a dead end that wins for player 1}\rbrace$。
- $\text{Bad}:= \lbrace v\in V \mid v \text{ a dead end that wins for player 2} \rbrace$
- $\mathbf{Initialize}$:$\text{Win}_1 := \text{Good}; St_1 := \emptyset$;
-
$\mathbf{Repeat}$
- $\mathbf{Foreach}\ v\notin \text{Win}_1$:
-
$\text{If } (pl(v) = 1 \ \&\ \exist (v, v^\prime)\in E: v^\prime\in \text{Win}_1)$:
$\text{Win}_1 := \text{Win}_1 \cup \lbrace v\rbrace; St_1 := St_1 \cup \lbrace v\mapsto v^\prime\rbrace$;
-
$\text{If } (pl(v) = 2 \ \&\ \forall (v, v^\prime)\in E: v^\prime\in \text{Win}_1)$:
$\text{Win}_1 := \text{Win}_1 \cup \lbrace v\rbrace$;
-
$\mathbf{Until} \text{ The set Win}_1 \text{ does not change}$;
- $\mathbf{Foreach}\ v\notin \text{Win}_1$:
玩家 1 有必胜策略,当且仅当 $v_0 \in \text{Win}_1$。如果是这样,那么 $St_1$ 是玩家 1 的一个无记忆必胜策略。