Skip to main content Link Menu Expand (external link) Document Search Copy Copied

Lecture 12 图上的博弈

同一个“位置或配置”可能在博弈中反复出现,但(无限)博弈树并不能反映这一点。

博弈图及其树

一个 2 人博弈图 $G = (V, E, pl)$ 由以下部分组成:

  • 一个(有限)顶点集合 $V$。
  • 一个边集合 $E \subseteq V\times V$。
  • 顶点集合 $V = V_1 \cup V_2$ 的一个划分 $(V_1, V_2)$,其中 $V_1$ 和 $V_2$ 互不相交,分别属于玩家 1 和玩家 2。

一个博弈图 $G$ 与一个起始顶点 $v_0 \in V$ 一起,定义了一棵博弈树 $T_{v_0}$:

  • 动作字母表 $\Sigma = V$。因此 $T_{v_0} \subseteq V^*$。
  • $\epsilon \in T_{v_0}$,并且对 $v^{\prime\prime} \in V$,$wv^{\prime\prime} \in T_{v_0}$ 当且仅当:
    • $w = \epsilon$ 且 $(v_0, v^{\prime\prime}) \in E$,或
    • $w = w^{\prime\prime}$,对某个 $v^\prime\in V$ 成立,并且 $(v^\prime, v^{\prime\prime})\in E$。

    (如果任意节点 $w$ 的最后一个顶点是 $v^\prime$,那么它有动作 $v^{\prime\prime}$,当且仅当 $(v^\prime, v^{\prime\prime})\in E$。)

图上的博弈

一个图上的博弈 $\mathcal{G}_{v_0}$ 由以下内容给出:

       一个有限博弈图 $G$、顶点 $v_0\in V$,以及收益函数 $u: \Psi_{T_{v_0}} \mapsto \mathbb{R}$。

这些共同定义了一个 2 人零和 PI 博弈,其博弈树为 $T_{v_0}$。

:有限图一般并不一定是被决定的。

历史无关收益

假设图 $G$ 中存在一个顶点 $v^\prime$ 是“死端”。例如,在国际象棋中,这可能是“玩家 I 将死对方”。

可能有很多方式到达 $v^\prime$,但对于任意有限对局 $wv^\prime \in V^\ast$,赢家都是相同的。也就是说,对所有 $wv^\prime, w^{\prime\prime} \in V^\ast$,都有 $u(wv^\prime) = u(w^\prime v^\prime)$。因此,收益是“历史无关的”。

那么对于无限对局 $\pi$ 呢?我们可以把 $\pi$ 看作一个无限序列 $v_0v_1v_2\cdots$,其中每个 $v_i \in V$。我们使用记号 $\pi \in V^\omega$。

对于 $\pi = v_0v_1v_2\cdots$,令

\[\inf(\pi) = \lbrace v\in V \mid \text{ for }\infty\text{-many } i \in \mathbb{N}, v_i = v\rbrace\]

\[\inf(\pi) = \lbrace v\in V \mid \forall n\in \mathbb{N}, \exists j\ge n, v_j = v \rbrace\]

也就是说,它是无限对局 $\pi$ 中循环部分的入口。

如果对于所有无限对局 $\pi\ \&\ \pi^\prime$,只要 $\inf(\pi) = \inf(\pi^\prime)$,就有 $u(\pi) = u(\pi^\prime)$;并且对于所有有限完整对局 $wv$ 和 $w^\prime v$,都有

\[u(wv) = u(w^\prime v)\]

那么称收益函数 $u()$ 是历史无关的(h.o.)。

如果一个图博弈的收益是 h.o.,则称它是 h.o. 的。这里 $w$ 和 $w^\prime$ 表示历史。

有限式收益

注意,在国际象棋中,如果对局 $\pi$ 是无限的,那么该对局总是平局,即 $u(\pi) = 0$。

如果一个 h.o. 收益函数对所有无限对局 $\pi$ 和 $\pi^\prime$ 都满足 $u(\pi) = u(\pi^\prime)$,那么称它是有限式的。如果一个图上的博弈 $\mathcal{G}_{v_0}$ 的收益函数是有限式的,则称该博弈是有限式的。

因此,在胜负和有限式博弈中,对玩家 1 来说,无限对局要么全是胜,要么全是负,要么全是平局。

因此,所有图上的有限式博弈都是被决定的。 事实上,更强的结论成立:对于有限式博弈,每个玩家总是存在一个达到博弈值的无记忆策略,并且我们可以高效地计算这些策略。

无记忆策略与决定性

定义:对于一个博弈 $\mathcal{G}_{v_0}$,如果对所有 $wv, w^\prime v \in Pl^\prime_i$ 都有 $s_i(wv) = s_i(w^\prime v)$,并且如果 $wv_0\in Pl_i^\prime$,那么 $s_i(wv_0) = s_i(\epsilon)$,则称玩家 $i$ 的策略 $s_i$ 是无记忆策略

也就是说,该策略总是从同一个顶点作出同样的移动,而不管它是如何到达该顶点的。

令 ${\rm MLS}_i$ 表示玩家 $i$ 的无记忆策略集合。即使 $S_i$ 不是有限集,${\rm MLS}_i$ 也是有限集。特别地,如果 $m = \lvert Pl_i\rvert$ 是属于玩家 $i$ 的顶点数量,那么 $\lvert {\rm MLS}_i \rvert \leq \lvert \Sigma \rvert ^m$。

定义:如果 $\mathcal{G}_{v_0}$ 中双方都有达到“博弈值”的无记忆策略,那么称它是无记忆决定的。也就是说,

\[\max_{s_1\in {\rm MLS}_1}\inf_{s_2\in S_2} u(s_1, s_2) = \min_{s_2\in {\rm MLS}_2}\sup_{s_1\in S_1} u(s_1, s_2)\]

定理 A 有限图上的有限式博弈是无记忆决定的。此外,存在一个高效的(P-time)算法,可以在这样的博弈中计算无记忆达值策略。

胜负情形:简单的“不动点”算法

我们首先通过一个简单的自底向上不动点算法,为有限式胜负博弈证明该定理

$\text{Input}$:博弈图 $G = (V, E, pl, v_0)$。

不失一般性,假设所有无限对局都是玩家 1 获胜(另一种情况是对称的)。“死端”:没有外出边的顶点。

  • $\text{Good} := \lbrace v\in V \mid v \text{ a dead end that wins for player 1}\rbrace$。
  • $\text{Bad}:= \lbrace v\in V \mid v \text{ a dead end that wins for player 2} \rbrace$
  1. $\mathbf{Initialize}$:$\text{Win}_1 := \text{Good}; St_1 := \emptyset$;
  2. $\mathbf{Repeat}$

    1. $\mathbf{Foreach}\ v\notin \text{Win}_1$:
      1. $\text{If } (pl(v) = 1 \ \&\ \exist (v, v^\prime)\in E: v^\prime\in \text{Win}_1)$:

        $\text{Win}_1 := \text{Win}_1 \cup \lbrace v\rbrace; St_1 := St_1 \cup \lbrace v\mapsto v^\prime\rbrace$;

      2. $\text{If } (pl(v) = 2 \ \&\ \forall (v, v^\prime)\in E: v^\prime\in \text{Win}_1)$:

        $\text{Win}_1 := \text{Win}_1 \cup \lbrace v\rbrace$;

    $\mathbf{Until} \text{ The set Win}_1 \text{ does not change}$;

玩家 1 有必胜策略,当且仅当 $v_0 \in \text{Win}_1$。如果是这样,那么 $St_1$ 是玩家 1 的一个无记忆必胜策略