Skip to main content Link Menu Expand (external link) Document Search Copy Copied

Lecture 10 扩展式博弈

玩家做出“移动”,其他玩家再用“移动”作出反应

树:一个形式化定义

实际上,这里的树可以被看作一个状态转换机器

  1. 令 $\Sigma = \lbrace a_1, a_2, \cdots, a_k \rbrace$ 为一个字母表。$\Sigma$ 上的一棵是一个节点集合 $T \subseteq \Sigma^\ast$,其中节点 $w \in \Sigma^\ast$,并且满足:如果 $w = w^\prime a \in T$,那么 $w^\prime\in T$。(也就是说,它是 $\Sigma^*$ 的一个前缀闭子集。换言之,如果一个字符串在 $T$ 中,那么它的所有前缀也都在 $T$ 中。)
  2. 对于节点 $w \in T$,$w$ 的子节点为 $ch(w) = \lbrace w^\prime\in T \mid w^\prime = wa, \text{for some } a\in \Sigma\rbrace$。对于 $w \in T$,令 $Act(w) = \lbrace a\in \Sigma \mid wa\in T\rbrace$ 表示在 $w$ 处可用的“动作”。
  3. 叶节点(或终止节点)$w \in T$ 是满足 $ch(w) = \empty$ 的节点。令 $L_T = \lbrace w\in T \mid w \text{ a leaf} \rbrace$。
  4. $T$ 中的一条(有限或无限)路径 $\pi$ 是节点序列 $\pi = w_0, w_1, w_2, \cdots$,其中 $w_i\in T$,并且如果 $w_{i + 1} \in T$,那么 $w_{i + 1} = w_ia$,对某个 $a \in \Sigma$ 成立。如果 $w_0 = \epsilon$,并且 $\pi$ 中每个非叶节点都有一个子节点也在 $\pi$ 中,那么它是一条完整路径(或对局)。令 $\Psi_{T}$ 表示 $T$ 的对局集合

扩展式博弈

一个扩展式博弈 $\mathcal{G}$ 由以下部分组成:

  1. 一个玩家集合 $N = \lbrace 1, \cdots, n\rbrace$。
  2. 一棵定义在某个 $\Sigma$ 上的树 $T$,称为博弈树
  3. 将树节点 $T$ 划分为互不相交的集合 $Pl_0, Pl_1, \cdots, Pl_n$,使得 $T = \bigcup_{i = 0}^n Pl_i$。其中 $Pl_i,i\geq 1$ 表示玩家 $i$ 的节点,也就是轮到玩家 $i$ 行动的节点。(而 $Pl_0$ 表示“机会”/“自然”节点。)
  4. 对每个“自然”节点 $w \in Pl_0$,有一个定义在其动作上的概率分布 $q_w: Act(w) \mapsto \mathbb{R}$:$q_w(a) \geq 0, \sum_{a\in Act(w)}q_w(a) = 1$。(也就是说,$Act(w)$ 映射到概率。)
  5. 对每个玩家 $i \geq 1$,将 $Pl_i$ 划分为互不相交的非空信息集 \({\rm Info}_{i, 1}, \cdots, {\rm Info}_{i, r_i}\),使得 \(Pl_i = \bigcup_{j = 0}^{r_i} {\rm Info}_{i, j}\)。此外,对于任意 $i, j$,以及所有节点 $w, w^\prime \in {\rm Info}_{i, j}$,都有 $Act(w) = Act(w^\prime)$。(也就是说,同一个信息集中所有节点的可能“动作”集合相同。)(信息集中的节点不知道在同时博弈中前一个玩家会采取哪个动作。)(只有一个元素的普通节点也可以构成一个信息集。)
  6. 对每个玩家 $i$,有一个函数 $u_i: \Psi_T \to \mathbb{R}$,从(完整)对局映射到玩家 $i$ 的收益。(p.s. 这是针对无限情形;对有限博弈,它可以是 $u_i: L_t \to \mathbb{R}$。)

定义 如果每个信息集 ${\rm Info}_{i, j}$ 都只包含 1 个节点,那么扩展式博弈 $\mathcal{G}$ 称为完美信息博弈。

纯策略

在扩展式博弈 $\mathcal G$ 中,玩家 $i$ 的一个纯策略 $s_i$ 是一个函数 $s_i: Pl_i \mapsto \Sigma$(也就是说,$s_i$ 是字母表中的一个字母),它为玩家 $i$ 的每个节点分配动作,满足 $s_i(w) \in Act(w), w\in Pl_i$,并且如果 $w, w^\prime \in {\rm Info}_{i, j}$,那么 $s_i(w) = s_i(w^\prime)$。

令 $S_i$ 为玩家 $i$ 的纯策略集合。

  1. 没有机会节点:给定纯策略组合 $s = (s_1, \cdots, s_n)\in S_1\times\cdots\times S_n$,如果没有机会节点(即 $Pl_0 = \emptyset$),那么 $s$ 唯一确定博弈的一条对局 $\pi_s$:玩家按照自己的策略行动:
    1. $\text {Initialize}$ $j:= 0$,$\text {and}$ $w_0 := \epsilon$;
    2. $\text{While}$($w_j$ $\text {is not at a terminal node}$)

      $\quad \quad \text{If } w_j \in Pl_i$,$\text{then } w_{j + 1}:= w_js_i(w_j)$;

      $\quad \quad j:= j + 1$

    3. $\pi_s = w_0, w_1, \cdots$
  2. 有机会节点:如果存在机会节点,那么 $s\in S$ 确定了博弈中对局 $\pi$ 上的一个概率分布。

    对于有限扩展式博弈,即 $T$ 有限时,我们可以使用概率 $q_w(a)$ 来计算对局 $\pi$ 的概率 $p_s(\pi)$:

    假设 $\pi = w_0, \cdots, w_m$ 是 $T$ 的一条对局。进一步假设对每个 $j < m$,如果 $w_j \in Pl_i$,那么 $w_{j + 1} = w_js_i(w_j)$。否则,令 $p_s(\pi) = 0$。

    令 $w_{j_1} \cdots, w_{j_r}$ 为 $\pi$ 中的机会节点,并假设对每个 $k = 1, \cdots, r$,都有 $w_{j_k + 1} = w_{j_k} a_{j_k}$,也就是说,从节点 $w_{j_k}$ 到 $w_{j_k + 1}$ 所需的动作是 $a_{j_k}$。那么

    \[p_s(\pi) := \prod_{k = 1}^r q_{w_{j_k}}(a_{j_k})\]

机会与期望收益

玩家 $i$ 在 $s$ 下的期望收益为:

\[h_i(s):= \sum_{\pi\in \Psi_T}p_s(\pi)\cdot u_i(\pi)\]

:这个期望收益并不是因为任何玩家在混合自己的策略而产生的。它来自博弈本身包含随机性。

从策略式博弈到扩展式博弈

每个有限策略式博弈 $\Gamma$ 都可以容易且简洁地编码为一个扩展式博弈 $\mathcal{G}_{\Gamma}$。

每个扩展式博弈 $\mathcal{G}$ 都可以被视为一个策略式博弈 $\Gamma_{\mathcal{G}}$:

  • 在 $\Gamma_{\mathcal{G}}$ 中,玩家 $i$ 的策略是映射 $s_i\in S_i$。
  • 在 $\Gamma_{\mathcal{G}}$ 中,对所有纯策略组合 $s$,我们定义收益 $u_i(s):= h_i(s)$。

如果扩展式博弈 $\mathcal{G}$ 是有限的,也就是说树 $T$ 是有限的,那么策略式博弈 $\Gamma_{\mathcal{G}}$ 也是有限的。

因此,我们为有限策略式博弈发展出的所有理论,也都适用于有限扩展式博弈。

不幸的是,策略式博弈 $\Gamma_{\mathcal{G}}$ 通常比 $\mathcal{G}$ 指数级更大。注意,如果玩家 $i$ 在树中有 $\lvert Pl_i\rvert = m$ 个节点,那么玩家 $i$ 的纯策略数量在最坏情况下是 $\lvert \Sigma \rvert ^m$。

为了“求解”一个博弈而天真地把它从扩展式形式转换为策略式形式,通常是不明智的。

不完美信息与完美记忆

  1. 如果一个扩展式博弈(EFG)有非平凡的(大小 > 1)信息集,那么它是不完美信息博弈。玩家并不完全知道当前“状态”(博弈树的当前节点)。
  2. 非正式地说,如果每个玩家 $i$ 从不忘记自己之前的动作序列和信息集,那么一个不完美信息 EFG 具有完美记忆。也就是说,EFG 具有完美记忆,如果每当 $w, w^\prime \in {\rm Info}_{i, j}$ 属于同一个信息集时,玩家 $i$ 在到达节点 $w$ 和 $w^\prime$ 之前的“可见历史”(对局中玩家 $i$ 经历的信息集序列和动作序列)必须完全相同。如果同一个信息集中的节点具有相同经历,那么该博弈具有完美记忆。
  3. 在完美记忆下,只需将玩家策略限制为行为策略就足够了:这种策略只在每个信息集上的动作之间(独立地)随机化。
    • 混合策略为纯策略分配一个概率分布。
    • 行为策略 独立地为每个信息集上的动作分配一个概率分布。智能体在每个节点处的(概率性)选择独立于他/她在其他节点处的选择。

不完美记忆的例子

子博弈与(子博弈)完美性

  1. 扩展式博弈的一个子博弈是博弈树中具有自包含信息集的任意子树。(也就是说,该子树中的每个节点都必须包含在一个信息集中,而这个信息集本身又完全包含在该子树中。此外,子树 $\neq$ 子博弈。

  2. 对于扩展式博弈 $\mathcal G$,玩家的一个行为策略组合 $b = (b_1, \cdots, b_n)$ 称为子博弈完美均衡(SGPE)(或子博弈完美纳什均衡),如果它在 $\mathcal G$ 的每一个子博弈中都定义了一个 NE。每个具有完美记忆有限扩展式博弈都有一个子博弈完美均衡(SPNE 的例子)。

  3. [Selten’75]:纳什均衡(NE)(甚至 SGPE)作为扩展式博弈的解概念仍然不够精炼。特别地,这类均衡可能包含“不可信威胁”(也就是执行起来并不理性的威胁)。为了解决 NE 和 SGPE 的这种一般性不足,需要一种更精炼的均衡概念,称为颤抖手完美均衡。