Lecture 8 一般有限策略式博弈的求解 I:支配与迭代策略消除
策略上的偏序:支配
定义:对于 $x_i, x_i^\prime \in X_i$,如果对所有 $x_{-i} \in X_{-i}$ 都有
\[U_i(x_{-i};x_i) \geq U_i(x_{-i};x_i^\prime)\]则称 $x_i$ 支配 $x^\prime_i$,记作 $x_i \succeq x^\prime_i$。
如果对所有 $x_{-i}\in X_{-i}$ 都有
\[U_i(x_{-i};x_i) > U_i(x_{-i};x_i^\prime)\]则称 $x_i$ 严格支配 $x_i^\prime$,记作 $x_i \succ x_i^\prime$。
命题:$x_i$ 支配 $x_i^\prime$,当且仅当对所有纯反策略组合 $\pi_{-i}\in X_{-i}$ 都成立。
\[U_i(\pi_{-i};x_i) \geq U_i(\pi_{-i};x_i^\prime)\]类似地,$x_i$ 严格支配 $x_i^\prime$,当且仅当对所有 $\pi_{-i}$ 都有
\[U_i(\pi_{-i};x_i) > U_i(\pi_{-i};x_i^\prime)\]明显好的策略:占优策略
定义:如果对所有 $x_i^\prime \in X_i$ 都有 $x_i \succeq x_i^\prime$,那么混合策略 $x_i \in X_i$ 是占优的。如果对所有满足 $x_i \neq x_i^\prime$ 的 $x_i^\prime \in X_i$ 都有 $x_i \succ x_i^\prime$,那么 $x_i$ 是严格占优的。
定义:对于一个混合策略 $x_i$,它的支撑集 ${\rm support}(x_i)$ 是所有满足 $x_i(j) > 0$ 的纯策略 $\pi_{i, j}$ 的集合。
命题:每个占优策略 $x_i$ 实际上都是纯占优策略的“加权平均”。也就是说,每个 $\pi_{i, j} \in {\rm support}(x_i)$ 也都是占优的。
此外,只有纯策略可能是严格占优的。
证明:纯策略的加权平均为
\[U_i(x_{-i}; x_i) = \sum_{j = 1}^{m_i} x_i(j)\cdot U_i(x_{-i}; \pi_{i, j})\]如果 $x_i$ 是占优策略,那么对于任意 $x_{-i}$,对所有 $j$ 都有 $U_i(x_{-i}; x_i) \geq U_i(x_{-i}; \pi_{i, j})$(NE)。但如果 $x_i(j) > 0$,那么 $U_i(x_{-i};x_i) = U_i(x_{-i}; \pi_{i, j})$。(有用推论。)
如果 $x_i$ 是严格占优的,那么它显然必须等于其支撑集中唯一的纯策略。(否则,$U_i(x_{-i}; x_i) > U_i(x_{-i}; \pi_{i, j})$ 不会成立。)
寻找占优策略的算法
- 对每个玩家 $i$ 和每个纯策略 $s_j \in S_i$,
- 检查是否对所有纯组合 $s\in S = S_1 \times \cdots \times S_n$,都有 $u_i(s_{-i};s_j) \geq u_i(s)$。
- 如果这对所有 $s$ 都成立,则输出 $s_j$ 是玩家 $i$ 的一个占优策略。
- 如果没有找到这样的纯策略,则不存在占优策略。
明显差的策略:被严格支配的策略
定义:如果存在另一个策略 $x_i^\prime$ 使得 $x_i^\prime \succ x_i$,那么称策略 $x_i \in X_i$ 是被严格支配的。如果存在 $x_i^\prime$,使得 $x_i^\prime \succeq x_i$,并且对某个 $x_{-i} \in X_i$,有 $U_i(x_{-i}; x_i^\prime) > U_i(x_{-i}; x_i)$,那么称 $x_i$ 是被弱支配的。
被弱支配策略并不一定那么“糟糕”。这取决于你认为其他人会怎么行动。特别地,可能存在这样的纳什均衡:每个人都在使用被弱支配策略。
\[\begin{bmatrix} (0, 0) & (0, 0) \\ (0, 0) & (1, 1)\end{bmatrix}\]例子:最后一行是否被严格支配?
\[\begin{bmatrix} 30 & 0 & 0 \\ 0 & 30 & 0 \\ 0 & 0 & 30 \\ 5 & 5 & 5 \end{bmatrix}\]无论如何选择,总是存在一个策略,其期望收益大于最后一行的收益。
共同知识与策略消除
定义:如果满足以下条件,那么事实 $P$ 是所有 $n$ 个玩家之间的共同知识:
- 对每个玩家 $i$,“玩家 $i$ 知道 $P$”:把这个事实称为 $P_{\langle i \rangle}$。
- 并且,递归地,对于 $k \geq 1$,对所有玩家 $i$,以及所有序列 $s = i_1 \cdots i_k\in \lbrace 1, \cdots, n\rbrace^k$,“玩家 $i$ 知道 $P_{\langle s \rangle}$”:把这个事实称为 $P_{\langle i, s \rangle}$。
RNK 假设:每个玩家的理性是所有玩家之间的共同知识。
迭代 SDS 消除算法
假设 RNK 成立,我们可以安全地执行下面的策略消除算法:
- ${\rm While}$(某个纯策略 $\pi_{i,j}$ 被严格支配)
- 从博弈中消除 $\pi_{i,j}$,
- 得到一个新的剩余博弈;