Lecture 16 自私网络路由、拥塞博弈与无政府代价
作为博弈的(自私)网络路由
拥塞博弈
一个拥塞博弈
\[G = (N, R, (Z_i)_{i\in N}, (d_r)_{r\in R})\]包含:
- 一个有限玩家集合 $N = \lbrace 1, \cdots, n\rbrace $。
- 一个有限资源集合 $R = \lbrace 1, \cdots, m\rbrace $,(资源可以是边)。
- 对每个玩家 $i$,有一个可采纳策略集合 $Z_i \subseteq 2^{R}$。因此,一个纯策略 $s_i\in Z_i$ 是一组资源(边)。
- 每个资源 $r \in R$ 都有一个成本函数:$d_r: \mathbb{N} \to \mathbb{Z}$。直观地说,如果同时有 $j$ 个智能体使用资源 $r$,那么 $d_r(j)$ 就是使用资源 $r$ 的成本。
- 对于一个纯策略组合 $s = (s_1, \cdots, s_n) \in Z_1 \times \cdots \times Z_n$,资源 $r$ 上的拥塞(有多少个智能体)为:$n_r(s) = \lvert\lbrace i\mid r\in s_i\rbrace \rvert$。也就是说,如果智能体 $i$ 拥有资源 $r$,那么 $n_r(s_i) = \lvert \lbrace i\rbrace \rvert = 1$。
-
在策略组合 $s = (s_1, \cdots, s_n)$ 下,玩家 $i$ 的总成本为
\[C_i(s) \doteq \sum_{r\in s_i}d_r(n_r(s))\]每个玩家 $i$ 都想要最小化自己的(期望)成本。
最优反应动态与纯纳什均衡
在一个拥塞博弈 $G$ 中,对于任意纯策略组合 \(s = (s_1, \cdots, s_n)\),假设某个玩家 $i$ 有一个更好的替代策略 \(s^\prime_i\in Z_i\),使得 \(C_i(s_{-i}; s_i^\prime) < C_i(s)\)。
玩家 $i$ 可以(单方面地)从 $s_i$ 切换到 $s_i^\prime$。这使我们从当前策略组合出发,执行一系列这样的(严格)改进步。
定理:([Rosenthal’73])在任意拥塞博弈中,每个严格改进步序列都必然是有限的,并且终止于一个纯 NE。
因此,特别地,每个拥塞博弈都有一个纯策略 NE。
证明:考虑下面这个势函数(来自势能的直觉):
\[\varphi(s) \doteq \sum_{r\in R}\sum_{j=1}^{n_r(s)}d_r(j)\]这个函数计算了博弈中玩家选择的总成本或收益。它有时被称为社会成本函数。令 $s^\prime := (s_{-i}; s_i^\prime)$。
命题:$\varphi(s) - \varphi(s^\prime) = C_i(s) - C_i(s^\prime)$。
对于 $i^\prime\in \lbrace 1, \cdots, n \rbrace$,定义
\[n_r^{(i^\prime)}(s) = \lvert \lbrace i \mid r\in s_i \wedge i \in \lbrace 1, \cdots, i^\prime\rbrace \rbrace \rvert\]通过交换式 $(1)$ 中的求和顺序,得到
\[\varphi(s) = \sum_{i=1}^n\sum_{r\in s_i} d_r(n^{(i)}_r(s))\]现在注意到 $n^{(n)}_r(s) = n_r(s)$。因此
\[\sum_{r\in s_n}d_r(n^{(n)}_r(s)) = \sum_{r\in s_n}d_r(n_r(s)) = C_n(s)\]所以,如果玩家 $n$ 从策略 $s_n$ 切换到策略 $s_n^\prime$,使我们从策略组合 $s$ 转到 $s^\prime$,那么 $\varphi(s) - \varphi(s^\prime) = C_i(s) - C_i(s^\prime)$。
$n_r(s)$ 是资源 $r$ 上的总拥塞。公式 $\sum_{j=1}^{n_r(s)}$ 不一定有很直观的解释。这个构造出来的公式表示一种势的概念,和重力势能非常相似。
该命题说明 $\varphi$ 是所谓的精确势。也就是说,如果单个玩家把自己的延迟降低了 $\Delta > 0$,那么 $\varphi$ 也恰好降低同样的量。
继续证明:注意,每个严格改进步都会使势函数 $\varphi(s)$ 的值至少减少 $1$(成本 $d_r(s)$ 都是整数)。此外,纯策略 $s$ 只有有限多个,所以存在有限整数:
$a = \min_s\varphi(s)$ 和 $b = \max_s\varphi(s)$。因此,每个改进序列都是有限的。
最后,注意任何不能被进一步改进的改进序列的最后一个策略组合 $s$,根据定义就是一个纯纳什均衡。
一个流网络博弈与 Braess 悖论
1. 流网络
graph LR
s -- 1 --> t
s -- x --> t
2. Braess 悖论
graph LR
s -- 1 --> b -- x --> t
s -- x --> a -- 1 --> t
社会福利与无政府代价
拍卖中的无政府代价:无政府代价(Price of Anarchy, PoA)衡量一个系统的社会福利如何由于其智能体的自私行为而退化。
回忆一下,在策略式博弈 $\Gamma$ 中,在某个混合策略组合 $x\in X$ 下的“功利主义社会福利” ${\rm welfare}(x)$ 定义为 ${\rm welfare(x)}:= \sum_{i=1}^n U_i(x)$。对于一个博弈 $\Gamma$,令 ${\rm NE}(\Gamma)$ 为 $\Gamma$ 的 NE 集合。
对于下一个定义,假设对所有 $x\in X$ 都有 ${\rm welfare}(x) > 0$。
最大化社会福利的一种方法是设计一个真实机制。在这样的机制中,每个智能体都有激励向物品报告自己的真实估值。然后,拍卖者可以计算并实施一个最大化总价值的分配。这样的机制的一个例子是 VCG 拍卖。
“无政府代价”的一个版本可以定义为最优社会福利与最差均衡中的社会福利之间的比值(社会福利会退化到哪里):([Koutsoupias-Papadimitriou98])
\[{\rm PoA}(\Gamma) := \frac{\max_{x\in X}{\rm welfare}(x)}{\min_{x\in {\rm NE}(\Gamma)}{\rm welfare}(x)}\]注:这个比值 $\geq 1$,并且越大表示“越糟”。
纯无政府代价
在某些设置中,例如拥塞博弈中,我们知道纯均衡存在,因此比较整体最佳结果和最差纯 NE 结果有时更合理。
令 pure-${\rm NE}(\Gamma)$ 表示博弈 $\Gamma$ 中的纯 NE 集合。对于我们知道 pure-${\rm NE}(\Gamma)$ 非空的设置(例如拥塞博弈),我们把“纯无政府代价”定义为:
\[\text{pure-PoA}(\Gamma) := \frac{\max_{s\in S}{\rm welfare}(s)}{\min_{s\in\text{pure-}{\rm NE}(\Gamma)}{\rm welfare}(s)}\]流网络博弈中的无政府代价
- 对于流 $f$,令 ${\rm welfare}(f):= 1/(\text{average s-t-delay})$。
- 在 Braess 悖论中,无政府代价为 $\frac{4}{3}$:通过参与 NE,平均延迟为 2;但如果在上方路径和下方路径之间各走一半,平均延迟为 $\frac{3}{2}$(这也是最优的)。
- [Roughgarden-Tardos’00] 证明,在更一般的流网络设置中(其中可以有多个源点-终点对 $(s_j, t_j)$),只要标记边拥塞的函数是 $x$ 的线性函数,最坏情况下的无政府代价就是 $\frac{4}{3}$。
回到原子网络拥塞博弈
所谓“原子”网络拥塞博弈,我们只是指具有有限数量玩家的标准网络拥塞博弈,其中每个玩家的目标都是最小化自己的成本。(相比之下,在非原子网络流博弈中,均衡下的平均成本是唯一确定的;但在原子网络拥塞博弈中并非如此。)
定理:[Christodoulou-Koutsoupias’2005]。对于具有线性效用的原子网络拥塞博弈中的纯 NE,其纯无政府代价为 $\frac{5}{2}$。