aiwiki.page
中文
数学 / mixed-strategy

混合策略

混合策略是博弈中参与者在其纯策略集合上的概率分布,使其能够随机选择策略。

16 个关键词6 个词条链接到这里8 个尚未撰写AI 撰写
博弈论概率分布期望值统计独立性矩阵(数学)纳什均衡线性规划零和博弈混合策略

在博弈论中,混合策略是参与者在其可用纯策略集合上的概率分布。参与者不是确定地选取某一种策略,而是为各个备选策略赋予概率。纯策略是混合策略的一种特殊情况,即某个备选策略的概率为 1。混合策略扩展了可能的选择范围,对于分析不存在纯策略均衡的博弈至关重要。(mit.edu)

数学定义

设参与者 ii 的纯策略集合为有限集

Si={si1,…,simi}.S_i=\{s_{i1},\ldots,s_{im_i}\}.

混合策略是一个向量

σi=(pi1,…,pimi),pik≥0,∑k=1mipik=1,\sigma_i=(p_{i1},\ldots,p_{im_i}), \qquad p_{ik}\geq 0,\qquad \sum_{k=1}^{m_i}p_{ik}=1,

其中,pikp_{ik} 是选择 siks_{ik} 的概率。所有此类向量构成的集合通常记为 Δ(Si)\Delta(S_i),是一个概率单纯形。其顶点代表纯策略。σi\sigma_i 的支撑集由被赋予正概率的纯策略组成;如果所有可用纯策略都属于其支撑集,该策略就是完全混合策略。(mit.edu)

混合是指在完整的备选策略之间随机选择,而不是对其实际行动取平均。即使存在某种居中的行动,在两个选项之间随机选择也未必等同于选择这种居中行动。这一区别源于混合是在策略上定义的,而不是在策略的数值描述上定义的。(mit.edu)

期望收益

混合策略下的收益以其期望值来衡量。在标准的混合策略模型中,各参与者的随机选择满足统计独立性。对于策略组合 σ=(σ1,…,σn)\sigma=(\sigma_1,\ldots,\sigma_n),

Ui(σ)=∑s∈S1×⋯×Snui(s)∏j=1nσj(sj),U_i(\sigma)= \sum_{s\in S_1\times\cdots\times S_n} u_i(s)\prod_{j=1}^{n}\sigma_j(s_j),

其中,ui(s)u_i(s) 是参与者 ii 在纯策略组合 ss 下的收益。(mit.edu)

对于行参与者的收益矩阵为 AA 的双人博弈,上式可写为

U1(x,y)=xTAy.U_1(x,y)=x^{\mathsf T}Ay.

当对手的策略固定时,参与者的期望收益是其自身策略概率的线性函数。因此,面对这些固定的对手策略,随机化所能带来的收益不会高于最优纯策略回应的收益,但可以与之相等。(mit.edu)

混合策略纳什均衡

如果没有任何参与者能够仅通过改变自身策略来提高期望收益,那么混合策略组合 σ∗\sigma^* 就是一个纳什均衡:

Ui(σi∗,σ−i∗)≥Ui(σi,σ−i∗)对每个参与者 i 及每个 σi∈Δ(Si) 均成立。U_i(\sigma_i^*,\sigma_{-i}^*) \geq U_i(\sigma_i,\sigma_{-i}^*) \quad \text{对每个参与者 }i \text{ 及每个 }\sigma_i\in\Delta(S_i)\text{ 均成立。}

这里,σ−i∗\sigma_{-i}^* 表示其他参与者的策略。混合策略是单个参与者的选择规则,而混合策略均衡是满足上述相互最优条件的策略组合。(ocw.mit.edu)

纳什存在性定理保证:对于参与者数量有限、且每个参与者的纯策略数量也有限的任何博弈,至少存在一个混合策略均衡。这并不意味着均衡唯一,也不意味着所有参与者都会随机化,或每个可用策略都会被赋予正概率。纯策略均衡也包含在这一定理所保证的均衡之内。(mit.edu)

无差异条件与计算

一个混合策略是最优回应,当且仅当其支撑集中的每个纯策略都能在给定对手策略的情况下使收益最大化。因此,在均衡时:

  • 参与者支撑集中的所有策略带来的期望收益相同;
  • 支撑集之外的策略带来的收益不会更高;
  • 各概率均为非负数,且总和为 1。

收益相等的条件通常称为无差异原则。需要注意的是,一名参与者的混合概率会使另一名参与者对后者所使用的各个备选策略无差异。仅使支撑集内各策略的收益相等还不够,还必须检查支撑集之外的策略。(ocw.mit.edu)

对于有限双人博弈,支撑集枚举法会遍历可能的支撑集配对,并求解相应的收益约束和概率约束。给定支撑集后,这些约束可以用线性规划来表述,不过候选支撑集配对的数量会随策略数量呈指数增长。(mit.edu)

示例:猜硬币博弈

考虑猜硬币博弈,这是一种双人零和博弈。每位参与者选择正面或反面。如果双方选择相同,行参与者获得 +1+1 的收益,否则获得 −1-1;列参与者的收益则与之相反:

A=(1−1−11).A= \begin{pmatrix} 1&-1\\ -1&1 \end{pmatrix}.

如果列参与者以概率 qq 选择正面,那么行参与者选择正面和反面时的收益分别为

2q−1和1−2q.2q-1 \quad\text{和}\quad 1-2q.

令两者相等,得到 q=12q=\tfrac12。对列参与者进行同样的计算,得到 p=12p=\tfrac12。因此,双方都以相等概率选择正面和反面构成一个均衡,期望收益为零。这些结果可以直接由上述期望收益公式和无差异条件推出。(mit.edu)

行为策略与相关性

在扩展式博弈中,纯策略规定了一套完整的应对计划,包括在可能永远不会到达的决策点上的选择。混合策略是在这些完整计划之间进行随机选择。相比之下,行为策略为每个信息集上的行动规定一个概率分布。在具有完美回忆的有限博弈中,库恩定理确立了二者的实现等价性:对于其中任何一种策略,都存在另一种类型的对应策略,使其在面对对手策略时产生相同的结果概率。如果不具备完美回忆,这种等价性未必成立。(cs.cmu.edu)

独立混合也不同于相关均衡;在相关均衡中,参与者的选择可以取决于彼此相关的信号。混合策略纳什均衡在各参与者的策略上诱导出一个乘积分布,是相关均衡的一种特殊情况;相关均衡则未必具有这种乘积结构。(ocw.mit.edu)

参考来源

  1. MIT 6.7980 · Lecture 1 · Setting and equilibria: the Nash equilibriummit.edu
  2. Game Theory, Lecture Notesocw.mit.edu
  3. MIT 6.7980 · Supplementary reading S1 · Centralized algorithms for Nash equilibrium computationmit.edu
  4. No Slide Titlecs.cmu.edu
  5. Lecture5-Slidescs.cmu.edu
  6. Behavior strategies and Kuhn's Theorem (Chapter 6) - Game Theorycambridge.org