博弈论模型
博弈论模型
双人标准式零和博弈 (two-player normal-form zero-sum games)
在这种博弈中,每个博弈参与者选择一个行动,并根据博弈参与者自己的行动和另一个博弈参与者的行动获得一定收益。此外,博弈参与者双方的收益总和为零。
博弈的纳什均衡(Nash equilibrium)是指这样一种策略,它们能够使每个博弈参与者的策略在给定其他博弈参与者策略的情况下是最优的。
在硬币配对博弈中,存在一个唯一的均衡策略,那就是,两个博弈参与者都以相同的概率在两个行动之间进行随机化。为了证明随机化是一种均衡,只需要证明,如果某个博弈参与者随机化,那么另一个博弈参与者选择任何行动都不可能比随机化更好。
随机化策略的最优性,对策略互动环境中的行为有很大的意义。例如,任何非随机性都可能会被对手利用,扑克等纸牌游戏就是如此。一个优秀的扑克玩家会随机地虚张声势。如果他一直虚张声势,对手就会了解这种策略,他就会落败。当然,对手的最优策略也是随机地虚张声势,这样就同样有可能赢或输。
最小化风险博弈(minimize risk game),一方为另一方排除最优策略被称为迭代消除被占优策略。
序贯博弈
在序贯博弈中,博弈参与者按照某个特定的顺序采取行动。由此,可以用一棵博弈树(game tree)来表示一个序贯博弈。博弈树由节点和边组成,每个节点对应于博弈参与者必须采取行动的时刻,该节点的每条边分别表示可以采取的某个行动。在博弈树最末尾的分支上,我们写下相应行动路径的收益。
在序贯博弈中,一种常见的细化准则是选择子博弈完美均衡(subgame perfect equilibrium)。可以运用逆向归纳法(backward induction)来求解子博弈均衡:从最末端的节点开始,并在每个节点处选择最优行动。然后沿着博弈树逆向倒推,假设每个博弈参与者会在给定另一个博弈参与者在后续节点上的行动时选择最优行动。
连续行动博弈
努力博弈
N个博弈参与者中的每一个人都要选择以货币形式表达努力水平,以赢得价值为M的奖励。一个博弈参与者赢得奖励的概率等于他的努力水平除以所有博弈参与者的总努力水平。如果令Ei表示博弈参与者i的努力水平,那么他的获胜概率由以下方程式表示:
$$
P(i \ wins)=\frac{E_{i}}{E_{1}+E_{2}+\dots+E_{N}},均衡努力水平为:E_{i}=\frac{M}{N}-\frac{M}{N^2}
$$
均衡努力水平的表达式揭示了很多重要的含义,正如我们所预料的那样,个人的努力水平会随着奖金的增多而增大。同样,在均衡状态下,总努力水平将会小于奖金的价值。在假设博弈参与者会进行最优化的情况下也会得到这些结果。博弈参与者应该付出一定努力以赢得奖励,但是不应该付出不合理的努力水平。
通过增加博弈参与者的数量,可以看到其对个人和总体努力的影响。根据模型,即便每个人的努力水平都下降了,总努力水平也会增加。
[!NOTE] 洞察
只有在产能过剩的情况下,学校才有动力提高质量,否则,择校会在学生中造成零和博弈。
识别问题
关于人们行为的数据经常揭示出人类行为的“聚类倾向”。有两个模型可以解释这种聚类:同伴效应模型(peer effect model)和分类模型(sorting model)。
同伴效应模型用博弈论来解释聚类现象,即一个人与他的朋友一起进行协调博弈。而在分类模型中,人们会“迁移”到与他们相似的其他人附近。一群优秀的学生之所以聚在一起,可能是因他们要协调完成某个共同行动(同伴效应),或者也可能是因为优秀的学生就喜欢找优秀的学生一起玩(分类效应)。如果只有数据快照(snapshot of data),那么这两者是无法区分的。
利用时间序列数据,我们就可以分辨出人们到底是在改变自己的行为(同伴效应),还是在更换他们的朋友(分类效应)。在许多情况下,这两个因素都有。