WRPSA。世界石头剪刀布协会。
登录

博弈论与石头剪刀布

纳什均衡、混合策略、贝叶斯推理。这些数学证明了:最简单的游戏,其实静悄悄地非常复杂。

作者:,WRPSA 创始人

在标准的零和石头剪刀布博弈中,每一种纯策略都能被另一种击败。唯一的纳什均衡是以 1/3 的概率独立选择每种手势。这一混合策略面对任何对手策略的期望收益都是零;它不保证短赛中打平,也不保证实际战绩恰好持平。只有当对手偏离均衡、且这种偏离能在改变之前被估计和利用时,才可能获得优势。

现在就来一局:你对战电脑

选一手出出看!

0 胜0 负0 平

想和认识的人玩?


RPS:教科书级的范例(字面意义上)

石头剪刀布是一个有限的、二人的、零和的、同时行动的博弈。它小巧的收益矩阵让纯策略、混合策略、最佳应对和均衡一目了然,而不会掩盖背后的假设。

收益矩阵(别慌)

每一次 RPS 对局都可以写成一个 3×3 的表格。赢记 +1,输记 −1,平记 0:

石头布剪刀
石头0-1+1
布+10-1
剪刀-1+10

这是一个对称博弈:双方的选项相同,收益也相同。它不存在纯策略纳什均衡。换成人话就是:只要你有规律,就会有人能利用它。

纳什均衡:数学上完美、玩起来毫无乐趣的策略

纳什 1950 年的存在性结果表明,每一个有限博弈都至少存在一个混合策略均衡。对于标准的 RPS 收益矩阵,求解无差异条件可得到唯一的混合策略:以各 1/3 的概率独立选择石头、布和剪刀。

这一策略保证面对任何对手的混合策略时期望收益为零。在有限的比赛中,实际结果仍会波动,有时波动很大。“无法被利用”描述的是在既定收益模型下的期望值;它并不意味着选手永远不会输。

重复对局实验发现了什么

人类 RPS 的结果取决于实验设置。两项常被引用的研究测量的是不同的群体和实验方案:

  • Wang 等人(2014):360 名学生在随机配对的六人小组中进行了 300 轮有金钱激励的对局。群体层面的循环可以用一个基于结果条件的保持和轮转概率模型来解释。
  • Dyson 等人(2016):31 名本科生与一台等概率随机出手的计算机对局 225 轮。输和平局之后换手的情况增加,但赢了之后保持不变的倾向在统计上并不显著。

这些研究为对手模型提供了候选特征,而不是一套普遍适用的方法。对象群体、实验方案和局限请参阅心理学综述。

贝叶斯推理:更新判读的一种模型

贝叶斯推断提供了一种有章法的方式,来更新你对对手出手分布的不确定性。它需要一个明确的先验、一个似然模型和观察数据;仅仅在一手之后改变想法,并不自动等于贝叶斯分析:

  • 均衡基准:在没有可靠证据时,采用等概率的独立随机出手。
  • 更新:随着可比较的出手不断积累,估计在各个竞争性的对手模型下观察到这些结果的可能性,并让不确定性保持可见。

单独一回合通常携带的信息很少,短赛的噪声也很大。强烈的先验主张或复杂的模型可能造成虚假的信心,除非在之后的出手上加以检验。

以迭代推理为例

选手可以推理对手会如何回应一个预测。下面的阶梯只是示意,而不是经过测量的选手排名体系:

  • 基准:以相等概率独立选择。
  • 一层应对:预测一个有记录的对手倾向,并选择克制它的手势。
  • 二阶:考虑对手是否预料到了这个克制并会作出调整。
  • 停止规则:避免缺乏依据的“他知道我知道”式推理链;当观察无法区分各个模型时,回到基准。

更深的推理并不自动等于更好的预测。优先选择在之后未见过的出手上表现良好的最简单模型。

演化博弈论中的 RPS

Sinervo 和 Lively(1996)对侧斑蜥蜴的三种雄性形态策略进行了建模,这些策略之间存在非传递的、依赖频率的关系。六年的野外观察显示,各形态频率的振荡与模型的预测一致。

生物学家称之为 RPS 动态,因为每种策略都对其中一种占优、对另一种处于劣势。这是关于形态间选择的数学类比,并不能证明动物在玩人类的手势游戏,也不能证明每个竞争系统都遵循同样的循环。

这对你意味着什么

博弈论指出了安全的基准以及它背后的确切假设。只有当对基准的偏离被估计得足够好、持续存在,并且在检验时没有忽略落空的情况下,针对特定对手的策略才能提高期望收益。