博弈论与石头剪刀布
纳什均衡、混合策略、贝叶斯推理。这些数学证明了:最简单的游戏,其实静悄悄地非常复杂。
用博弈论的话说,石头剪刀布是一个对称的零和博弈,且没有纯策略解:无论你固定出哪一种手势,对手总能克制它。它唯一的纳什均衡是混合策略,也就是以 1/3 的概率随机出每一种手势;这个策略无法被利用,但同样无法利用任何人,长期结果保证正好是不输不赢。因此,这个游戏中一切真实的优势,都来自对手偏离了那个均衡。

RPS:教科书级的范例(字面意义上)
石头剪刀布是一个有限的、二人的、零和的、同时行动的博弈。如果你上过博弈论入门课,这会是他们最早让你研究的东西之一,也是你最后才真正弄懂的东西之一。游戏看着简单,但它背后的数学有话要说。
收益矩阵(别慌)
每一次 RPS 对局都可以写成一个 3×3 的表格。赢记 +1,输记 −1,平记 0:
| 石头 | 布 | 剪刀 | |
|---|---|---|---|
| 石头 | 0 | -1 | +1 |
| 布 | +1 | 0 | -1 |
| 剪刀 | -1 | +1 | 0 |
这是一个对称博弈:双方的选项相同,收益也相同。它不存在纯策略纳什均衡——换成人话就是:只要你有规律,就会有人能利用它。
纳什均衡:数学上完美、玩起来毫无乐趣的策略
约翰·纳什(对,就是《美丽心灵》里那位)证明了每一个有限博弈都至少存在一个混合策略均衡。对 RPS 来说,纳什均衡无聊得很漂亮:每种手势都以正好 1/3 的概率出。石头 33.3%,布 33.3%,剪刀 33.3%。
如果你做得完美,任何对手都永远无法在你身上占到便宜,而你的期望收益也永远是零。你永远不会输,也永远不会赢。这相当于博弈论版的“每一餐都吃白燕麦粥”。最优,但毫无快乐。
人类为什么做不到这一点
有意思的地方来了。研究一再表明:人类极其不擅长随机。浙江大学 2014 年的一项研究追踪了 360 名学生、每人 300 轮对局,结果发现:
- 赢了的那一手,人们会倾向于重复(赢了不变偏差)
- 输了之后,人们会改出那个本可以赢下上一局的手势(输了就换)
- 人们出石头的比例约为 36%,明显高于理论上的 33%
这些都不是随机,而是规律。而规律正是竞技 RPS 选手赖以为生的东西。完整拆解见我们的心理学指南。
贝叶斯推理:边看边学
高水平选手会使用贝叶斯推断,也就是根据你已经出过什么,不断更新对你下一手的预测。这和纳什的思路有本质区别:
- 纳什说:假设你的对手是一台完全理性的机器人。随机出手就好。
- 贝叶斯说:你的对手是一个有情绪、有习惯的人。观察他,然后利用他。
在单独一轮里,贝叶斯推理帮不上多少忙。但在三局两胜或更长的系列赛中(WRPSA 赛事的标准形式),每一手都会给你新的数据。这就像打扑克,只不过你的破绽长在手指上。
思维的层级(能挖很深)
博弈论学者把竞技 RPS 的策略分成几个层级:
- 第 0 层:随机出手。你就是一枚长了大拇指的硬币。
- 第 1 层:你根据对手刚刚出的那一手做反应。
- 第 2 层:你预判对手认为你会出什么,然后反制它。
- 第 3 层:你预判他对你的预判的预判——到这儿所有人都开始头疼了。
顶尖选手在第 3 层甚至更高的层级上运作,同时还要判断对手正打在哪一层。这就像下棋,只是更快,而且手势更多。
演化博弈论中的 RPS
侧斑鬣蜥(Uta stansburiana)有三种雄性形态,它们的交配策略正好构成一个 RPS 循环:好斗的橙喉雄性压制蓝喉,蓝喉压制黄喉,黄喉又压制橙喉。这不是比喻,而是生物学家实地记录下来的真实蜥蜴行为。
类似的动态也出现在细菌、珊瑚礁鱼类和政治竞争之中。RPS 不只是一个游戏,它是编织在生物竞争方式里的一种基本模式。大自然比我们先发明了它。
这对你意味着什么
懂博弈论不会让你在 RPS 里战无不胜,但它能帮你理解某些策略为什么有效,以及该在什么时候用。关键在于:当你读不出对手时,纳什均衡是安全的兜底;而利用“对手终究是个可预测的人”这件事,才是你赢下比赛的方式。
