賽局理論與剪刀石頭布
納許均衡、混合策略、貝氏推論。用數學證明:最簡單的遊戲,其實安靜地複雜著。
以賽局理論來說,剪刀石頭布是一個對稱的零和賽局,而且沒有純策略解:不論你固定出哪一種手勢,對手永遠都能剋制它。它唯一的納許均衡是混合策略 - 以三分之一的機率隨機出每一種手勢;這個策略無法被利用,但也利用不了任何人,並保證長期結果剛好打平。因此,這個遊戲裡真正的優勢,全都來自對手偏離了那個均衡。

RPS:字面意義上的教科書範例
剪刀石頭布是一個有限、雙人、零和、同時進行的賽局。如果你修過賽局理論入門,這會是他們最早要你研究的東西之一,也是你最後才真正搞懂的東西之一。這個遊戲看起來很簡單,但它背後的數學可有話要說。
報酬矩陣(別緊張)
每一場 RPS 對局都能寫成一個 3x3 的方格。贏得 +1,輸得 -1,平手得 0:
| 石頭 | 布 | 剪刀 | |
|---|---|---|---|
| 石頭 | 0 | -1 | +1 |
| 布 | +1 | 0 | -1 |
| 剪刀 | -1 | +1 | 0 |
這是一個對稱賽局:雙方有相同的選項與相同的報酬。它沒有純策略的納許均衡,換成白話就是:只要你有模式,就有人能利用它。
納許均衡:數學上完美、但一點也不好玩的策略
約翰・納許(沒錯,就是《美麗境界》那位)證明了每一個有限賽局至少存在一個混合策略均衡。對 RPS 來說,這個納許均衡無聊得很美:三種手勢各以剛好三分之一的機率出。石頭 33.3%、布 33.3%、剪刀 33.3%。
如果你做得完美,就永遠沒有對手能占到你便宜。你的期望報酬永遠是零。你不會輸,但你也永遠贏不了。這是賽局理論版的「三餐都吃白燕麥粥」:最佳解,毫無樂趣。
為什麼人類做不到這件事
有趣的地方就在這裡。研究一再顯示,人類極度不擅長隨機。浙江大學 2014 年的一項研究,追蹤了 360 名學生各 300 回合的對局,結果發現:
- 玩家會重複贏過的那一手(贏了就留的偏誤)
- 玩家會改出「原本能贏過上一次落敗」的那一手(輸了就換)
- 人們出石頭的比例約為 36%,明顯高於預期的 33%
這些都不是隨機,而是模式。而模式正是競技 RPS 選手賴以維生的東西。完整拆解請見我們的心理學指南。
貝氏推論:一邊看,一邊學
高階選手會使用貝氏推論,也就是依據你已經出過的手,不斷更新對你下一手的預測。這和納許的思路根本不同:
- 納許說:假設你的對手是一台完全理性的機器人。那就隨機出拳吧。
- 貝氏說:你的對手是一個有情緒、有習慣的人。觀察他,然後利用他。
在單一回合裡,貝氏推論幫不上太多忙。但在三戰兩勝或更長的系列賽中(WRPSA 賽事的標準賽制),每一手都會給你新的資料。這就像打撲克,只不過你的破綻長在手指上。
思考的層級(可以很深)
賽局理論學者把競技 RPS 的策略分成幾個層級:
- 第 0 層:隨機出拳。你就是一枚長了大拇指的硬幣。
- 第 1 層:你根據對手剛剛出的那一手做反應。
- 第 2 層:你預測對手認為你會出什麼,然後反制它。
- 第 3 層:你預測他對「你的預測」的預測,然後大家都開始頭痛。
頂尖選手在第 3 層或更高的層級運作,同時還要判斷對手正在第幾層。這就像下棋,只是速度更快,手勢更多。
演化賽局理論中的 RPS
側斑鬣蜥(Uta stansburiana)有三種雄性型態,牠們的求偶策略正好構成一個 RPS 循環:具侵略性的橘喉雄性贏過藍喉,藍喉贏過黃喉,黃喉又贏過橘喉。這不是比喻,而是生物學家實際觀察並記錄下來的蜥蜴行為。
類似的動態也出現在細菌、珊瑚礁魚類與政治競爭之中。RPS 不只是一個遊戲,它是一種深植於生物競爭方式的基本模式。大自然比我們更早發明了它。
這對你來說代表什麼
懂賽局理論不會讓你在 RPS 中所向無敵,但它能幫你理解某些策略為什麼有效,以及該在什麼時候使出來。關鍵洞見是:當你完全讀不出對手時,納許均衡是你安全的退路;而利用「對手是個可預測的人類」這件事,才是你贏下錦標賽的方法。
