賽局理論與剪刀石頭布
納許均衡、混合策略、貝氏推論。用數學證明:最簡單的遊戲,其實安靜地複雜著。
在標準的零和剪刀石頭布賽局中,每一種純策略都能被另一種策略擊敗。唯一的納許均衡是以三分之一的機率獨立選擇每一種手勢。這個混合策略面對任何對手策略的期望報酬都是零;它並不保證短期比賽會打平,也不保證實際戰績剛好五五開。只有當對手以可被估計的方式偏離均衡,並且能在偏離改變之前加以利用時,優勢才有可能出現。
現在就來一局:你對戰電腦
挑一手出出看!
想和認識的人玩?

RPS:字面意義上的教科書範例
剪刀石頭布是一個有限、雙人、零和、同時行動的賽局。它小小的報酬矩陣,讓純策略、混合策略、最佳回應與均衡一目了然,而且不會把假設藏起來。
報酬矩陣(別緊張)
每一場 RPS 對局都能寫成一個 3x3 的方格。贏得 +1,輸得 -1,平手得 0:
| 石頭 | 布 | 剪刀 | |
|---|---|---|---|
| 石頭 | 0 | -1 | +1 |
| 布 | +1 | 0 | -1 |
| 剪刀 | -1 | +1 | 0 |
這是一個對稱賽局:雙方有相同的選項與相同的報酬。它沒有純策略的納許均衡,換成白話就是:只要你有模式,就有人能利用它。
納許均衡:數學上完美、但一點也不好玩的策略
納許在 1950 年提出的存在性結果證明,每一個有限賽局都至少有一個混合策略均衡。對於標準的 RPS 報酬矩陣,求解無差異條件會得到唯一的混合策略:以各三分之一的機率獨立選擇石頭、布和剪刀。
這個策略面對任何對手的混合策略,都保證期望報酬為零。在有限的比賽中,實際結果仍會有所變動,有時差異很大。「無法被利用」描述的是在所述報酬模型下的期望值;並不代表玩家永遠不會輸。
重複對局實驗的發現
人類 RPS 的結果取決於實驗情境。兩項常被引用的研究,量測的是不同的受試族群與實驗程序:
- Wang 等人(2014):360 名學生在隨機配對的六人小組中,進行了 300 回合有金錢誘因的對局。群體層級的循環,可以用一個依結果而定的留下與輪轉機率模型來解釋。
- Dyson 等人(2016):31 名大學生與均等隨機的電腦進行了 225 回合。輸掉與平手之後換手的比例增加,但贏了之後留下的傾向並不具統計顯著性。
這些研究為對手模型提供了候選特徵,而不是普遍適用的公式。受試族群、實驗程序與限制,請見心理學回顧。
貝氏推論:更新判讀的一種模型
貝氏推論提供了一種有紀律的方法,用來更新你對對手出拳分布的不確定性。它需要明確的先驗、概似模型與觀察資料;只是在一手之後改變想法,並不自動等於貝氏分析:
- 均衡基準:在沒有可靠證據時,使用獨立的均等隨機。
- 更新:隨著可比較的出拳逐漸累積,估計這些觀察在各個相互競爭的對手模型下出現的可能性,並讓不確定性保持可見。
單一回合通常只帶有很少的資訊,而短期比賽的雜訊很大。強烈的先驗主張或複雜的模型,若沒有在之後的出拳上檢驗,就可能造成錯誤的信心。
以迭代推理為例
玩家可以推想對手會如何回應某個預測。以下的階梯只是舉例說明,並非經過量測的選手分級系統:
- 基準:以均等機率獨立選擇。
- 一層回應:預測對手一項有紀錄的傾向,並選擇剋制它的手勢。
- 第二層:考慮對手是否預料到你的反制,並會因此調整。
- 停止規則:避免毫無根據的「他知道我知道」推理鏈;當觀察無法區分各個模型時,回到基準。
更深的推想並不自動就是更好的預測。請優先採用在之後、未見過的出拳上表現良好的最簡單模型。
演化賽局理論中的 RPS
Sinervo 與 Lively(1996)以非遞移、依頻率而定的關係,為側斑鬣蜥三種雄性型態的策略建立模型。六年的野外觀察顯示,各型態的頻率呈現振盪,與模型的預測一致。
生物學家稱之為 RPS 動態,因為每一種策略都對某一種有優勢、對另一種處於劣勢。這是關於型態之間天擇的數學類比,並不是動物在玩人類手勢遊戲的證據,也不代表每一種競爭系統都遵循同樣的循環。
這對你來說代表什麼
賽局理論指出了安全的基準,以及其背後確切的假設。針對特定對手的策略,只有在偏離基準的程度被估計得夠準確、持續存在,並且在不忽略失誤的前提下經過檢驗時,才能提高期望值。
