WRPSA。世界剪刀石頭布協會。
登入

賽局理論與剪刀石頭布

納許均衡、混合策略、貝氏推論。用數學證明:最簡單的遊戲,其實安靜地複雜著。

作者:,WRPSA 創辦人

在標準的零和剪刀石頭布賽局中,每一種純策略都能被另一種策略擊敗。唯一的納許均衡是以三分之一的機率獨立選擇每一種手勢。這個混合策略面對任何對手策略的期望報酬都是零;它並不保證短期比賽會打平,也不保證實際戰績剛好五五開。只有當對手以可被估計的方式偏離均衡,並且能在偏離改變之前加以利用時,優勢才有可能出現。

現在就來一局:你對戰電腦

挑一手出出看!

0 勝0 敗0 和

想和認識的人玩?


RPS:字面意義上的教科書範例

剪刀石頭布是一個有限、雙人、零和、同時行動的賽局。它小小的報酬矩陣,讓純策略、混合策略、最佳回應與均衡一目了然,而且不會把假設藏起來。

報酬矩陣(別緊張)

每一場 RPS 對局都能寫成一個 3x3 的方格。贏得 +1,輸得 -1,平手得 0:

石頭布剪刀
石頭0-1+1
布+10-1
剪刀-1+10

這是一個對稱賽局:雙方有相同的選項與相同的報酬。它沒有純策略的納許均衡,換成白話就是:只要你有模式,就有人能利用它。

納許均衡:數學上完美、但一點也不好玩的策略

納許在 1950 年提出的存在性結果證明,每一個有限賽局都至少有一個混合策略均衡。對於標準的 RPS 報酬矩陣,求解無差異條件會得到唯一的混合策略:以各三分之一的機率獨立選擇石頭、布和剪刀。

這個策略面對任何對手的混合策略,都保證期望報酬為零。在有限的比賽中,實際結果仍會有所變動,有時差異很大。「無法被利用」描述的是在所述報酬模型下的期望值;並不代表玩家永遠不會輸。

重複對局實驗的發現

人類 RPS 的結果取決於實驗情境。兩項常被引用的研究,量測的是不同的受試族群與實驗程序:

  • Wang 等人(2014):360 名學生在隨機配對的六人小組中,進行了 300 回合有金錢誘因的對局。群體層級的循環,可以用一個依結果而定的留下與輪轉機率模型來解釋。
  • Dyson 等人(2016):31 名大學生與均等隨機的電腦進行了 225 回合。輸掉與平手之後換手的比例增加,但贏了之後留下的傾向並不具統計顯著性。

這些研究為對手模型提供了候選特徵,而不是普遍適用的公式。受試族群、實驗程序與限制,請見心理學回顧。

貝氏推論:更新判讀的一種模型

貝氏推論提供了一種有紀律的方法,用來更新你對對手出拳分布的不確定性。它需要明確的先驗、概似模型與觀察資料;只是在一手之後改變想法,並不自動等於貝氏分析:

  • 均衡基準:在沒有可靠證據時,使用獨立的均等隨機。
  • 更新:隨著可比較的出拳逐漸累積,估計這些觀察在各個相互競爭的對手模型下出現的可能性,並讓不確定性保持可見。

單一回合通常只帶有很少的資訊,而短期比賽的雜訊很大。強烈的先驗主張或複雜的模型,若沒有在之後的出拳上檢驗,就可能造成錯誤的信心。

以迭代推理為例

玩家可以推想對手會如何回應某個預測。以下的階梯只是舉例說明,並非經過量測的選手分級系統:

  • 基準:以均等機率獨立選擇。
  • 一層回應:預測對手一項有紀錄的傾向,並選擇剋制它的手勢。
  • 第二層:考慮對手是否預料到你的反制,並會因此調整。
  • 停止規則:避免毫無根據的「他知道我知道」推理鏈;當觀察無法區分各個模型時,回到基準。

更深的推想並不自動就是更好的預測。請優先採用在之後、未見過的出拳上表現良好的最簡單模型。

演化賽局理論中的 RPS

Sinervo 與 Lively(1996)以非遞移、依頻率而定的關係,為側斑鬣蜥三種雄性型態的策略建立模型。六年的野外觀察顯示,各型態的頻率呈現振盪,與模型的預測一致。

生物學家稱之為 RPS 動態,因為每一種策略都對某一種有優勢、對另一種處於劣勢。這是關於型態之間天擇的數學類比,並不是動物在玩人類手勢遊戲的證據,也不代表每一種競爭系統都遵循同樣的循環。

這對你來說代表什麼

賽局理論指出了安全的基準,以及其背後確切的假設。針對特定對手的策略,只有在偏離基準的程度被估計得夠準確、持續存在,並且在不忽略失誤的前提下經過檢驗時,才能提高期望值。