WRPSA. 세계 가위바위보 협회.

게임 이론과 가위바위보

내시 균형, 혼합 전략, 베이즈 추론. 가장 단순한 게임이 사실은 대단히 복잡하다는 것을 증명하는 수학.

글: , WRPSA 창립자

표준 제로섬 가위바위보에서는 모든 순수 전략이 다른 전략에 질 수 있습니다. 유일한 내시 균형은 각 손동작을 1/3 확률로 독립적으로 고르는 것입니다. 이 혼합 전략은 어떤 상대 전략에 대해서도 기대 보상 0을 주지만, 짧은 경기에서 무승부나 정확히 반반인 실제 전적을 보장하지는 않습니다. 우위는 상대가 균형에서 벗어나고, 그 이탈이 바뀌기 전에 추정하고 공략할 수 있을 때에만 가능합니다.

지금 한 판 해보세요: 나 vs 컴퓨터

낼 수를 골라 보세요!

0승0패0무

아는 사람과 하고 싶나요?


RPS: 말 그대로 교과서적 사례

가위바위보는 유한한 2인 제로섬 동시 행동 게임입니다. 보상 행렬이 작아서 가정을 숨기지 않고도 순수 전략, 혼합 전략, 최선 대응, 균형을 한눈에 볼 수 있습니다.

보수 행렬 (당황하지 마세요)

모든 RPS 대결은 3×3 표로 적을 수 있습니다. 승리는 +1, 패배는 -1, 무승부는 0입니다.

바위보가위
바위0-1+1
보+10-1
가위-1+10

이것은 대칭 게임입니다. 두 선수의 선택지도 보수도 똑같습니다. 순수 전략 내시 균형은 존재하지 않는데, 쉽게 말하면 이렇습니다. 당신에게 패턴이 있다면 누군가 그것을 이용할 수 있습니다.

내시 균형: 수학적으로 완벽하지만 하나도 재미없는 전략

내시의 1950년 존재 정리는 모든 유한 게임에 혼합 전략 균형이 적어도 하나 있음을 보여 줍니다. 표준 RPS 보상 행렬에서 무차별 조건을 풀면 유일한 혼합이 나옵니다. 바위, 보, 가위를 각각 1/3 확률로 독립적으로 고르는 것입니다.

이 전략은 어떤 상대 혼합에 대해서도 기대 보상 0을 보장합니다. 그래도 유한한 경기에서 실제 결과는 때로 크게 달라집니다. “공략당하지 않는다”는 말은 명시된 보상 모델에서의 기대값을 설명할 뿐, 절대 질 수 없다는 뜻이 아닙니다.

반복 플레이 실험이 발견한 것

인간 RPS 결과는 실험 환경에 따라 달라집니다. 자주 인용되는 두 연구는 서로 다른 대상 집단과 절차를 측정했습니다.

  • Wang 외(2014): 학생 360명이 무작위로 짝지어진 6인 그룹에서 금전적 보상이 걸린 300라운드를 플레이했습니다. 집단 수준의 순환은 결과에 따라 유지하거나 회전하는 확률 모델로 설명되었습니다.
  • Dyson 외(2016): 학부생 31명이 균등 무작위 컴퓨터를 상대로 225라운드를 플레이했습니다. 패배와 무승부 뒤에는 바꾸는 경향이 늘었지만, 승리 뒤 유지하는 경향은 통계적으로 유의하지 않았습니다.

이 연구들은 보편적인 비법이 아니라 상대 모델에 넣을 후보 특징을 제공합니다. 대상 집단, 절차, 한계는 심리학 리뷰를 참고하세요.

베이즈 추론: 읽기를 갱신하는 모델

베이즈 추론은 상대의 수 분포에 대한 불확실성을 체계적으로 갱신하는 방법을 제공합니다. 명시된 사전 분포, 가능도 모델, 관측 데이터가 필요합니다. 한 수를 본 뒤 생각을 바꾸는 것만으로 자동으로 베이즈 분석이 되지는 않습니다.

  • 균형 기준선: 믿을 만한 근거가 없으면 독립적인 균등 무작위를 사용하세요.
  • 갱신: 비슷한 조건의 수가 쌓이면, 경쟁하는 상대 모델들 아래에서 관측이 나타날 가능성을 추정하고 불확실성을 드러내 두세요.

한 라운드에는 보통 정보가 적고, 짧은 경기는 잡음이 많습니다. 강한 사전 주장이나 복잡한 모델은 이후의 수로 검증하지 않으면 거짓 확신을 낳을 수 있습니다.

예시로 보는 반복 추론

플레이어는 상대가 예측에 어떻게 반응할지 추론할 수 있습니다. 다음 단계는 예시일 뿐, 선수를 측정해 매기는 순위 체계가 아닙니다.

  • 기준선: 같은 확률로 독립적으로 고릅니다.
  • 1차 대응: 기록된 상대의 경향을 예측하고 그에 대응하는 수를 고릅니다.
  • 2차: 상대가 그 대응을 예상하고 조정할지 고려합니다.
  • 멈춤 규칙: 근거 없는 “상대는 내가 안다는 것을 안다” 식의 연쇄를 피하세요. 관측으로 모델을 구별할 수 없으면 기준선으로 돌아갑니다.

더 깊은 이야기가 자동으로 더 나은 예측이 되지는 않습니다. 보지 않은 이후의 수에서 성과를 내는 가장 단순한 모델을 택하세요.

진화 게임 이론 속의 RPS

Sinervo와 Lively(1996)는 수컷 옆얼룩도마뱀의 세 가지 형태 전략을 비이행적이고 빈도 의존적인 관계로 모델링했습니다. 6년간의 야외 관찰에서 형태 빈도가 모델의 예측과 일치하게 진동하는 것이 나타났습니다.

생물학자들은 각 전략이 하나에는 우위를, 다른 하나에는 열세를 가지기 때문에 이를 RPS 역학이라고 부릅니다. 이것은 형태 간 선택에 관한 수학적 비유이지, 동물이 사람의 손 게임을 한다거나 모든 경쟁 체계가 같은 순환을 따른다는 근거가 아닙니다.

이것이 당신에게 뜻하는 것

게임 이론은 안전한 기준선과 그 뒤에 있는 정확한 가정을 알려 줍니다. 특정 상대에 맞춘 전략은 기준선에서의 이탈을 충분히 잘 추정하고, 그 이탈이 지속되며, 빗나간 경우를 무시하지 않고 검증했을 때에만 기대값을 높일 수 있습니다.