WRPSA. World Rock Paper Scissors Association.
Entrar

Teoria dos jogos e Pedra Papel e Tesoura

Equilíbrio de Nash, estratégias mistas, raciocínio bayesiano. A matemática que prova que o jogo mais simples é, silenciosamente, muito complicado.

Por , fundador da WRPSA

No jogo padrão de soma zero de Pedra Papel e Tesoura, toda estratégia pura pode ser vencida por outra. O único equilíbrio de Nash é escolher cada gesto de forma independente com probabilidade 1/3. Essa mistura dá um ganho esperado de zero contra qualquer estratégia do oponente; ela não garante um empate numa partida curta nem um histórico realizado exatamente equilibrado. Uma vantagem só é possível quando o oponente se afasta do equilíbrio de uma forma que possa ser estimada e explorada antes que mude.

Jogue uma rodada agora: você contra o computador

Escolha uma jogada!

0V0D0E

Prefere jogar com alguém que você conhece?


PPT: o exemplo de livro-texto (literalmente)

Pedra Papel e Tesoura é um jogo finito, de dois jogadores, de soma zero e de movimentos simultâneos. Sua pequena matriz de ganhos torna visíveis estratégias puras, estratégias mistas, melhores respostas e equilíbrio sem esconder as premissas.

A matriz de payoff (não entre em pânico)

Todo confronto de PPT pode ser escrito como uma grade 3x3. Vitória vale +1, derrota vale -1, empate vale 0:

PedraPapelTesoura
Pedra0-1+1
Papel+10-1
Tesoura-1+10

Este é um jogo simétrico. Os dois jogadores têm as mesmas opções e os mesmos retornos. Não existe equilíbrio de Nash em estratégia pura, que é um jeito chique de dizer: se você tem um padrão, alguém pode explorá-lo.

Equilíbrio de Nash: a estratégia matematicamente perfeita que não tem graça nenhuma

O resultado de existência de Nash, de 1950, mostra que todo jogo finito tem pelo menos um equilíbrio em estratégias mistas. Para a matriz de ganhos padrão do PPT, resolver as condições de indiferença dá uma mistura única: escolher Pedra, Papel e Tesoura de forma independente com probabilidade 1/3 cada.

Essa estratégia garante ganho esperado zero contra qualquer mistura adversária. Os resultados realizados ainda variam, às vezes bastante, ao longo de uma partida finita. “Inexplorável” descreve o valor esperado sob o modelo de ganhos declarado; não significa que o jogador nunca possa perder.

O que os experimentos de jogo repetido encontraram

Os resultados humanos no PPT dependem do contexto experimental. Dois estudos frequentemente citados mediram populações e protocolos diferentes:

  • Wang et al. (2014): 360 estudantes jogaram 300 rodadas com incentivo monetário em grupos de seis pessoas pareadas aleatoriamente. O ciclo populacional foi explicado por um modelo de probabilidades de permanência e rotação condicionadas ao resultado.
  • Dyson et al. (2016): 31 estudantes de graduação jogaram 225 rodadas contra um computador aleatório equiprovável. A troca aumentou após derrotas e empates, mas a permanência após vitórias não foi estatisticamente significativa.

Esses estudos fornecem características candidatas para um modelo de oponente, não uma receita universal. Consulte a revisão de psicologia para populações, protocolos e limites.

Raciocínio bayesiano: um modelo para atualizar uma leitura

A inferência bayesiana oferece uma forma disciplinada de atualizar a incerteza sobre a distribuição de jogadas de um oponente. Ela exige uma priori declarada, um modelo de verossimilhança e dados observados; simplesmente mudar de ideia após uma jogada não é automaticamente uma análise bayesiana:

  • Base de equilíbrio: sem evidências confiáveis, use a aleatorização independente e equiprovável.
  • Atualização: à medida que jogadas comparáveis se acumulam, estime a probabilidade das observações sob modelos concorrentes do oponente e mantenha a incerteza visível.

Uma rodada costuma trazer pouca informação, e partidas curtas são ruidosas. Uma priori forte ou um modelo complexo pode gerar falsa confiança se não for testado em jogadas posteriores.

Raciocínio iterado como exemplo

Os jogadores podem raciocinar sobre como um oponente reage a uma previsão. A escada a seguir é uma ilustração, não um sistema medido de classificação de competidores:

  • Base: escolha de forma independente com probabilidade igual.
  • Uma resposta: preveja uma tendência documentada do oponente e escolha o que a vence.
  • Segunda ordem: considere se o oponente espera essa resposta e vai se ajustar.
  • Regra de parada: evite uma cadeia sem respaldo de “ele sabe que eu sei”; volte à base quando as observações não conseguirem distinguir os modelos.

Histórias mais profundas não são automaticamente previsões melhores. Prefira o modelo mais simples que funcione em jogadas posteriores ainda não vistas.

O RPS na teoria evolutiva dos jogos

Sinervo e Lively (1996) modelaram as estratégias de três morfos de machos do lagarto-de-mancha-lateral com relações não transitivas e dependentes da frequência. Seis anos de observações de campo mostraram frequências de morfos oscilantes, compatíveis com a previsão do modelo.

Os biólogos chamam isso de dinâmica de PPT porque cada estratégia tem vantagem sobre uma e desvantagem contra outra. É uma analogia matemática sobre seleção entre morfos, não evidência de que animais jogam o jogo de mãos humano nem de que todo sistema competitivo segue o mesmo ciclo.

O que isso significa para você

A teoria dos jogos identifica a base segura e as premissas exatas por trás dela. Uma estratégia específica para um oponente só pode melhorar o valor esperado se um desvio dessa base for estimado bem o suficiente, persistir e for testado sem ignorar os erros.