WRPSA. World Rock Paper Scissors Association.

Teoría de juegos y Piedra Papel o Tijera

Equilibrio de Nash, estrategias mixtas, razonamiento bayesiano. Las matemáticas que demuestran que el juego más simple es, en silencio, muy complicado.

Por , fundador de la WRPSA

En el juego estándar de suma cero de Piedra Papel o Tijera, toda estrategia pura puede ser vencida por otra. El único equilibrio de Nash consiste en elegir cada gesto de forma independiente con probabilidad 1/3. Esa mezcla da un pago esperado de cero contra cualquier estrategia del rival; no garantiza un empate en una partida corta ni un historial realizado exactamente igualado. Solo es posible obtener ventaja cuando un rival se aparta del equilibrio de una forma que pueda estimarse y explotarse antes de que cambie.

Juega una ronda ahora: tú contra la computadora

¡Elige una jugada!

0V0D0E

¿Prefieres jugar con alguien que conoces?


El PPT: el ejemplo de manual (literalmente)

Piedra Papel o Tijera es un juego finito, de dos jugadores, de suma cero y de movimientos simultáneos. Su pequeña matriz de pagos hace visibles las estrategias puras, las estrategias mixtas, las mejores respuestas y el equilibrio sin ocultar los supuestos.

La matriz de pagos (que no cunda el pánico)

Cualquier enfrentamiento de PPT puede escribirse como una cuadrícula de 3×3. Ganar suma +1, perder resta 1 y empatar vale 0:

PiedraPapelTijera
Piedra0-1+1
Papel+10-1
Tijera-1+10

Este es un juego simétrico: ambos jugadores tienen las mismas opciones y los mismos pagos. No existe ningún equilibrio de Nash en estrategias puras, que es una forma elegante de decir: si tienes un patrón, alguien puede aprovecharlo.

El equilibrio de Nash: la estrategia matemáticamente perfecta que no tiene ninguna gracia

El resultado de existencia de Nash de 1950 demuestra que todo juego finito tiene al menos un equilibrio en estrategias mixtas. Para la matriz de pagos estándar del PPT, resolver las condiciones de indiferencia da una mezcla única: elegir Piedra, Papel y Tijera de forma independiente con probabilidad 1/3 cada una.

Esta estrategia garantiza un pago esperado de cero contra cualquier mezcla rival. Los resultados realizados siguen variando, a veces mucho, en una partida finita. «Inexplotable» describe el valor esperado bajo el modelo de pagos indicado; no significa que un jugador nunca pueda perder.

Qué encontraron los experimentos de juego repetido

Los resultados del PPT con personas dependen del entorno experimental. Dos estudios citados a menudo midieron poblaciones y protocolos distintos:

  • Wang et al. (2014): 360 estudiantes jugaron 300 rondas con incentivos económicos en grupos de seis personas emparejadas al azar. El ciclo poblacional se explicó mediante un modelo de probabilidades de mantener y rotar condicionadas al resultado.
  • Dyson et al. (2016): 31 estudiantes universitarios jugaron 225 rondas contra un ordenador equiprobable y aleatorio. Los cambios aumentaron tras las derrotas y los empates, pero mantener la tirada tras las victorias no fue estadísticamente significativo.

Estos estudios aportan rasgos candidatos para un modelo del rival, no una receta universal. Consulta la revisión de psicología para las poblaciones, los protocolos y los límites.

Razonamiento bayesiano: un modelo para actualizar una lectura

La inferencia bayesiana ofrece una forma disciplinada de actualizar la incertidumbre sobre la distribución de tiradas de un rival. Requiere una distribución previa declarada, un modelo de verosimilitud y datos observados; limitarse a cambiar de opinión tras una tirada no es automáticamente un análisis bayesiano:

  • Referencia de equilibrio: sin evidencia fiable, usa la aleatorización independiente y equiprobable.
  • Actualización: a medida que se acumulan tiradas comparables, estima la probabilidad de las observaciones bajo modelos alternativos del rival y mantén visible la incertidumbre.

Una ronda suele aportar poca información, y las partidas cortas tienen mucho ruido. Una hipótesis previa fuerte o un modelo complejo pueden crear una falsa confianza si no se ponen a prueba en tiradas posteriores.

El razonamiento iterado como ejemplo

Los jugadores pueden razonar sobre cómo responde un rival a una predicción. La siguiente escala es una ilustración, no un sistema medido de clasificación de competidores:

  • Referencia: elegir de forma independiente con igual probabilidad.
  • Una respuesta: predecir una tendencia documentada del rival y elegir lo que la contrarresta.
  • Segundo orden: considerar si el rival espera esa respuesta y se ajustará.
  • Regla de parada: evitar una cadena sin respaldo de «saben que yo sé»; volver a la referencia cuando las observaciones no permitan distinguir entre los modelos.

Las historias más profundas no son automáticamente mejores predicciones. Prefiere el modelo más sencillo que funcione en tiradas posteriores no vistas.

El PPT en la teoría de juegos evolutiva

Sinervo y Lively (1996) modelizaron tres estrategias de morfos de machos del lagarto de manchas laterales con relaciones no transitivas y dependientes de la frecuencia. Seis años de observaciones de campo mostraron frecuencias de morfos oscilantes, coherentes con la predicción del modelo.

Los biólogos llaman a esto una dinámica de PPT porque cada estrategia tiene ventaja sobre una y desventaja frente a otra. Es una analogía matemática sobre la selección entre morfos, no una prueba de que los animales jueguen al juego de manos humano ni de que todo sistema competitivo siga el mismo ciclo.

Qué significa esto para ti

La teoría de juegos identifica la referencia segura y los supuestos exactos en que se basa. Una estrategia específica para un rival solo puede mejorar el valor esperado si una desviación de esa referencia se estima con suficiente precisión, persiste y se pone a prueba sin ignorar los fallos.