WRPSA. Всемирная ассоциация Камень Ножницы Бумага.

Теория игр и Камень Ножницы Бумага

Равновесие Нэша, смешанные стратегии, байесовское мышление. Математика, которая доказывает: простейшая игра втихую очень сложна.

Автор: , основатель WRPSA

В стандартной игре Камень Ножницы Бумага с нулевой суммой любую чистую стратегию можно обыграть другой. Единственное равновесие Нэша — выбирать каждый жест независимо с вероятностью 1/3. Такая смесь даёт нулевой ожидаемый выигрыш против любой стратегии соперника; она не гарантирует ничьей в коротком матче или точно равного фактического счёта. Преимущество возможно лишь тогда, когда соперник отклоняется от равновесия так, что это отклонение можно оценить и использовать до того, как оно изменится.

Сыграйте раунд прямо сейчас: вы против компьютера

Выбери ход и сыграй!

0В0П0Н

Хотите сыграть с кем-то знакомым?


RPS: учебниковый пример (буквально)

Камень Ножницы Бумага — это конечная игра двух игроков с нулевой суммой и одновременными ходами. Небольшая матрица выигрышей делает наглядными чистые стратегии, смешанные стратегии, наилучшие ответы и равновесие, не скрывая допущений.

Матрица выигрышей (без паники)

Любую встречу в RPS можно записать сеткой 3×3. Победа даёт +1, поражение −1, ничья 0:

КаменьБумагаНожницы
Камень0-1+1
Бумага+10-1
Ножницы-1+10

Это симметричная игра. У обоих игроков одинаковые опции и одинаковые выигрыши. Равновесия Нэша в чистых стратегиях здесь нет. Что на человеческом языке значит: если у тебя есть паттерн, его можно использовать против тебя.

Равновесие Нэша: математически идеальная стратегия, в которой нет ни капли веселья

Результат Нэша 1950 года о существовании показывает, что у каждой конечной игры есть по крайней мере одно равновесие в смешанных стратегиях. Для стандартной матрицы выигрышей RPS решение условий безразличия даёт единственную смесь: выбирать камень, бумагу и ножницы независимо с вероятностью 1/3 каждый.

Эта стратегия гарантирует нулевой ожидаемый выигрыш против любой смеси соперника. Фактические результаты за конечный матч всё равно колеблются, иногда сильно. «Неуязвимая» описывает ожидаемое значение в заданной модели выигрышей; это не значит, что игрок никогда не может проиграть.

Что обнаружили эксперименты с повторной игрой

Результаты RPS у людей зависят от условий эксперимента. Два часто цитируемых исследования изучали разные выборки и протоколы:

  • Wang et al. (2014): 360 студентов сыграли 300 раундов с денежным стимулом в группах по шесть человек со случайным распределением пар. Циклы на уровне популяции объяснялись моделью вероятностей повтора и ротации, зависящих от исхода.
  • Dyson et al. (2016): 31 студент сыграл 225 раундов против компьютера, выбиравшего равновероятно случайно. После поражений и ничьих переключения учащались, но повторение после побед не было статистически значимым.

Эти исследования дают возможные признаки для модели соперника, а не универсальный рецепт. Выборки, протоколы и ограничения описаны в обзоре психологии.

Байесовское рассуждение: модель для обновления прочтения соперника

Байесовский вывод даёт дисциплинированный способ обновлять неопределённость относительно распределения бросков соперника. Для него нужны явно заданное априорное распределение, модель правдоподобия и наблюдаемые данные; просто передумать после броска — это ещё не байесовский анализ:

  • Равновесная база: при отсутствии надёжных данных используй независимый равновероятный случайный выбор.
  • Обновление: по мере накопления сопоставимых бросков оценивай, насколько вероятны наблюдения при конкурирующих моделях соперника, и держи неопределённость на виду.

Один раунд обычно несёт мало информации, а короткие матчи сильно зашумлены. Сильное априорное утверждение или сложная модель могут создать ложную уверенность, если не проверять их на последующих бросках.

Итеративное рассуждение как пример

Игроки могут рассуждать о том, как соперник отреагирует на прогноз. Следующая лестница — иллюстрация, а не измеренная система ранжирования участников:

  • База: выбирай независимо и равновероятно.
  • Один ответ: предскажи задокументированную склонность соперника и выбери то, что её бьёт.
  • Второй порядок: подумай, ожидает ли соперник этот контрход и подстроится ли.
  • Правило остановки: избегай неподтверждённой цепочки «он знает, что я знаю»; возвращайся к базе, когда наблюдения не позволяют различить модели.

Более глубокие рассуждения не делают прогнозы автоматически лучше. Предпочитай простейшую модель, которая работает на последующих, ещё не виденных бросках.

RPS в эволюционной теории игр

Синерво и Лайвли (1996) смоделировали три стратегии морф самцов пятнистобоких ящериц с нетранзитивными, частотно-зависимыми отношениями. Шесть лет полевых наблюдений показали колебания частот морф, согласующиеся с предсказанием модели.

Биологи называют это динамикой RPS, потому что каждая стратегия имеет преимущество над одной и уступает другой. Это математическая аналогия отбора между морфами, а не доказательство того, что животные играют в человеческую игру на руках или что любая конкурентная система следует такому же циклу.

Что это значит для тебя

Теория игр определяет безопасную базовую стратегию и точные допущения, на которых она держится. Стратегия под конкретного соперника может повысить ожидаемый выигрыш, только если отклонение от этой базы оценено достаточно хорошо, сохраняется и проверено без игнорирования промахов.