游戏或许是被抽去了艰难部分的人生,但它们提供了一种研究人们为何做出特定选择的方法。传统博弈通常在静态背景下进行:每种结果对应的奖励是固定不变的。这限制了它们在解释真实行为方面的意义,因为在现实生活中,策略选择所带来的奖励和后果始终在变化。如今,研究人员利用一个数学模型研究了一系列包含演化策略和随机变化收益的博弈。
一点历史背景
或许最著名的博弈论实验就是囚徒困境。在囚徒困境中,一对盗贼被捕后分别接受警方审讯。如果两人都保持沉默,他们将因较轻的罪行受到惩罚。如果一名囚犯选择认罪(背叛),那么这名囚犯将被释放,而另一人将获得更重的刑罚。如果两人都选择认罪,他们都会获得介于两者之间的惩罚。
游戏的组织者可以为合作和背叛设定不同的初始奖励,以此探索最优策略如何随奖励和风险变化,而参与者可以通过在多轮博弈中调整策略来找出应对方法。根据保持沉默(合作)的奖励与背叛之间的平衡关系,游戏最终会稳定在人人互相背叛的状态。在这种简单情境下,所有人都是输家。
类似的动态也可以在斗鸡博弈、石头剪刀布等游戏中找到。策略的演化可能导致稳定的群体状态、双稳态群体(群体在两种稳定策略之间来回切换),或者极限循环,即群体在多种策略之间持续转换。
博弈在进行过程中发生变化,这方面也有丰富的研究历史。通常,这些变化是在博弈内部发生的。例如,可以设定可用奖励总量的上限,这样随着轮数的增加,策略的演化就要考虑到资源日益受限的情况。换句话说,此前的大多数研究关注的是玩家当前一轮的行为如何改变下一轮可用的资源或奖励这类情况。
你的影响力是有限的
然而在现实生活中,我们受到许多不受自己控制的外部因素驱动。兔子无法控制淹没其洞穴的雨水,也无法控制杀死其食物的旱灾。每一轮博弈都会发生变化,因为每种策略的风险和收益会随时间改变。研究人员意识到,将这些动态因素纳入数学模型可能会揭示出新的行为模式。事实证明他们的判断是对的。
前文所述的囚徒困境只有一个稳定点(人人皆输)。模型很快会收敛到这一点,几轮之后所有玩家都会采用相同的策略。但这项新研究发现,如果奖励随时间发生变化(即使变化幅度很小),模型中就会出现第二个稳定点,使合作者与背叛者能够共存。如果变化幅度进一步加大,背叛者所对应的稳定点就会变得不稳定,这意味着最终只剩下合作者。
在斗鸡博弈中,模型的结果则更令人不安:如果奖励没有变化,稳定点是人人都选择让步,大家都能存活。只需加入一点点变化,就会出现不让步的群体。再加入更多的随机性,就会出现在存活与冲突之间反复切换的双稳态。(考虑到斗鸡博弈本质上就是冷战时期的策略写照,我更加惊讶于我们所有人竟然都活了下来,去面对下一个生存挑战。)
对于石头剪刀布,出现的动态则更加复杂。就稳定点和不稳定点而言,常规的石头剪刀布游戏没有任何稳定点——策略永远不会稳定在人人都选石头这样的状态。相反,所有人都会持续在三种选择之间不断切换。然而,如果奖励每轮随机变化,新的稳定点和不稳定点就会出现。根据具体情况的不同,这可能会使博弈更快演化为持续切换的策略,或者发展出极限循环。如果奖励不均衡(例如,石头胜剪刀所获得的收益大于纸胜石头的收益),就会出现极限循环。在这种情况下,群体会持续循环变化,选择石头、纸、剪刀的概率会随时间以一种可预测且稳定的方式演化。
从这些博弈论研究中得出的结论是,尽管玩家的行为倾向会影响博弈本身,但不断变化的博弈环境同样可能对最优策略产生巨大影响。
用简单规则揭示生活
如果我们把囚徒困境当作经典的博弈论工具,它会得出一个令人沮丧的结论:合作是一种失败的策略。然而,即便在囚徒困境所设定的条件下,我们依然能观察到合作行为。为什么会这样?因为奖励背后存在着外部影响因素——选择背叛并获释的囚犯,在略微不同的情境下很可能会遭到报复,而在另一些情境下则不会。因此,更为复杂的策略组合很可能会由此产生。
不过,令人意外的是,奖励结构中相对较小的变化幅度竟然能引发行为上如此强烈的改变。
博弈论模型也常被用来尝试理解经济行为。我一直对从这类博弈中得出的洞见持怀疑态度(或许有些过于怀疑),我认为这篇论文清楚地说明了我为何不完全信任这些模型的原因。但这里的研究结果同样指出了一条前进的道路:我们在现实生活中观察到的更丰富的动态,可以在依然相当简单的博弈中得到复现。
《物理评论快报》,2026年,DOI: 10.1103/3yby-qq2n
Q&A
Q1:囚徒困境中奖励发生变化会怎样?
A:如果奖励随时间发生变化,即使变化幅度很小,模型中也会出现第二个稳定点,使合作者与背叛者能够共存;变化幅度进一步加大后,背叛者对应的稳定点会变得不稳定,最终只剩下合作者。
Q2:斗鸡博弈加入随机奖励变化后会有什么结果?
A:如果奖励没有变化,稳定点是人人让步、大家都能存活。只要加入一点变化,就会出现不让步的群体;再加入更多随机性,就会出现在存活与冲突之间反复切换的双稳态。
Q3:石头剪刀布博弈中加入随机奖励会怎样?
A:常规石头剪刀布没有稳定点,策略会持续在三种选择间切换。加入随机奖励后会出现新的稳定点和不稳定点,根据具体情况可能加快切换演化速度,或者在奖励不均衡时发展出选择概率持续变化的极限循环。
