← 书架

以牙还牙——好人赢的条件

重复博弈里,合作怎么在没有皇帝、没有合同的条件下自己长出来

2026-10-11 · 04-社会学 · 公共资源与集体行动

事实分档图例

公认 81 教科书级共识或记载明确可核 推断 29 有依据但口径/解读有分歧 存疑 16 流传广但查不到可靠出处,或两说并列

三个 N 不用手填:assemble.py 拼接时实扫自动回填(各档总数减图例那一枚)。

这份页面讲什么

合作不是因为人好,是因为还要见面。把"人"分成好坏解释不了世界,把"关系"分成一次性与长期才解释得了。

先摆一个反直觉的事实:在只做一次的买卖里,坑你是数学上的最优解——不需要你品德有亏,只需要你算得清楚。这条我们在 s1 会当场算给你看。可现实里大量陌生人之间确实在合作:远距离贸易做了几百年,小摊小贩不敢短斤缺两,同事之间多数时候互相搭把手。所以真正的问题不是"人到底善还是恶",而是三个更硬的问题:

  • 什么时候"老实"是聪明,什么时候是蠢?这条分界线有没有一个可以写下来的数学条件?
  • 没人当警察、没人签合同,合作能不能自己长出来?如果能,它长出来的形状是什么?
  • 它会不会失灵?在什么条件下"以德报怨"反而是最糟的策略,什么条件下连"以牙还牙"都不够用?

这三问合起来给一台发动机,发动机只有一个零件名称:未来阴影(shadow of the future)——"下次还要见面"这一件事,就把背叛的短期收益折成了亏本。s2 给它算临界点,s3 讲一场让策略互相厮杀的计算机锦标赛(冠军只有四行代码),s4 拆那四行代码为什么赢,s5 是全库第二个可交互模拟:你自己拨"还能见多久"和"手有多滑"两个旋钮,看冠军怎么换人。

后半本(s6–s9)专门讲它的边界:手滑的世界怎么把报复点燃、历史上和动物世界里真发生过的现场、平台时代用人造声誉把短线拉成长线,以及三张争论卡——这套机制在学界被追问得最狠的三个地方,我们不给结论,只给两边的证据。

这页和库里已有的页怎么分工

本页不是重新讲一遍"集体行动有多难"。那件事库里有两篇先讲过,分工要写清楚:

  • 《公地的另一种结局》把哈丁公地悲剧的四条隐藏前提列成表,其中第四条是"只此一遭——没有『明年还要见面']公认,它把这条前提当成奥斯特罗姆解药之一来用。本页就是把那条前提本身拆开:为什么"明年还要见面"能有这么大的力量,它的临界点在哪,它需要什么条件才不塌。两页一个是制度清单,一个是机制底账。
  • 《柠檬市场》讲信息不对称怎么把市场自己拧死,给出的三件解药之一是"品牌与声誉(重复博弈)",那句只写了一半就收住了推断。本页 s8 专门还这笔账:声誉为什么有效、它有效到几分、以及它把哪些交易从"一次性"改写成了"长期"。

另外三处对照,读的时候值得记住:这一台机器和 《挤兑》、《棋盘上的隔离》、公地页是同一个句型——每个人的算盘都打得对,加总出来的结局却没人想要公认。差别在方向:那三台是负向机器(个体理性造成集体灾难),本页这台是正向机器:个体照样自利,加总出来的却是合作。同一条机制,反着装就是灾难,正着装就是秩序。

本页不写什么:不做"做人应该善良"的道德劝导——这里的"善良"是一个技术术语(不先背叛),跟品德无关;不给任何具体人、具体民族的合作性打分;跨文化的比较结论一律降档标注。政治与现实人物的道德评价不在本页下结论。

一锤子买卖里,坑你是最优解

把场景缩到最小:两个人,各选一次,选完就散,永不复见。每个人只有两个动作可选——合作(我按规矩来)或背叛(我占你一次便宜)。收益用博弈论课本里最常用的一组数字公认:

  • 两人都合作:各得 3;
  • 两人都背叛:各得 1;
  • 你合作、我背叛:我拿 5,你拿 0(我被占便宜那次叫"傻子支付",英文文献直接写成 sucker's payoff);
  • 顺序要求是 5 > 3 > 1 > 0,这就是"囚徒困境"这个类型的定义,具体数字换成别的只要保持这个次序,结论不变。
收益矩阵(我 ↓ 对方 →) 对方合作 对方背叛 我合作 我背叛 3 · 3 都按规矩,都赚 0 · 5 你守约,我占便宜 5 · 0 反过来被占一次 1 · 1 互相防着,两败 ↑ 唯一谁也不肯先改的一格 读法:把每一列里"我"的那个数字比大小——1 > 0,5 > 3,两列都是下面那格高。所以"背叛"这一行永远不比"合作"那行差,而且至少有一列严格更好。
囚徒困境的原始形状:不是有人使坏,是一张谁也挪不动的桌子。

为什么这不算道德问题

把上面那张表读一遍就够了:不管对方选什么,我背叛都不比合作差。对方合作时我背叛多拿 2(5 比 3),对方背叛时我背叛少亏 1(1 比 0)。这在博弈论里叫占优策略公认——它的定义就是"不管别人怎么着我都是最优"。于是两个人都往那一格走,落点是 1 比 1,而明明存在一个大家都拿 3 的格子。

这个落点有个名字:纳什均衡——单看每个人,都没有理由单独改变自己的选择公认。它和"最好"是两回事:纳什均衡描述的是"谁也挪不动",不是"大家过得好"。3·3 那一格比 1·1 好,可它挪不动——谁先合作谁就等着被占便宜,只要双方都这么想,就一起待在差的位置上。

所以请注意本页第一个重要判断:困局的成因不在人,在结构。把骗子换成圣人不会改变结局,只要这买卖只做一次、双方不能事先约定、没有第三方执法。这句话是后面所有讨论的地基:既然病根在结构,那要改的也是结构,不是人心。

一句口径:这里的"背叛"没有道德含义

"背叛"在本页全程只指一件事:在对方选择合作时,我也选那个对我个人更划算的动作。它不指背信弃义,不指感情上的伤害,也不预设做这件事的人品行有问题。一页纸里最容易被误读的正是这个词——读者会把它读成对人性的判断,其实它是对支付表的描述。

身边的一次性场景

一锤子买卖并不罕见,它的特征很好认:对方认不出你,你也不打算再见他。旅游景点的餐馆、火车站前的出租车、只在平台上成交一次的陌生卖家、一次性装修包工,都在这一类里。这类场景里"宰客"频繁出现,不是因为从业者素质差,而是因为结构允许推断——同一批人回到自家小区门口开店,行为马上变,这是最省事的检验办法(下一页就把"变在哪"算出来)。

库里已有的一页给这类现象记过账:《柠檬市场》说的是"买家分不出好坏,于是只肯出中位价",结局是好货退场;本页说的是同一批场景的另一半——卖家为什么敢短斤缺两。一个是价格端崩,一个是行为端崩,同一个结构的两张脸。

下次还见面,账就算不过来

现在只做一处改动:这场博弈不是一次性的,做完一轮还可能有下一轮,概率是 w。博弈论管这个量叫继续概率(probability of continuation), Axelrod 给它起的名字更好记——未来阴影(shadow of the future)公认:未来的那笔账在你今天的决策里投下的影子有多长。w=0 就是上一节的一锤子买卖;w 越接近 1,关系越长久。

把 s1 那张支付表带上 w 重算一遍,就会看见临界点。这里不引任何二手结论,全部是给定支付表之后的一步算术(口径先说清:折现只用 w,不再叠一层利率折扣;假设双方都能看见对方上一轮的动作、并且认得出对方是谁)。

算两笔账

账一:一直合作值多少。每轮 3 分,未来各轮按 w 打折,等比级数求和:

V(合作) = 3 + 3w + 3w² + … = 3 / (1 − w)

账二:背叛一次值多少。本轮先拿走 5 分,代价从下一轮开始付。代价是多少,取决于对方用什么策略惩罚你,这就分出两条线:

  • 对方用"冷酷策略"(grim trigger:一旦发现你背叛一次,此后永远背叛)公认。你背叛之后每轮只能拿 1 分:
    V(背叛) = 5 + 1w + 1w² + … = 5 + w / (1 − w)
    令 3/(1−w) ≥ 5 + w/(1−w),两边乘 (1−w):3 ≥ 5 − 4w,即 w ≥ 1/2。
  • 对方用"以牙还牙"(这轮我合作,下轮照抄你上一轮的动作)。你背叛一次之后,两人的动作会开始轮流错位:他报复你一轮(你拿 0),你再反打一轮(你拿 5),这么 0、5、0、5 交替下去:
    V(背叛) = 5 + 0w + 5w² + 0w³ + … = 5 / (1 − w²)
    令 3/(1−w) ≥ 5/(1−w²),用 (1−w²)=(1−w)(1+w) 化简:3(1+w) ≥ 5,即 w ≥ 2/3。

两个数摆在一起,本页第二个判断出来了,而且它和直觉相反:惩罚越狠,能撑住合作的门槛越低。冷酷策略把未来的合作全砸掉,所以只需要 w ≥ 1/2 就吓得住人;以牙还牙只还一轮、给台阶下,所以要把关系拉得更长(w ≥ 2/3)才压得住背叛。以牙还牙是靠"关系更牢"换来的宽容,不是白得的公认(这两个临界值是上面两步算术的直接结果,换成任何满足 5>3>1>0 的支付表都会移动,但方向不变)。

继续概率 w → 一生的折现总分 ↑ 0 0.5 0.6 0.9 3 分/轮 5 分/6 分档 w = 1/2(冷酷策略的临界) w = 2/3(以牙还牙的临界) 一直合作 3/(1−w) 背叛一次,被轮流错位 背叛一次,被永久拉黑 读法:曲线的上下关系就是"该不该背叛"。交叉点左边,橙/赭线在绿线上方——短期占便宜更划算;右边反过来,合作才是自利的选择。绿线在 w≈0.8 之后冲出画面(3/(1−w) 发散),这正说明长期关系的价值涨得比什么都快。
同一张支付表,唯一的变量是 w。关系一长,最优解自动换人。

这条临界线为什么重要

因为它把"这人靠不靠得住"这个问题换成了一个可以观察、可以设计的问题:不是问他品德,是问他所处关系的 w。三个直接推论:

  • 同一个人在不同 w 里会做出完全相反的行为,而且两边都不算"装了"。小区门口的修鞋匠不敢糊弄你,同一个人在火车站前敢——w 不一样。这一条是本页最实用的部分:看到行为差异,先怀疑结构,再怀疑人品推断(这是本页给的一个读法,不是某个实验的直接结论)。
  • 合作不是"信任"生出来的,是"预期的长期关系"生出来的。把顺序搞反就会开错药方:喊大家互相信任没用,把关系拉长、把身份钉牢才有用。
  • 把 w 推高或者把惩罚做实,是同一枚硬币的两面。s8 讲的声誉系统做第一件,s6 讲的报复机制做第二件,s9 的争论正好卡在"第二件要不要由第三方来做"。
这条推论在实验室里被直接测过

Blake、Rand、Tingley 与 Warneken 让儿童分别在"固定同伴反复相遇"和"每次随机换陌生人"两种条件下玩合作游戏(Scientific Reports 5: 14559,2015):重复配对那组的合作明显更高——原文给的是方向性表述,没有给一个"两组相差 X 个百分点"的总数公认;同一篇里可核的量化数字是条件合作率:同伴上一轮合作之后,儿童这一轮合作的比例是 44.9%,同伴上一轮背叛之后降到 27.4%(N=64,1790 次决策)公认。这两面其实是同一件事:对方上一轮做了什么会改变你下一轮的选择,而这个通道只有在"还会再见"的时候才存在。

临界线的三个前提(后面所有的失灵都从这里进来)

上面那两步算术用了三个不显眼但极硬的假设,一个个数出来:

  • 认得出对方是谁——匿名会把 w 实际压成 0,因为"下次见面"碰不到同一张脸。这正是 《公地》那页四前提里的"匿名",本页给它一个机制说法。
  • 看得见上一轮发生了什么——动作必须可观察。对方偷偷占便宜、没人知道,报复就无从谈起。
  • 下次的概率真的够高——关系要足够长、足够确定;一个随时可能消失的市场里,w 低到撑不住任何策略。

这三条也是本页与《人情与规则》的接口:那页讲熟人社会靠"关系"把陌生人变成自己人(差序格局那一圈圈水波纹),机制的另一面其实就是把一次性相遇改写成有身份的长期相遇——把第一条前提人为造出来推断。

一场让策略互相厮杀的计算机锦标赛

本页最出名的那段故事发生在 1979 年:政治学家 Robert Axelrod 邀请一批博弈论研究者提交"下次还怎么打"的规则程序,然后让这些程序互相打。他后来在 Journal of Theoretical Biology 299: 21–24(2012) 里自己回顾过发起过程公认。这件事之所以重要,不是因为办了个比赛,而是因为它第一次把"什么做人方式活得最好"变成了一个可以跑的问题——不用先回答人性是什么。

赛制里可核的部分,和两处传错的部分

项目可核到什么程度怎么来的
支付表 5 / 3 / 1 / 0(T/R/P/S)两条独立文献一致公认Rapoport-Seale-Colman 2015;PLoS Comput Biol 2024 那篇重跑研究
冠军是 Anatol Rapoport(多伦多大学)的 TIT FOR TAT,两届都第一两源一致公认同上两篇
首届 1979 年发起、14 个投稿程序另加一个随机对照本轮只找到一条可靠源推断PLoS ONE 2015 的赛事描述
每对策略打多少回合两说并存:该文献记 200 回合;中文圈通行的"1200 回合"本轮取不到原文证据存疑原始赛事记录不可达
第二届 63 个程序、没有加噪音,TFT 又赢两源一致公认同上两篇;实际举办年份未能证实
20 周年纪念赛(2004,Kendall-Yao-Chong 记录)加了随机噪音加噪音这件事可核;冠军是谁没能核到存疑该届结果表
顺手校准两条流传很广的说法:①"以牙还牙只有四行代码"——这个说法在中文通识写作里几乎成了标配,但本轮没找到原始出处,本页只说它规则极短(短到可以被第三人转述,这一点是 s4 第四条性质的重点)存疑。②"第三届加了噪音还是以牙还牙赢"——2004 年那届确实加了噪音,可"它又夺冠"这句话本轮查不到源,所以不写;s6 会讲到,噪音环境里学界认的赢家其实是另一族策略。

为什么是它赢

答案不在"它聪明",在场上都是谁。第一届的投稿绝大多数是有条件的策略——它们会看对手上一轮做了什么再决定自己这一轮。在这种群体里,任何"永远背叛"的程序打谁都只能拿到 1 分(对方一被发现就报复),而 TIT FOR TAT 跟所有愿意合作的程序都拿到满额的 3 分,只在那几个背叛者身上吃点亏公认。反过来,如果场上大半是无条件合作者,冠军就换人了——这件事 s5 那台模拟里能直接拨出来(本页实测:把"永远合作"和"随机"留在场上,永远背叛的排名被抬高)。

Axelrod 把这些结果整理成书:The Evolution of Cooperation,Basic Books(纽约),1984公认;学术版的第一次亮相则是论文 Axelrod, R. & Hamilton, W. D., "The Evolution of Cooperation", Science 211(4489): 1390–1396,1981 年 3 月 27 日(DOI 10.1126/science.7466396)公认。⚠ 网上常见的"211: 1396–1399"与"1981 年 12 月"两个写法都是错的公认(Crossref、OpenAlex、PubMed 三源一致)。他早一年还发过两篇方法论文:"Effective Choice in the Prisoner's Dilemma"(Journal of Conflict Resolution 24(1): 3–25,1980)与"More Effective Choice in the Prisoner's Dilemma"(同刊 24(3): 379–403,1980)公认——锦标赛的设计逻辑全在这两篇里。

还有一个细节值得记住:冠军是对手送来的。Rapoport 本人是研究合作与冲突的心理学家,他把自己设计的程序交给 Axelrod 时并不知道它会赢;后来 Axelrod 反复讲这段,是为了说明"善良"这件事在学术圈里当时并不被看好——多数人提交的是各种抢先试探、伺机占便宜的复杂规则推断(这一层是本书叙事的读法,具体谁提交了什么策略的可核清单见原书附录,本轮未能取到)。

最后,"未来阴影"这个术语本身不是 Axelrod 一个人造的:它在政治学里的定名出处是 Axelrod & Keohane, "Achieving Cooperation under Anarchy: Strategies and Institutions", World Politics,1985,pp. 226–254(后收入 Cooperation under Anarchy,Princeton University Press,1986;两处文献给的页末打架,226–254 与 226–260 并存)公认。

四行代码的四条性质:善良、可激怒、宽容、清晰

Axelrod 在书里把以牙还牙为什么有效拆成四条性质,这是全库后来很多讨论的原点公认。它们不是四种美德,是四个可以分别检查的设计参数——这也是本页把 s5 那台模拟做成三个旋钮的原因:每个旋钮拧的正是其中一条。

① 善良(nice):绝不先背叛

这一条管的是开局。以牙还牙第一轮永远伸手,它不占任何人便宜,所以它的收益上限就是合作的上限 3 分——它永远拿不到 5 分那一格。听起来像吃亏,实际是把"占便宜"这笔风险从自己的账上划掉了:先背叛者要付的代价是让对方从此有理由怀疑你所有的动作。公认

本页要提醒一处误读:"善良"在 Axelrod 的原文里是一个定义在策略结构上的技术词,不是道德评价。它说的是"首轮不背叛",不是"出于善意"。以牙还牙完全可以是一个冷静的自利者采用的策略——这恰恰是这场讨论最有价值的地方:它不需要假设人是好人,就能解释合作为什么会存在推断(这是本页对原文的读法)。

② 可激怒(provocable):被背叛立刻还手

这一条管的是下限。不还手的策略(永远合作)在长期关系里也活得好,但前提是场上没有永远背叛——一旦有,它就是别人的稳定收入来源。可激怒的作用是让占便宜这件事在你身上变成亏本买卖:你打我一下,这一轮我就少拿 4 分(从 3 掉到 −1 的差),而且你会看见。

注意它的机制:报复的价值不在于我出了气,而在于给你和其他旁观者改预期。所以报复必须贵到对方算得过来,又不能贵到自己承受不起——这条平衡是 s9 第三张争论卡的主战场推断。

③ 宽容(forgiving):对方回头就翻篇

这一条管的是怎么从冲突里走出来,也是四条里最容易被忽略、却在真实世界里最要命的一条。以牙还牙的宽容是被动的:只要你下一轮回到合作,我下一轮就跟着回来——我不主动原谅,但我立刻接受你的原谅。冷酷策略没有这一条,一次背叛换永久拉黑,在零误会的世界里它最稳,在有误会的世界里它最先死(s5 表二里那根从 26% 掉到 1% 的线就是它的)。

宽容的代价也要写清楚:它让你在下一次相遇中容易被再吃一次。所以 s5 的第三个旋钮专门给它设了区间——太窄就是冷酷,太宽就是永远合作。

④ 清晰(clear):让别人一眼看懂你会怎么反应

这一条最反直觉:赢家不是最聪明的策略,是最容易被看懂的策略公认。复杂的策略能占便宜——它会在对手露出破绽时才出手,会伪装成不同类型,会随机化让对手猜不到。但对手猜不到,就没法"学会"跟你合作;它只能按最坏情况防着你,于是你赢到的是一次次的便宜,输掉的是后面所有轮次的合作红利。

清晰还有一个社会学版本:你的规则要能被第三方转述。"他打我我就打回去,他住手我就住手"这句话谁都能替他讲一遍,所以他敢先跟你合作;"我这次原谅你但我记着,下次看情况"没人能转述清楚,于是没人敢把身家押在这段关系上推断。这一条正好接 《柠檬市场》的信号逻辑:能被看懂的承诺才是有价值的承诺。

四条性质互相牵制,不是四条并列的优点

把它们排成一句因果链:善良决定你的上限能不能拿到,可激怒决定你会不会被吃,宽容决定一次误会之后这段关系还剩什么,清晰决定别人敢不敢先对你善良。任何一条单独推到极致都会把另外三条拖坏:

只推一条变成什么策略在长期关系里的下场
只有善良永远合作零噪音的群体里能分到一成多份额;场上只要有永远背叛的,它就是别人的稳定收入推断
善良 + 最狠的可激怒冷酷策略误伤一次就永久拉黑,有噪音的世界最先出局(本页模拟:26% → 1%)
善良 + 无限宽容接近永远合作宽容率推到 60% 时份额塌到 4%(本页模拟)——原谅太便宜,就等于宣布"打我不用付钱"
前三条都有、但不清晰复杂条件策略对手读不出你的规律,只能预防性背叛;你骗到了几轮便宜,赔掉了后面的合作红利推断

这一表也是本页与《公地》那页的接法之一:奥斯特罗姆的八条设计原则里"渐进惩罚"和"低成本吵架场所"两条,对应的正是这里的可激怒与清晰——社区不是靠一次抓一次打死,而是先罚小额、并且罚法人人看得懂公认。个体策略和制度原则在这一点上是同一套零件的两种尺寸。

自己拨一遍:把关系长短、手滑、宽容度做成三个旋钮

下面这台是活的,全库第二个交互模拟。它不排"谁的分数最高",它演一个群体:场上同时住着七种做人方式,每一代里各策略按"跟这个群体里的人打交道平均能拿多少分"调整自身份额(用的是演化博弈里最标准的复制子动力学,份额跟着收益差走,赚得比群体平均多的就扩张)。所以你能看见的不是冠军,是谁活下来、谁绝迹。

三个旋钮。第一个最好记:不问"继续概率 w",问这段关系平均还要见几次面(N;换算 w = 1 − 1/N,N=1 就是一锤子买卖,N=100 是 w=0.99 的老交情)。第二个是噪音率 ε:心里想合作、手却打错的比例。第三个是宽容率:宽容版在对手刚背叛过自己之后,仍然先伸手的概率。支付表固定 5 / 3 / 1 / 0,七种策略两两对打 120 局估收益,每局的期望长度正好等于 N。

N=100(w=0.99)
5%
15%
预设
操作
第 0 代 份额:—

就绪:N=100、ε=5%、宽容率 15%。按"自动跑"看群体怎么洗牌。

显微镜:一次手滑在三段关系里各自变成什么

橙块 = 合作 · 灰蓝块 = 背叛 · 描橙框的块 = 这一下是手滑打错的,不是本意。三行分别是「以牙还牙 对 以牙还牙」「冷酷策略 对 以牙还牙」「宽容版 对 以牙还牙」,每对上下两条带,各显示开局 24 回合。

五个读数点,建议照这个顺序拨(下面的数全是本页模拟实测,跑满 120 代后的份额,重估一遍收益会在几个百分点内晃):

  • 一锤子买卖(N=1):永远背叛占 100%,其余六种策略全部归零,连永远合作和以牙还牙的火星都留不下。这不是策略笨,是 s1 那张表在没有未来的世界里只有一个答案。
  • 老邻居、手不滑(N=100、ε=0):场上变成五家并存——冷酷策略 26%、以牙还牙 22%、宽容版 20%、赢留输换 19%、永远合作 13%,永远背叛 0%。零噪音的世界里,"最狠的报复"和"最短的记性"谁也吃不掉谁,连无原则的老好人都能分到一成多。但只要世界开始出误会,这个平衡就散了。
  • 老邻居、会手滑(N=100、ε=5%、宽容率 15%):格局整个洗牌——宽容版 56%–60%、以牙还牙 24%–26%、赢留输换 12%–14%,而冷酷策略掉到 0%–1%、永远背叛归零(这两条线在这档基本贴地)。这是本页最想让你看见的一张图:善良阵营赢了,但赢的不是"最硬的那种善良",是该还的还、该放的放那种。
  • 关系短一点(N=5,其余不变):冠军换成了不肯原谅的那家——冷酷策略 33%–43%,宽容版掉到 25% 上下、以牙还牙 24% 上下、赢留输换 13%;再短一档(N=3)连永远背叛都能占到 12%,而 N=10 时冷酷策略仍有 31%。关系短的时候,原谅等于把自己的位置让给别人——宽容这笔投资要有回报,得先有关系长度来垫。附带一句实话:N=3 到 N=10 这一段是相变带,本页多次重跑的名次在这里晃得最凶,越往两端(N=1 与 N≥50)越稳定。
  • 宽容率本身有个最优区间:N=100、ε=5% 下把宽容率从 0 推到 60%,份额先涨后崩——0% 时它与以牙还牙几乎没区别(群体里占 26%,被赢留输换压到第二),10%–15% 处最高(54%–59%,随重估的抽样晃),推到 40% 反被以牙还牙压过去(29% 对 50%),推到 60% 只剩 4%。宽容不是越多越好的美德,是一个有区间的技术参数推断(本页模拟的形状,文献里对最优宽容度的具体数值各说不一)。

最后一条留给噪音的上限:把 ε 推到 12%–15%,群体不再往合作的方向走,而是退回"谁也不信"的粗糙均衡——冷酷策略回升到 35%–41%,永远背叛回到 29%–44%,宽容版掉到 3%–11%。误会多到一定程度,"我愿意原谅"和"我在装傻"从对手那边看是同一件事,于是原谅不再买到信任推断。这条边界在 s6 会接着讲。

口径与差异声明:策略集是本页自选的七个——永远合作、永远背叛、以牙还牙(首轮合作,之后照抄对手上一轮实际打出的牌)、宽容版以牙还牙(对手上一轮背叛时,按"宽容率"先合作,否则照抄)、冷酷策略(被背叛一次就永久背叛)、赢留输换(win-stay lose-shift,Pavlov:上一轮自己拿到 3 分或 5 分就重复,拿到 0 分或 1 分就换公认)、随机。它们与 1980 年代那两场真实锦标赛的投稿策略集不同;每对 120 局、每局期望长度等于 N、上限 1500 轮也都是本页设定。演化那部分用确定性复制子方程(份额按收益差增减,步长 0.14,跑 120 代),不是逐个体随机匹配,所以曲线是平滑的;唯一的随机来源是估收益矩阵时的抽样噪声——按下"重估一遍收益"会重抽一次,终局份额会有几个百分点的晃动。页内所有读数是"本页模拟实测",不是文献值。噪音模型取"意图正确、执行翻牌"这一种实现误差,不是"看错对方";双方看到的都是实际发生的动作。

手滑的世界:一次误伤怎么变成互相惩罚

s5 那台模拟里最反直觉的一张图,是冷酷策略那根线。零噪音时它是场上的大户(本页实测:占群体 26%,与以牙还牙、宽容版一起把永远背叛挤到 0%);把噪音推到 5%,它掉到 1%。为什么?因为它的规则里没有"错误"这个类别:对手打出背叛这一手,不管是存心的还是手滑,它都按存心的处理,一次触发、永久拉黑。

误差有三种,值得分开记,因为文献里经常混着说公认:

  • 执行误差——想合作,手滑打了背叛(本页模拟用的就是这一种);
  • 观察误差——对方合作了,你看成背叛了;
  • 沟通误差——你的意图传达出去走了样(现实中占比最大,也最难建模)。

两个"照抄对方"的策略,会被一次手滑带进什么

看显微镜第一行:两个以牙还牙在和平时期配合得完美,谁都不先动。可只要有一方打错一手,另一方下一轮就照抄那个背叛——而此时打错的那方已经回到合作了,它抄到的是对手因为误伤而做出的报复。于是两个人进入"我原谅你的上一手、你惩罚我的上一手"的错位循环,谁都不肯先停,因为先停的那个正是"照抄对方"的那个。这就是报复螺旋(revenge spiral),它不是情绪问题,是两条完美对称的规则互相咬住的必然结果公认。

学界对这个问题的正面回应,是 Nowak 与 Sigmund 1993 年提出 Pavlov/赢留输换(Nature 364(6432): 56–58)公认。这条策略只看自己上一轮的结果:拿到 3 分或 5 分(结果符合预期)就重复上一步,拿到 0 分或 1 分就换。原文给它的两条优势写得很清楚——一、它能纠正自己造成的错误:两个 Pavlov 即使互相背叛了一次,下一轮都会因为"结果不如预期"而同时回到合作;二、它能利用无条件合作者(对永远合作的人就一直背叛)。这一条正好补上了以牙还牙的缺口:以牙还牙需要对方先回头才能结束报复,赢留输换自己就会回头。

再往演化那一步:Imhof、Fudenberg 与 Nowak(Journal of Theoretical Biology 247(3): 574–580,2007)在一个带噪音的演化过程里算出一个临界收益——低于它,被选中的是永远背叛;高于它,被选中的是赢留输换,并且明确写道以牙还牙在这套动力学里从来没有被选中过公认。另一条支线是 Stewart 与 Plotkin(PNAS 110(38): 15348–15353,2013)研究的"慷慨型"策略:会原谅背叛者,却仍然在演化种群中占支配地位公认。这两支合起来给的是同一句话:能活的不是最硬的那种,是能纠错的那种。

⚠ 一条必须写下来的口径缺口:中文圈常流传"噪音率超过约 X% 时以牙还牙就输给宽容策略"这类阈值说法。本轮检索没有找到任何一篇给出这种噪音百分比阈值的文献——Imhof 等人给的是收益临界值,不是噪音临界值。所以 s5 里那条"宽容率推到 40% 就被以牙还牙反超""噪音推到 12%–15% 群体退回互害"只能是本页模型的读数推断,不能当文献结论引用;本页宁缺不编。

宽容在这套机制里的真实职务

把上面几条翻译成本页的语言:可激怒解决的是"敢不敢背叛我",宽容解决的是"一次误会之后这段关系还剩什么"。少了前者,你成为别人的稳定收入来源;少了后者,一段百年关系会因为一次口角归零。所以宽容不是道德加分项,它的作用非常实际——它是打断链条的那个零件。

这条机制在人类社会里的对应物很好找。两个人之间的"你骂我一句我回两句、然后各自找帮手"升级,和两个策略互相照抄导致的互害锁死是同一个结构,能停住它的从来不是"谁先认错很高尚",而是有一方的规则里写了"只要你不继续,我下一轮就回来"推断(结构类比是本页的读法,不是某篇论文的结论)。

制度版同样存在:奥斯特罗姆八原则里的渐进惩罚(先小额罚款、再升级)与低成本吵架场所,干的正是同一件事——给误伤留一个可以当场澄清、不必升级的出口公认。社区不是靠一次抓到就打死来维持的,是靠"惩罚可以逐步撤回"来维持的。这一句也接得上 《读空气》记的山岸俊男实验:日本被试在没有制裁时合作率 44.4%,低于美国被试的 56.2%;有制裁时跳到 74.6%公认——合作靠的不是"这个民族爱集体",是有一套能被看见、能被执行的反应规则。

没有皇帝的地方,合作是怎么长出来的

s2 算出合作需要三样东西:认得出对方、看得见上一轮、下次真的还会见面。这三条都不需要谁 enforce,但需要物理条件。下面四个现场——两种动物、两段商业史——恰好是这三条各自被满足的样子。读的时候只看一件事:每个案例里,"下次见面"藏在哪里。

现场一:吸血蝙蝠——共享食物发生在"同宿率高"的两只之间

吸血蝙蝠一晚吸不到血就可能饿死,所以它们会把吸到的血反刍分给没吃到的同伴。这件事最早由 Wilkinson 记下来(Nature 308(5955): 181–184,1984,哥斯达黎加野外研究)公认。有意思的是分布:他记录的 110 次分享里约七成是母亲喂崽;剩下的非母性分享里,绝大多数给的是近亲。

但真正把"互惠"和"亲缘"分开的是后来的实验:Carter 与 Wilkinson 用 20 只蝙蝠做受控喂食,禁食 48 小时来诱发求助,结论写在 Proc. R. Soc. B 280: 20122573(2013)公认——控制亲缘关系之后,"我曾经收到过你的食物"是"我这次是否给你食物"的最好预测因子,它的权重是亲缘度的 8.5 倍;而且样本里 64% 的分享发生在非亲缘个体之间(如果完全偏向亲属,这个比例应该低得多)。同样关键的一条限定:他们观察到的分享全部发生在"同宿率高于 60%"的配对之间——两只蝙蝠要长期睡在彼此旁边,互惠才有发生的场所。

这一条正是本页的机制在自然界里的落地:不是蝙蝠聪明,是它们的社会结构把 N 抬高了。同一批个体反复相遇,才有"上次你帮我"这笔账可记。推断("同宿率=未来阴影"这层类比是本页的读法,实验论文本身没有用博弈论语言)。

顺手校准两条中文流传:①"蝙蝠一晚不吃就会死""70 小时饿死""一次吸进自身体重一半的血"——本轮查不到可核对的双源,本页不用,标存疑;实验里可核的是"禁食 23–24 小时用于诱发求助"。②"互惠主要发生在陌生个体之间"也不准:野外记录里亲缘占多数,互惠的证据来自受控实验。
现场二:清洁鱼——客户用"换一家"来惩罚

珊瑚礁上有专门啄食寄生虫的清洁鱼,客户鱼排队让它们清理口腔和鳃。冲突点很清楚:清洁鱼偶尔会偷吃一口客户身上的组织——短期收益更高,但客户会立刻中止服务。Bshary 与 Schaefer 的实验(Animal Behaviour 63(3): 557–564,2002)给出可核的一条:当客户鱼能同时看到两个清洁站时,它显著偏向那个"多啄寄生虫、少啃客户组织"的诚实站公认。

这就是报复的市场版本,而且它比以牙还牙更"温和":客户不惩罚你,只是不再来。惩罚的成本由被惩罚者自己承担(失去以后的收入),不需要谁来执法。这一条与 s5 里"关系短则宽容不值钱"是同一枚硬币——诚实的清洁鱼之所以诚实,是因为礁石上有下一家客户、也有隔壁那个竞争者。

现场三:香槟集市与马巴商人——名声当保证金

中世纪欧洲的远距离贸易面对一个死结:买方在千里之外,合同没法强制执行,欺诈抓不到。Milgrom、North 与 Weingast 的经典论文(Economics & Politics 2(1): 1–23,1990)给出的解释就是本页这台机器:"可转移的诚实名声,本身就是一笔够用的保证金"(原文 transferable reputations for honesty can serve as an adequate bond)公认。支撑它的是三件实物:定期重复召开的集市、由商人自己选的私人法官(Law Merchant)、以及裁决结果会传出去这件事。

可核的时间与规模:香槟的集市群分布在四座城镇、一年六次(特鲁瓦两次、普罗万两次、拉尼与巴尔各一次),12—13 世纪是鼎盛期,每次持续约六周(另有"最长 49 天"一说,两说并存);香槟伯国 1314 年并入法国王冠后集市衰落公认。这里"下次见面"不是比喻——它有一张日程表。商人知道秋天还会在特鲁瓦碰面,所以这一季的诚信有回报。

同一时期地中海一带还有"马格里布商人联盟"的研究(Greif,American Economic Review 83(3): 525–548,1993,用共同惩罚机制解释族群内跨城信任)推断——但要提醒一句:这篇的史料解读后来受到 Edwards 与 Ogilvie(Economic History Review 65(2): 421–444,2011)的系统反驳,指其证据不足公认。本页把它当作有争议的案例列出,不引它做论据。

现场四:德川的五人组——把"下次"写进法律

前面三个现场的"下次"都是自然长出来的;第四个是人为造出来的。德川幕府把民户五户结成一保(五人组),互相担保赋税、火防、盗贼告发与宗门取缔,成文法条见 17 世纪前期的《五人组法》(今译本编入 Vaporis《近世日本的声音》一章,标为 1640 年・寛永 17)公认。机制上它做的事只有一件:让"和这伙人的关系"变成不能退出的长期关系——一人出事牵连四家,等于把每两户之间的相遇次数强行拉到一生。

⚠️ 口径卡:库里另一页 《读空气》写的五人组时间窗是 1649—1888,与本页据以立论的 1640 年成文本不同源,两处并存待回查(本页不替读者选边)。这一条只影响起始年,不影响"连保=人为延长关系"的机制。

四个现场排在一起,本页第一个大结论就出来了:历史上真实存在的合作,几乎没有一种靠"人心本善"解释。它们靠的是可识别的身份 + 会长久相处的结构 + 背叛之后对方能做的事。这条结论直接接进 《公地的另一种结局》——奥斯特罗姆那八条设计原则,本质就是把这三件东西逐条造出来公认。

再补一条实验侧的旁证,它说的是"下次"从哪来:Efferson、Bernhard、Fischbacher 与 Fehr 发现,一个群体与外部反复打交道的历史和群体内部的制度这两种条件叠加时,群体内合作水平高于各自单独作用的加总(Nature 626(8001): 1034–1041,2024)公认。换句话说,"我们以后还要一起对外"也是把 N 抬起来的一只手——这一条与 《挤兑》那页的负向机器正好成反号:恐惧能把陌生人拧成一股绳往回跑,共同的长期处境能把陌生人拧成一股绳往前走推断(这一层对照是本页给的读法)。

人造未来阴影:声誉系统把一次性买卖变成长期关系

《柠檬市场》那一页给信息不对称开了三件药方,第二件写的是"品牌与声誉",当时只点了一句就收住了推断。这笔账在这一节还:声誉为什么管用,管到什么程度,以及在哪儿不管用。

声誉机制做的事只有一件:把 N 做大

一次性的陌生交易之所以容易崩,是因为买卖双方之间 N=1。声誉系统不改人性、不改支付表,它只改相遇结构,而且改的正是 s2 那三条前提:

  • 身份可指认——账号、店铺、营业执照、真名。有了它,"下次"才落到同一个对象上;
  • 记录跟着人走——评价、评分、信用分、行业黑名单。一段关系的结局变成下一段关系的开局;
  • 背叛有确定成本——不是有人来罚你,是以后没人跟你做。这一条与 s7 清洁鱼那条完全同型:客户不惩罚你,只是不再来。

演化那侧的理论根据是 Nowak 与 Sigmund 的间接互惠研究(Nature 393: 573–577,1998):当"我帮你"会被第三个人看见并影响第三个人对我的态度时,即便双方终生不再单独相遇,合作也能被自然选择保留下来公认。换句话说,声誉是把两个人的博弈变成一个人和一群人的博弈——未来阴影的来源从"你的对手"换成"你的观众"推断(这是本页对原文的读法)。

实证:有效,但幅度比多数人以为的小

互联网拍卖是这套机制最干净的实验室,因为买家和卖家终生大概率只见一次。可核的三条:

  • Resnick 与 Zeckhauser 对 eBay 声誉系统做了最早的实证分析("Trust among Strangers in Internet Transactions",Advances in Applied Microeconomics 11: 127–157,DOI 10.1016/S0278-0984(02)11030-3),结论是陌生人之间确实会依据声誉定价,高信誉卖家卖得更高公认。⚠ 该文的具体差评率与溢价百分比本轮只拿到单源、未过双源关,故不给数字;另外它的出版年份两个书目库打架(Crossref 记 2002 卷 11,OpenAlex 记 2004),引用时以卷号为准存疑。
  • Melnik 与 Alm 用同一件商品(未流通的 5 美元金币,1999 年样本,均价约 32.73 美元)单独估计卖家声誉对成交价的影响:显著为正,但幅度不大(Journal of Industrial Economics 50(3): 337–349,2002)推断(出版社摘要口径,未取到原文表格)。
  • Houser 与 Wooders 进一步做了分离:卖家的声誉影响成交价,买家的声誉几乎不影响(Journal of Economics & Management Strategy 15(2): 353–369,2006)公认。这条很实在——声誉约束的是掌握质量秘密的那一方,不是所有参与者。

三条合起来给一个校准:声誉系统真的能把一次性买卖往长期关系的方向推,但它的经济价值通常是个位数百分点的量级,不是"口碑=一切"。中文互联网上流传的"差评率多少=营收损失多少"那一类吓人数(例如 Yelp 一星等于 5%–9% 营收)本轮没找到可核对的双源,本页不用存疑。国内的芝麻信用、淘宝评价体系也没检索到可核对的正规量化研究,同样只当现象描述、不当证据。

这台机器有三个已知的坏法

坏法对应本页哪条前提被破坏现实长相
记录注水(刷单、买好评)观察误差——别人看到的"你上次做了什么"是假的评分失真后买家改用别的价格信号,声誉的约束力打折推断
身份可弃(换店重来、换马甲)身份可指认——"下次"落不到同一个人身上老账号的成本 = 声誉抵押物;无抵押的平台更容易出柠檬推断
关系长度由平台决定(政策一改就下架清退)下次真的还会见面——N 变成别人手里的开关商家对"平台规则"的博弈,比对"顾客"的博弈更短视推断

声誉机制还有一个高强度样本:钻石交易圈。Bernstein 对纽约钻石业的研究("Opting Out of the Legal System: Extralegal Contractual Relations in the Diamond Industry",Journal of Legal Studies 21(1): 115–157,1992)记录的是同一台机器——交易靠口头约定达成、几乎不进法院,支撑它的是族内共同体:身份跑不掉、记录人人知道、失信等于被整个行业逐出公认。⚠ 网上流传的"口头合同占该行业交易额 X%"这类数字本轮只取到自媒体级来源,本页不用存疑;能站住的是机制本身。

这一节最后接回库里的关系线:《人情与规则》讲的熟人社会"名声"与"人情",其实就是这套技术的低配版——身份靠脸、记录靠嘴、惩罚靠"以后没人理你"。它覆盖的范围小(一个村、一个行业),但在没有数据库的年代,它是唯一能造出未来阴影的办法推断(两个机制的对照是本页给的读法)。而"差序格局"那一圈圈水波纹的博弈论翻译就是:圈内 N 极高、圈外 N 极低,所以同一件事"自家人做得、外人不做得"。

争论三卡:这套机制在哪些地方会被追问

一台好发动机一定有几处拧不动的地方。下面三卡不给结论,只给两边的证据和它们各自成立的条件。

卡① 有终点的关系:倒推会不会把合作一路拆到第一轮

正方(教科书结论):如果这段博弈明确只做 10 轮,那么第 10 轮背叛是占优的(没有下次可惩罚);双方都想到这一点,第 9 轮就失去意义;倒推下去,理性人在第一轮就该背叛公认。这就是有限期囚徒困境的逆向归纳结论,它和本页的主张正面冲突。

反方(声誉与不完全信息):Kreps、Milgrom、Roberts 与 Wilson(Journal of Economic Theory 27(2): 245–252,1982)给出的解法是只要场上有哪怕一小部分"可能是讲信用的类型",一个纯自利的玩家也会假装讲信用去积累声誉,于是合作能撑到非常靠后的轮次公认。实验侧,Andreoni 与 Miller(Economic Journal 103(418): 570 起,1993)直接检验了这套声誉假说,结论是受试行为大体符合理论预测,同时观察到理论没写的"自制利他"现象公认。⚠ 流传很广的"有限次实验里末期背叛率接近 100%"这一类百分比,本轮只拿到单源,本页不写具体数存疑。

可操作的判据:关系的"最后一次"是可预见的,就会污染前面所有的轮次。合同到期前的最后三个月、退休前的最后一年、毕业前的最后一个学期——这些时点上合作质量下降,是本机制给出的一个可检验预测,不是感叹推断。

卡② 第三方惩罚:救得了合作,也可能是新的病

正方:两个人的私力报复有很多缺陷(误伤难纠正、力量不对等、成本高)。Fehr 与 Gächter 的公共品实验(American Economic Review 90(4): 980–994,2000)给出的结论是可重复的那一类:允许第三方付费惩罚搭便车者之后,合作水平显著上升并维持在高位;没有惩罚机会时合作逐轮衰减公认。⚠ 具体百分比与"人们愿意花多少钱去惩罚"要读原文表格,本轮没取到,本页只给定性存疑。

反方:同一批人在 2008 年又发现了一个不那么好看的后果。Herrmann、Thöni 与 Gächter 跨 16 个被试池的研究("Antisocial Punishment Across Societies",Science 319(5868): 1362–1367,2008)报告:反社会惩罚(惩罚合作者、惩罚贡献最多的人)在所有社会里都存在,部分社会里它强到足以抵消惩罚带来的促进合作效应;而且反社会惩罚的强度与公民合作规范弱、法治弱的指标相关公认。也就是说,惩罚这套零件本身需要被治理,把它当成免费的解药是错账。

接库:这条正好接上 《考什么就得到什么》——一旦惩罚/考核变成一项可操作的权力,它就会为自己制造出新的博弈对象;也接 《科层制》的"规则即下限"。本页与那两页的分工是:那两页管"谁来执行"的失真,本页管"没有执行者时能不能自转"。

卡③ "以牙还牙最成功"这句话到底成不成立

正方:原始赛事的事实站得住——它在两届锦标赛里都是第一名(详见 s3),而且它的四条性质后来被反复复现公认。

反方一(名次取决于计分方式):Rapoport、Seale 与 Colman 重跑了这批老策略并对赛制做了敏感性分析(PLoS ONE 10(7): e0134128,2015)。结论很不舒服:把"每对平均得分"换成"赢的对局数",或者改成两阶段对抗制,冠军名单整个重排——以牙还牙在其中一种计分下几乎一场都没赢过公认。同一篇论文提醒:那两句"以牙还牙赢了锦标赛"之所以有名,是因为它赢的那套计分恰好是 Axelrod 定的那一套。⚠ 该文给的具体胜率数字本轮为单源,本页只写方向不写百分比存疑。

反方二(演化里它排不上号):Imhof、Fudenberg 与 Nowak 那篇(2007)明确说,在他们设定的带噪音演化过程里以牙还牙从未被选中,被选中的一侧是赢留输换或永远背叛(取决于收益高低)公认。s6 已经引过这条。

本页的处置:把"以牙还牙是最优策略"降级成一句更窄、也更好用的话——在关系足够长、会有误会、且群体主要由"会报复的人"组成这三个条件下,"善良 + 可激怒 + 宽容 + 清晰"这一族策略活得最好;以牙还牙是这一族里最容易被看懂的那个代表。s5 那台模拟就是这句话的证据:换个群体组成、换个指标,冠军就换人推断(这句话是本页的归纳,不是任何单篇论文的原文)。

三件随身工具

这台发动机兑换成判断,是三件事。每件都写成"怎么看、怎么用、什么时候会失效",因为本页最大的风险是把它读成一句"做人要不卑不亢"。

工具一:先量关系的长度,再决定先不先伸手

不要问"这人靠得住吗",问四个可观察的问题:

  • 他认得出我吗?有名字、有账号、有脸——身份可识别,"下次"才有对象。匿名的场子里 w 事实上等于 0公认(这是 s2 三条前提之一)。
  • 真的有下次吗?不是"应该还会再见",是他需不需要我。一次性成交、你无法再影响他的任何收益的场景,就没有下次。
  • 记录会跟着他走吗?今天的评分、口碑、行业名单就是记录。记录让一段关系延长成一串关系——这正是 s8 讲的机制。
  • 这段关系对他值多少钱?同一个卖家,对游客和对本小区熟客的估值完全不同。他未来的收入越依赖你这类客户,他越不敢占你便宜。

怎么用:四个里有两个以上为"否",就把这当成一锤子买卖来谈——不是变成坏人,是别把信任预先交出去,改用可核查的东西代替(担保、第三方、先小单、货到付款)。四个都为"是",那先伸手是划算的,因为报复机制真的能生效。

什么时候失效:关系长但权力极不对称时。你离不开他、他随时可以换掉你,那么"下次见面"对他的约束远小于对你的约束——这是 《考什么就得到什么》那条线管的事:长期关系不自动等于公平关系。

工具二:把"我会还手"和"我肯翻篇"都写成明码

多数人只做了其中一半:要么从不说明底线(然后被反复越线),要么只会放狠话(然后一次冲突就把关系打死)。本页的模拟给的读数很直接——零噪音时最狠的报复能活,有噪音时最先死的就是它。

  • 报复要一次性、按比例、说得出理由。"你上次那样,我这次不做这部分"是可激怒;"你既然这样,我们从此完了"是冷酷策略,它在误会不可避免的真实世界里,会把一段还能用的关系白白烧掉。
  • 原谅要有明确触发条件,而且不要迟到。对方回到合作,你下一轮就回到合作——拖延的宽恕等于额外的惩罚,对手读不懂就会继续防备(清晰那条性质的作用)。
  • 把规则讲得能被第三人转述。检验办法很简单:能不能用一句话向别人说清"他什么情况下会翻脸、什么情况下会收手"。说不清,对方就只能按最坏情况防你。

什么时候失效:对方读不懂你的规则,或者你的成本结构不允许你承担一轮被占便宜(第一次合作失败就会致命损失的人,被迫先背叛)。本页讲的是重复博弈里的一般情形,经不起一次性巨大损失的场景——那条边界写在 s9 第一张卡。

工具三:认出一个市场裸不裸

把本页和《柠檬市场》合成一个更快的判据。看任何交易场景,先问三件东西在不在场:

在场的东西它把什么改写了不在场时你会看到什么
身份(谁都能被指认)让"下次"有对象匿名平台上的低价低质、群租楼道里的垃圾
记录(跟着人走)把一段关系延长成一串景区一次性的宰客、二手市场只谈价格不谈人
可执行的报复(第三方或声誉)让背叛有确定成本没人管的公共资源先烂(公地页那条链)

三件全缺,是裸市场——这时候讲诚信没有用,要改结构:把身份钉上、把记录接上、把惩罚交给一个真的会动的东西。三件都在,别去破坏它(在长期关系里为了省一点小钱而失信,是本页最亏的一种算账)。推断(这个三问表是本页把两页机制合起来的一个用法,不是文献现成框架)

一页话版:把关系拉长、把身份钉牢、把反应做短而清楚、把原谅留出通道——这四件事都不需要好人存在,也不需要谁相信谁,合作就能自己长出来。反过来,任何一个场子里如果你看见大家都在互相防着、谁都不肯先伸手,多半不是这里的人坏,是这四件里少了两件。

十句话

  1. 在只做一次的买卖里,坑人是数学上的最优解;把坏人换成圣人也不改变结局,要改的是关系长度。
  2. 合作的条件可以写成一个小数:这段关系还要延续的概率 w。支付表用 5 / 3 / 1 / 0 时,靠"一次背叛永久拉黑"撑住合作要 w ≥ 1/2,靠"以牙还牙"撑要 w ≥ 2/3。
  3. 但临界线只回答"两个人能不能合作",不回答"一群策略里谁活得最好"——关系短的时候,越了线的两个人照样被永远背叛吃掉。
  4. 以牙还牙之所以出名,不是因为它聪明,是因为它同时满足四条性质:善良、可激怒、宽容、清晰。
  5. 赢的从来不是最聪明的策略,是最容易被别人看懂的策略;读不懂的规则,只会让对方提前防你。
  6. 真实世界一定有误会——手滑、看错、传话走样。零误会的世界里最狠的报复最占便宜,有误会的世界里它最先绝迹。
  7. 所以"宽容"不是道德加分项,是一个工程参数:调到 0 就成了冷酷策略,推到六成等于宣布"打我不用付钱",本页模拟里最有用的一段在一成到四分之一之间。
  8. 合作不需要一个皇帝,它需要三件东西:身份认得出、记录跟着人走、背叛有确定成本。三件全缺的市场就是裸市场,那里讲诚信没用,得改结构。
  9. 谁能赢取决于跟谁一起打:场上留着无偿可吃的对象,背叛的地板就被人抬着;善良堆在一起,先出局的是不肯原谅那一个。
  10. 判断一个人值不值得先伸手,别先问品德,问两件事:他跟你还有多少次见面,他未来的收入依不依赖你这一类人。

来源与免责

一、机制与锦标赛(原始文献)

  • Axelrod, R. & Hamilton, W. D.(1981)"The Evolution of Cooperation",Science 211(4489): 1390–1396,1981-03-27,DOI 10.1126/science.7466396。公认(Crossref / OpenAlex / PubMed 三源一致;常见的"211: 1396–1399""12 月"两写法均错)
  • Axelrod, R.(1980a)"Effective Choice in the Prisoner's Dilemma",Journal of Conflict Resolution 24(1): 3–25;(1980b)"More Effective Choice in the Prisoner's Dilemma",同刊 24(3): 379–403公认
  • Axelrod, R.(1984)The Evolution of Cooperation,Basic Books(纽约)公认。所谓"2009 修订版"本轮无源,不写存疑
  • Axelrod, R.(2012)锦标赛发起经过的自述,Journal of Theoretical Biology 299: 21–24,DOI 10.1016/j.jtbi.2011.04.015公认
  • Axelrod, R. & Keohane, R. O.(1985)"Achieving Cooperation under Anarchy: Strategies and Institutions",World Politics,pp. 226–254("未来阴影"的定名处);1986 年收入 Cooperation under Anarchy,Princeton University Press。⚠ 两个书目给的页末不同(226–254 / 226–260),并存存疑
  • Rapoport, A., Seale, D. A. & Colman, A. M.(2015)"Is Tit-for-Tat the Answer? On the Conclusions Drawn from Axelrod's Tournaments",PLoS ONE 10(7): e0134128——支付表、两届冠军、首届 1979 年发起、第二届 63 个程序、计分方式敏感性,本页赛事数字主要取自此处公认
  • PLoS Computational Biology(2024)关于 iterated PD 胜者策略的重跑研究(PMC11670945):与 PLoS ONE 2015 共同支撑 5/3/1/0 与"两届均由 TFT 胜"公认
  • 2004 年 20 周年纪念赛加了随机噪音(Kendall 等的记录);该届冠军本轮未核到,"噪音下以牙还牙又赢"这句流行话不采纳存疑

二、噪音、演化与声誉的理论文献

  • Nowak, M. & Sigmund, K.(1993)"A strategy of win-stay, lose-shift that outperforms tit-for-tat in the Prisoner's Dilemma game",Nature 364(6432): 56–58,DOI 10.1038/364056a0公认(常见的 45–47 页码是错的)
  • Imhof, M., Fudenberg, D. & Nowak, M.(2007)"Tit-for-tat or win-stay, lose-shift?",Journal of Theoretical Biology 247(3): 574–580——带噪音演化过程里的收益临界值,以及"以牙还牙从未被选中"公认
  • Stewart, A. & Plotkin, J.(2013)PNAS 110(38): 15348–15353,慷慨型策略"原谅背叛者却在演化种群中支配"公认
  • Press, W. & Dyson, F.(2012)"Iterated Prisoner's Dilemma contains strategies that dominate any evolutionary opponent",PNAS 109(26): 10409–10413公认(网络流传的"Z-Extortion"标题是扩展摘要名,不是正式篇名)
  • Nowak, M. & Sigmund, K.(1998)"Evolution of indirect reciprocity by image scoring",Nature 393: 573–577公认(期号 Crossref 记 6685,未取第二源)
  • Kreps, D., Milgrom, P., Roberts, J. & Wilson, R.(1982)"Rational cooperation in the finitely repeated prisoner's dilemma",Journal of Economic Theory 27(2): 245–252公认
  • Andreoni, J. & Miller, J.(1993)声誉假说的实验检验,Economic Journal 103(418): 570 起公认("末期背叛率接近 100%"那类百分比只取到单源,本页不写)

三、惩罚与合作的实证

  • Fehr, E. & Gächter, S.(2000)"Cooperation and Punishment in Public Goods Experiments",American Economic Review 90(4): 980–994(常见的 90(3): 666–679 是错的卷期)公认。具体百分比与惩罚成本本轮在原文表格外,本页只作定性引用存疑
  • Herrmann, B., Thöni, C. & Gächter, S.(2008)"Antisocial Punishment Across Societies",Science 319(5868): 1362–1367,16 个被试池公认(另一常见写法"…is common and costly"是串忆)
  • Blake, P. R., Rand, D., Tingley, D. & Warneken, F.(2015)Scientific Reports 5: 14559,固定同伴 vs 随机换陌生人的儿童实验;条件合作率 44.9% / 27.4%(N=64,1790 次决策)公认
  • Efferson, M., Bernhard, H., Fischbacher, U. & Fehr, E.(2024)Nature 626(8001): 1034–1041,与外部的反复竞争史 × 制度对群体内合作的超可加效应公认

四、自然与历史现场

  • Wilkinson, G. S.(1984)"Reciprocal food sharing in the vampire bat",Nature 308(5955): 181–184,DOI 10.1038/308181a0;同作者的 Food sharing in vampire bats 是 1990 年 Scientific American 262(2): 76–82 的科普复述版,两者常被混引公认
  • Carter, G. & Wilkinson, G.(2013)Proc. R. Soc. B 280: 20122573(受控喂食实验那篇)——"曾收到食物"对"是否给出食物"的预测权重是亲缘度的 8.5 倍;实验中的分享全部发生在同宿率 >60% 的配对之间公认
  • Bshary, R. & Schaefer, J. F.(2002)"Choosy reef fish select cleaner fish that provide high-quality service",Animal Behaviour 63(3): 557–564(网上常误记为 Proc. R. Soc. B)公认。该文的具体百分比未取到原文,本页只作定性引用
  • Milgrom, P., North, D. & Weingast, B.(1990)"The Role of Institutions in the Revival of Trade: The Law Merchant, Private Judges, and the Champagne Fairs",Economics & Politics 2(1): 1–23公认
  • Greif, A.(1993)American Economic Review 83(3): 525–548(马格里布商人联盟);反驳见 Edwards, J. & Ogilvie, S.(2011)Economic History Review 65(2): 421–444公认——本页只把该案例列为"有争议"
  • Bernstein, L.(1992)Journal of Legal Studies 21(1): 115–157,钻石行业的法外合同关系公认("口头合同占比 X%"一类数字只取到自媒体级来源,不采纳)
  • 香槟集市规模与次数(四镇六集、每次约六周/另说最长 49 天、1314 年香槟并入法国王冠后衰落)据 Encyclopædia Britannica 1911「Champagne」条 与 World History Encyclopedia(Cartwright, 2022)两源;时长两说并存公认
  • 五人组连保制度:成文法条见 Vaporis, C. N.(编译,2018)Voices of Early Modern Japan,Routledge,"Self-Governance in Villages: Goningumi (Five-Household Group) Laws (1640)",pp. 85–88公认。⚠ 库里《读空气》页写的时间窗是 1649—1888,两处不同源、并存待回查(s7 口径卡)
  • 一战西线"自己活、也让别人活"的非正式停火:史料一般归于战壕史研究者 Ashworth 的著作,但该书出版年与出版社本轮未能核实;停火发生在 1914 年 12 月 24—26 日、由士兵自发、事后被严令禁止,方向上有两源一致;"约十万英德士兵""至少半个英军正面""其间踢了几场足球赛"这三条都不达标——前两条只取到单一来源,第三条与德国联邦博物馆(Deutschlandmuseum)的结论直接冲突,该馆认为"是否真有过一场足球赛并不清楚"存疑

五、声誉系统的实证

  • Resnick, P. & Zeckhauser, R.(2002)"Trust among Strangers in Internet Transactions: Empirical Analysis of eBay's Reputation System",Advances in Applied Microeconomics 11: 127–157,DOI 10.1016/S0278-0984(02)11030-3公认。⚠ 网传篇名"Knockin' on Heaven's Door"不存在;出版年份两个书目库打架(2002 / 2004),以卷号 11 为准存疑
  • Melnik, M. & Alm, J.(2002)"Does a Seller's eCommerce Reputation Matter? Evidence from eBay Auctions",Journal of Industrial Economics 50(3): 337–349推断(出版社摘要口径,未取原文表格)
  • Houser, D. & Wooders, J.(2006)Journal of Economics & Management Strategy 15(2): 353–369:只有卖家声誉显著影响成交价公认
  • Resnick, P., Zeckhauser, R., Swanson, J. & Lockwood, K.(2006)Experimental Economics 9(2): 79–101,声誉价值的受控实验(具体溢价百分比仍需原文,本页未用)

六、本轮查不到第二源、因此不写进正文的说法

  • "每对策略打 1200 轮"(与 PLoS ONE 所记 200 轮并存,原文不可达);"以牙还牙只有四行代码";"第三届加噪音后以牙还牙又夺冠";"噪音率超过某阈值 TFT 即输";Fehr-Gächter 的具体百分比;"末期背叛近 100%";Yelp"一星等于 5%–9% 营收";"犹太人做九成钻石生意";吸血蝙蝠"一晚不吃就死/70 小时饿死/吸一半体重血";中译本的出版社与译者信息。

免责

本页所有结构性解释只是在本库口径下的一种读法,不是学界定论。对普通人有什么用是本库的使用建议,不是学界共识。

三处必须单独声明的口径:① s5 那台模拟的所有读数都是本页自制模型的实测(策略集、每对局数、复制子动力学参数全是本页设定),它能复现这一族机制的定性结论,不能当文献证据引用;② s2 那两个临界值(1/2、2/3)是给定支付表之后的代数结果,不是某本书里的引文,本轮也没有找到直接给出这两个数的可引页面;③ 本页不评价任何具体个人、群体、民族"会不会合作",跨文化比较一律降档标注,理由写在 s0 的"本页不写什么"。