ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

动态博弈中的威胁与承诺:从逆向归纳到可信机制

动态博弈中的威胁与承诺:从逆向归纳到可信机制 1. 跨过静态博弈这道坎动态博弈到底新在哪里学博弈论的人最初接触的大多是静态博弈比如囚徒困境两个人同时决定是否坦白大家一次性出招然后结算收益。这种模型当然有用但它有一个非常反直觉的隐含假设——所有人都在同一时刻做决策而且做完就结束了。可在现实里几乎没有任何重要决策是一次性同时完成的。商业谈判是来回谈的你今天报价我明天还价你再根据我的反应调整策略职场博弈也一样你先观望领导的态度再决定要不要承担某项任务领导也会根据你的表现调整下一步安排。真正的高手从来不是根据对手现在会怎么做来决策而是根据对手在看了我的行动之后会怎么做来决策。这就是动态博弈的核心。所谓动态博弈指的是参与人的行动有先后顺序后行动者能观察到先行动者的选择并据此调整自己的策略而先行动者在做决策时也必须把这种对方的反应纳入考量。我当初刚学到这个概念时脑子里最大的困惑是这不就是把出招顺序从同时改成先后吗能有本质区别有而且区别非常大。因为在同时行动的静态博弈里大家拼的是对局势的判断和对对手预期的猜测而在动态博弈里第一步就被切割成了两个完全不同的决策维度——你不仅要考虑自己这一步怎么走还要预判自己这一步会引发对手的什么反应而这个反应又反过来决定你这一步应不应该走。整个决策逻辑从一次性利益计算变成了多阶段利益推演。更关键的是动态博弈把博弈论中一个非常尴尬的问题摆到了台面上很多人说要报复、要惩罚、要合作但这些话往往是不用付出成本的。嘴上说说谁都会问题在于——当真正该惩罚对方的时候惩罚者自己也要付出代价那他还会不会兑现自己的威胁这个问题静态博弈基本不讨论因为它模型中就没有说话这个环节。动态博弈必须直面它。经典的连锁店博弈、进入阻止博弈全都是围绕威胁与承诺的可信性展开的。这也是动态博弈的入门学习中最硬核、最有意思的一块内容。这篇文章我会顺着自己的学习笔记把这块内容分四步捋清楚先讲动态博弈的基本分析工具——逆向归纳再讲威胁为什么往往不可信然后讲承诺如何把不可信的威胁变成可信的最后用几个经典场景把这些工具串起来。如果你是零基础放心往下看我会尽量用大白话和具体例子讲不堆公式。2. 逆向归纳先看结局再决定开头的招2.1 倒着推顺着想——动态博弈的核心分析方法动态博弈最常见的表达方式是博弈树也就是把所有可能的行动顺序、决策节点和收益结果画成一棵倒着长的树。根在顶枝叶朝下每个分支结点是一个决策节点每条边是一个行动选择最底部的叶子是最终收益。分析博弈树最有效的工具叫做逆向归纳法。思路极其简单从博弈树的最后一个决策节点开始看看在这个节点做决策的那个人会选择哪些行动把这个选择的结果带上往前推一个节点再看前一个节点的人会怎么选择以此类推一路推到根节点的初始决策。这个方法的道理说穿了就是一句话**如果所有人都是理性的那么每个人在决策时都会选择让自己收益最大的行动。**既然最后决策的人一定会选对自己最有利的选项那这个选项就是确定的前一个人在做决策时就知道如果自己选择某个行动后面会发生什么。这样一步步倒推最终博弈的结果就确定了。我来举个例子。现在有一件古董要拍卖有两个买家你和一个对手。规则有点特别不是价高者得而是轮流报价——你先出价对手看到你的报价后决定跟不跟。如果你出10万对手选择接受那就按10万成交你们两人各有2万利润如果对手选择拒绝那他必须以一个固定的高价买下古董自己亏1万而你也同样亏1万。博弈树看起来是这样的你报价——对手接受/拒绝——结算。从后往前分析最后一个决策节点是对手决定是否接受你的报价10万。理性人当然是接受因为接受赚2万拒绝亏1万。所以当你站在自己的决策节点上时你心里很清楚只要报价10万对手就一定会接受自己到手2万。如果你报价20万呢对手依然会接受因为接受赚1万拒绝还是亏1万。但对你来说报价10万比报价20万更好。于是逆向归纳得出的均衡结果就是你报价10万对手接受双方各得2万。这游戏的妙处在于你根本没有必要替对手担心。对手的决策一定是理性的你只要预判理性结果就好。逆向归纳本质上就是把我将会怎么做、对手将会怎么做这种循环往复的猜测问题转化成了从终点倒推的直线问题破除了动态博弈中的无限套娃困境。2.2 逆推的前提共同知识与理性假设逆向归纳法虽然简单但它的有效性建立在一个隐藏前提上共同知识。这个词的意思是不仅我自己知道某个信息我也知道对手知道某个信息我还知道对手知道我知道某个信息如此无穷递归。放在刚才那个例子里就是我知道对手是理性的对手知道我知道他是理性的我也知道对手知道我知道他是理性的……只有在信息完全透明、大家的理性水平都处于同一层次时逆向归纳结果才是必然的。为什么非要提这个因为在现实博弈中对手不够理性本身就是一种变数。见过不少人打牌的时候明明算不清概率就瞎跟牌但恰恰因为他的乱来你基于理性推理的防守策略反而会被破解。这种情况叫做打破共同知识假设在实际谈判、竞标中经常发生。所以我在学习笔记里给自己特别标注了一句话逆向归纳是一种规范性的分析方法它告诉我们的是如果参与双方都足够理性结果应该是什么但如果对手不按套路出牌这套方法就要打折扣。这也是后文讨论威胁和承诺时一个非常关键的伏笔——很多威胁之所以不可信恰恰是因为兑现威胁对威胁者自己不利哪怕这个不利只建立在理性计算的框架内。3. 威胁的本质有些话说出来就是为了吓唬人3.1 空威胁我说要惩罚你但我真的不想罚动态博弈中最常见的现象就是参与者口头提出威胁。所谓威胁简单说就是如果你采取A行动我就会采取B行动而B行动会对你不利。问题来了当你在图书馆大声讲电话邻桌的人说你再吵我就去找管理员评理。这是一个威胁。但如果代价是他自己必须中断学习、走一段路去办公室排队而他又是一个特别怕麻烦的人那么这个威胁可信吗理性的你只需要思考一个问题他提出威胁之后如果我真的继续打电话他会不会真的去找管理员这个问题的答案取决于对他而言去找管理员的成本是否高于他忍受噪音的成本如果找管理员会让他损失一个小时的学习时间而忍受噪音只是损失十分钟的专注那么他嘴上说的威胁实际上是在撒谎——他根本不会去。这就是空威胁。它是动态博弈里最典型的骗术**威胁者故意宣称自己会采取某种行动但这个行动如果真的执行会对威胁者自己造成更大的伤害因此理性人绝不会真的执行。**听的人只要稍微动脑子算一下对方的成本收益就能轻易识破这种威胁是空的。但有意思的是空威胁尽管是假的在现实中却经常奏效。原因在于被威胁者往往不会仔细去算威胁者兑现威胁的代价。听到你再这样我就报警你再涨价我就换供应商很多人的第一反应是害怕后果而不是评估对方是否承担得起后果。所以博弈论教导我们面对威胁的第一反应不是问他能不能这样做而是问他这样做的成本对他自己来说有多大。3.2 鸡生蛋式的警察与小偷博弈举一个更贴近学习场景的例子吧。假设一个房间里有两个学生甲想要睡觉乙想要开灯学习。甲对乙说你要是开灯我就砸了你的台灯。从纯粹物理上看甲完全有能力砸台灯。但从博弈论的角度看这个威胁可信吗要看砸台灯的后果。如果砸了台灯甲确实可以开灯睡觉了——但也必须赔偿乙一盏新台灯还要背上一个暴力分子的名声可能面临处分。算下来砸台灯的代价远大于开灯睡觉的舒适感。所以甲说这句话纯属吓唬。乙应该怎么应对这个威胁很简单——无视它直接开灯。因为在甲的理性计算里乙开灯之后甲的最优反应是忍着而不是砸台灯。既然砸台灯不是一个理性人会做的选择那它就只是一个空威胁。这个例子虽然简单但它把威胁问题讲到了一个非常核心的位置**威胁是否可信不取决于威胁者是否足够凶残或者态度是否足够强硬而取决于威胁兑现之后威胁者自己的得失。**态度只是表象成本结构才是本质。很多人误以为吼得越凶的人威胁越可信。博弈论恰恰告诉我们吼得越凶的人往往是因为他知道自己不可能真的兑现所以才需要在语言上反复强调。真正可信的威胁者不需要吼——因为一旦对手知道他有能力且有意愿兑现警告一次就够了。3.3 为什么空威胁依然会被提出来如果空威胁如此容易被识破为什么大家还是乐此不疲地使用原因在于信息不对称。威胁者对自己是否真的会兑现的意图往往比被威胁者更清楚。威胁者知道这个威胁是空的但被威胁者并不一定知道。如果被威胁者是一个风险厌恶型的人——也就是特别害怕坏结果、宁可信其有的人——那么空威胁依然能奏效。这在谈判里非常常见。供应商A对采购方说你要是坚持压价我就停掉给你供应的关键原料。实际上停掉这个客户的单子对供应商的损失可能远远大于压价带来的损失但这个威胁仍可能让采购方犹豫万一对方是真的呢万一停供了我的产线要停摆损失更大。采购方面对这个威胁时假如他能准确判断供应商的成本结构他就能断定这只是虚张声势但如果采购方做不到这一点他就必须权衡压价的收益和供应商万一真的停供的风险。多数人在这种权衡里会倾向吃亏因为他们对不确定性的恐惧往往压过对确定收益的追求。这也给出了一个重要的实操建议识别空威胁的唯一可靠方法就是尽可能掌握对方的成本信息和收益结构。谈判桌上谁掌握的信息更多谁就能更准确地判断对方的话是真是假。反过来如果你自己想提升威胁的可信度就得在成本结构上下功夫——这就是下一章要说的承诺机制。4. 承诺的本质把退路堵死让威胁不得不兑现4.1 可信威胁的心理基础让别人相信你会做空威胁是口头说说可信威胁则是行动派。要让一个威胁可信最直接的办法是**在威胁提出的时候主动剥夺自己选择不兑现的自由。**一旦你让自己处于如果对方采取了某个行动我就不得不兑现威胁的处境那么这个威胁就从空话变成了可信承诺。这个逻辑用一句话总结叫破釜沉舟。当年项羽过江后砸掉锅、凿沉船士兵们知道退路没了唯一的生路就是打赢于是战斗力激增。项羽的这个行动本质上就是在向自己的队伍传递一个可信承诺我不会撤退我会死战到底。他的士兵相信他不是因为他说了什么而是因为他的行为让撤退这个选项从物理上消失了。在商业博弈里也有一个非常经典的例子一个创业者放出话来说自己一定要把产品做到行业第一。单说这句话所有人都会把它当作空喊口号。但如果创业者紧接着做了一系列不可逆的投资——卖掉房子、签下对赌协议、拒绝所有收购意向——那么大家对他的承诺就多了一层信任。因为此时如果真的半途而废他面临的损失会远超坚持到底的成本。4.2 博弈论里的经典可信承诺模型如果我们把一个动态博弈里的威胁和承诺用树形图画出来整个逻辑会变得非常清晰。假设一个市场里有一个垄断者A和一家想要进入这个市场的潜在进入者B。博弈顺序是这样的B先决定进入还是不进入如果B选择不进入那么B有2万利润A有8万利润这就是现状如果B选择进入那么由A来应对A可以选择合作维持高价两家共享利润或者打击压低价格自己亏1万B也亏1万甚至更多。这个博弈如果只用静态的理性人逻辑来分析结果很简单B进入之后A的最优反应是合作——毕竟合作自己赚4万打击自己亏1万。既然B知道A一定合作B就会选择进入。最终均衡是B进入、A合作。但现实里我们经常看到另一种局面面对新进入者既有的垄断者不惜亏本也要打价格战。为什么会这样答案是垄断者在这个单次博弈里的收益是亏1万但在一个更长期的博弈里他的收益还包括被市场上其他潜在进入者看到自己会打击的声誉。也就是说垄断者打的不是这一仗而是一个多阶段博弈中的第一场战役。当他决定无论谁来进来我都会打击的时候他就等于向所有潜在进入者发布了一个威胁敢来我会不计成本地报复。问题来了这个威胁为什么可信在单次博弈里它不可信因为理性A会选择合作。但在重复博弈的背景下A可以通过一系列不可逆的行动来提升威胁的可信度——比如公开宣称三年内不接受任何合作谈判或者把自己的利润目标压到行业最低水平或者投入大量产能建设向市场释放我有能力亏得更久的信号。这些行动的共同点是让A在兑现打击和不兑现打击之间的成本对比发生变化。原本不兑现打击是理性的但如果A已经公开宣称绝不合作、已经投入了海量沉没成本、已经把自己的后路封死那么他如果不兑现威胁他损失的不只是钱还有整个声誉以及未来几十年在这个市场上的话语权。到这一步兑现打击反而成了他更理性的选择。4.3 承诺的形式与常见误区综合来看常见的可信承诺形式有四种单向不可逆投入投钱投设备投时间让自己无法轻易抽身逼迫自己必须把事情做完。军事上的破釜沉舟、商业上的提前建好产能都属此类。合约化承诺通过法律合同约束自己。比如对赌协议、违约金条款、公开承诺书。一旦违约损失由第三方强制实现。声誉抵押对自己的名誉下注。公开立誓就是这个逻辑——如果说了不做到声誉受损这个代价比坚持承诺更大。分步承诺把大承诺拆成小步骤逐次兑现。每兑现一步就相当于向对手提交一份证据让下一步承诺的可信度水涨船高。这里有个常见误区很多人以为承诺就是说得更狠、态度更坚决。其实不是。语言层面的强硬不构成承诺因为语言是零成本的。真正有效的承诺必须付出实实在在的沉没成本让对方看到你若不兑现你会有真实损失。打个比方如果有人对你说我发誓明天早上一定早起骗你是小狗你不会太当真的因为说这话的成本为零。但如果这人请了一个教练每天早上6点准时视频打卡而且已经预付了3000元押金迟到一次扣500你才会真正相信他会早起。制造可信承诺的最底层逻辑就是花一笔不可收回的钱逼自己兑现未来某个行为。5. 把威胁与承诺放进真实场景里几种典型博弈局5.1 进入阻止博弈的商业版本把第四章的进入阻止博弈放到一个具体背景里你会看得更明白。假设你经营一家本地咖啡馆月利润2万元。最近有人打算在旁边开一家新的网红咖啡馆。你的第一反应是想威胁对方你要是开我就搞低价团购、买一送一让你血本无归。问题在于这个威胁可信吗对方只要算一笔账就明白如果对方真的开店你真的搞三天低价团购你的损失可能比新店还大——因为你是老店固定成本高、客源稳定没必要自损八百。于是对方判断你的威胁是空的照样开店。这就是典型的空威胁 理性进入者结局。但假如你的威胁足够可信呢怎么做比如你提前和房东签了一份店铺月流水低于某一数额就要收回场地的对赌协议如果你真的打价格战导致收入暴跌房东有权收回店铺这个风险对你足够大但反过来也让对方相信你宁可拼个鱼死网破也要把你赶走。这时候对方就要重新评估进入的风险了。你的威胁因为多了这份自杀承诺而变得可信新进入者可能就真的打消了念头。这个案例说明一个博弈论中很深刻的道理:**有时候故意让自己陷入险境反而是威慑对手的最佳方式而不是尽力让自己保持安全。**一个永远不会受伤的人说我要和你拼命是没人信的只有当你把自己的安全绳剪断站在悬崖边上对他说你现在再靠近一步我们一起下去他才会真正停下脚步。5.2 生活中的讨价还价分蛋糕的先后手策略动态博弈在生活中最常见的场景是讨价还价中的最后通牒游戏。规则很简单给你和另一个人100元钱由你先提出分配方案对方选择接受或不接受。如果接受按你的方案分如果不接受双方都拿不到钱游戏结束。理性分析是这样的只要你还给对方的钱超过0元对方都应该接受——因为接受至少能拿到一块钱拒绝则是一毛没有。所以你的最优策略是给对方1元自己拿99元。但现实中绝大多数人宁可自己拿不到钱也会拒绝99:1这种极度不公平的分配。这就是为什么纯粹的理论模型与现实行为总是有偏差——因为博弈论假设只考虑物质收益而真实的人还会考虑公平、情绪和面子。如果把这个游戏扩展到两轮谈判那就是标准的动态博弈了。对方拒绝你的分配后还可以对你反向出价但钱会缩水比如第一轮100元、第二轮只剩50元。用逆向归纳法分析第二轮的决策者这时轮到你出价会尽量把大头留给自己只给对方留很少对方预见到这一点就会在第一轮接受一个他还能接受的方案而不是等到第二轮被压得更狠。这类博弈在商业谈判中极其常见采购方说你这价格不降我就不签单但实际上如果拖到下个月供应商的库存成本更高。双方都在利用对时间成本和机会成本的计算来调整自己的出价空间。谁的后手更充足、谁更能承受僵局谁就能在动态博弈中占据优势。5.3 为什么有些人在谈判中故意不留退路我在学习这块内容时最感叹的一个实际应用是谈判中的故意不留退路策略。想象两个小公司谈合并A公司非常想要B公司的技术团队B公司也不是非卖不可。如果A表现得太急切B就会知道A急于成交于是开高价如果A表现得很冷淡B可能觉得算了不卖了。A的正解是什么是让B相信A并不只有一个选择——A完全可以把同样的钱投到其他地方甚至扶植B的竞争对手。这就是备选方案的力量。在博弈论里有一个专有概念叫 BATNABest Alternative To a Negotiated Agreement谈判协议的最佳替代方案。动态博弈中BATNA的作用本质上是改变威胁的可信度。如果A有一个强有力的备选方案那么A说你价再高我就不谈了就不再是空威胁因为A真的有一条退路。而B知道这一点之后他的定价空间就被压缩了。反之如果A没有任何备选方案说出我不谈了就完全不可信——B笃定A一定会回来。所以实操层面的启发是在进入任何长期谈判之前先把自己的退路建好。备选方案的存在本身就是你手里最有威慑力的一张牌。6. 学习动态博弈时的三个认知陷阱与突破方法6.1 陷阱一把静态均衡直接搬到动态博弈里初学动态博弈最容易犯的一个错误是习惯性地用静态博弈的思维方式来理解动态博弈。比如在进入阻止博弈中很多人第一反应是进入者知道在位者最优选择是合作所以进入者一定会进入。这个推理本身没错但它低估了动态博弈里行动的顺序和信息的传递带来的影响。在动态博弈中先行动者的选择本身就在传递信息——它不仅仅是当下收益的计算结果还是对后行动者的一个信号。先行动者打击后来的入侵者表面上亏了钱但他传递出的信号是我会对每一个入侵者进行打击。这个信号本身就有价值它能改变市场的预期从而减少未来挑衅的次数。突破的方法遇到任何一个动态博弈问题时先画博弈树把行动的先后次序和每个节点上的决策者掌握的信息都标出来然后再用逆向归纳法倒推。只要坚持这个习惯你的思考就会自然从静态切换到动态。6.2 陷阱二忽视承诺的成本问题很多人理解了承诺要可信就要产生沉没成本之后容易走向另一个极端无论什么场合都觉得只有花大钱才能证明承诺。但现实的要点在于承诺的成本应该是有针对性的不是越大越好。你的承诺成本对应的是对手心里的不确定性。如果对手对你的决心本来就比较相信你只需要一个小的承诺动作来推一把如果对手完全不信你你可能需要投入更多的沉没成本来改变他的预期。投入太多你浪费了资源投入太少你又无法有效传递信号。判断该投入多少的关键是准确评估对方的识别能力。如果对方是一个经验丰富的谈判者那么小打小闹的承诺根本没用他一眼就能看穿你需要实实在在的东西来证明如果对方是一个新手你只需要做出一个简单的姿态可能就足够了。承诺是信号传递工具不是越大越好的炫富游戏。6.3 陷阱三低估声誉作为长期承诺工具的价值最后一个常见误区是只把承诺看作一次性博弈里的工具忽略了声誉在重复博弈中的作用。声誉本质上是一个多阶段承诺机制。一个人如果一直信守承诺他的声誉价值会积累一旦他背弃承诺声誉会在瞬间归零。因此在重复博弈中声誉本身会反过来约束当事人的行为让他不得不兑现承诺。我们经常说名声比钱重要在博弈论里这句话是有严格含义的——声誉是一种跨时期的长期资产它的存在会改变一个人在当前阶段的策略选择。我自己的体会是理解声誉的承诺价值会帮助你在很多生活决策中做出看似吃亏、实则聪明的选择。比如在团队合作中偶尔多干一点活、拒绝占小便宜短期看你是亏的但这些行为会积累你讲诚信、不计较的声誉。未来当你在团队中需要别人配合时你的声誉就会成为你最具号召力的动态博弈筹码让合作方相信你的承诺必然兑现。6.4 一点学习上的实操建议如果你和我一样是非数学背景的博弈论自学者建议按顺序做三件事第一把所有经典的动态博弈模型进入阻止、连锁店、最后通牒、蜈蚣博弈都手画一遍博弈树。画树的过程就是强制自己理解顺序和信息传递的过程比读十遍文字都管用。第二每学完一个模型找一个现实场景去套用。我个人的方法是看商业新闻时主动翻译——把新闻里的企业竞争行为抽象成博弈树用逆向归纳法倒推一遍各方的理性策略。一开始会很吃力但坚持两周之后你会发现自己对商业谈判、竞争策略的理解力明显上升。第三记录自己的判断错误。学博弈论最深的体会不是猜对了别人的选择而是发现自己曾经在哪个场景里因为错误判断而吃了亏。把这些场景记下来复盘当时的信息和成本结构这种反思比做一百道练习题更有效。这套学习笔记写到这里动态博弈、威胁与承诺的三层逻辑基本串起来了动态博弈提供了行动有先后、决策需预判的分析框架威胁是博弈者口头或行动层面的策略工具但空威胁的泛滥让话变得廉价承诺则通过制造沉没成本、捆绑声誉、斩断退路的机制把廉价的语言变成可信的信号。理解这三者的关系不只是一个学术游戏它在谈判桌上、职场合作里、哪怕是家庭沟通中都能派上实实在在的用场。下一篇笔记我准备深入到不完全信息博弈也就是当大家互相不知道对方的底牌时博弈又会发生什么有趣的变化。
返回列表