ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

动态博弈中的威胁与承诺:可信性如何决定博弈胜负

动态博弈中的威胁与承诺:可信性如何决定博弈胜负 这篇文章不是我编的是我从去年到今年断断续续啃博弈论时整理的第四篇笔记。前面几篇聊完了完全信息静态博弈、混合策略、纳什均衡这些基础概念这次终于进入更贴近真实世界的一个版块动态博弈、威胁与承诺。老实说走到这一章我才觉得博弈论真正“活”了因为静态模型里大家同时出招跟现实中你来我往、互相观望的局面差别很大。生活中几乎所有重要决策都不是一锤子买卖而是我先出招、你再回应、我再调整每一步都在影响后面的结果。而动态博弈里最耐人寻味的不是“谁先走谁后走”而是那些“我说到做到”和“我其实是吓唬你”的话术与机制。这篇笔记适合已经掌握基本纳什均衡概念、想进一步理解动态博弈的读者也适合那些在实际谈判、定价、合作管理里反复遇到“对方说的话到底能不能信”这类问题的人。我会用三个经典模型做骨架把威胁、承诺、可信性这三个词彻底拆清楚再穿插一些我学习时踩过的坑和对现实案例的思考。1. 动态博弈先来后到本身就是信息1.1 为什么静态模型不够用静态博弈也就是参与人同时做出选择的模型适合描述那种“开牌定输赢”的局面比如投标竞价、猜拳选边、同时报价的拍卖。但真实世界里更多场景是动态的我先涨价你看反应再决定跟不跟我先投个广告你再考虑要不要打价格战我先把生米煮成熟饭你再来看怎么善后。你的行动发生在我之后而且你能看到我做了什么这种先后顺序和信息反馈就是动态博弈和静态博弈最本质的差别。这个差别特别重要因为它直接改变了一个东西策略的含义。在静态博弈里一个策略就是一个“行动选择”你选A、我选B两边同时亮牌就完事了。但在动态博弈里策略变成了“完整的行动预案”什么情况下我出什么牌、看到对方前一步怎么走、我下一步怎么应对。用教材上的话说策略是“相机行事”的完整地图而不是某一个孤立的动作。一开始我对这个概念非常绕。后来用一个生活化的例子给想通了下棋。你下第一步的时候脑子里必须装着“如果对方走马我就出车如果对方飞象我就挺兵”这一整套应对方案而不是单纯地“下一步棋”。换句话说动态博弈里的策略不是单个动作的集合而是一个“如果那么”的完整决策树。理解这一点是进入动态博弈的门槛。1.2 博弈树和子博弈把未来画成图动态博弈最常用的工具是博弈树也叫扩展式博弈。它把参与人的行动顺序、每个节点上谁能行动、可选动作和收益全都画成一棵从左向右生长的树。每一个分支的末端就是一组完整的“历史”——从起点走到这里每个人分别做了什么最后大家分别拿到多少收益。这棵树看起来简单但它是理解“子博弈”这个高级概念的地基。所谓子博弈就是从某个决策节点往后延伸的所有部分。它必须从“一个单独的决策节点”开始并且往后保留了完整的信息结构。对这个概念我当时的理解很粗暴博弈树里任何一个节点后面的那半截树只要没有人走到一半信息不全那就是一个子博弈。这个概念之所以重要是因为后面要讲的“子博弈完美纳什均衡”本质上就是在每一个子博弈里都要求均衡而不只是整棵树从起点出发算出来一个结果就完事。这里我第一次体会到博弈论的严谨性。从前面的静态博弈纳什均衡到动态博弈的子博弈完美纳什均衡加进去的其实是一个“动态一致性”的要求你的策略不仅在起点是最优的在任何可能走到的节点上也必须是最优的。做不到这一点就意味着你的策略里藏着一些“只说不做”的唬人话术。1.3 逆向归纳法从结尾往前推求解动态博弈最标准的方法是逆向归纳法也叫倒推法。思路特别朴素从博弈树的最后一个决策节点开始看那个决策者在给定前面历史的情况下会怎么选然后把他的选择“粘贴”回上一个节点再倒推上一层一直推到起点最终得到整个博弈的均衡路径。我在学习时第一反应是这不就是“站在终点看起点”吗对本质上就是这个意思。它背后有一个强劲的假设所有参与人都是理性的而且所有人都知道所有人理性也知道后面的理性选择会被前面的人预判到并纳入决策。因此在最后一个节点上决策者必然会选让自己收益更高的分支前一个决策者知道这一点就会据此反推自己的最优动作。这么一路倒推下来剩下的那条路径就是动态博弈的“理性归宿”。我建议所有初学者都亲自动手画一棵小博弈树比如三到四个节点的简单重复博弈再用倒推法走一遍。笔记写得再漂亮不如自己画几棵树练练手。这个方法的妙处在于它逼着你去“替未来的自己先做一次决策”这也是后面理解威胁和承诺的工具基础。2. 威胁与承诺可信性才是博弈论的灵魂2.1 威胁放狠话谁都会但别人不傻动态博弈里最经典的一幕就是领先者向后来者喊话“你要是敢抢我地盘我就跟你同归于尽杀敌一千自损八百。”问题在于这种威胁能不能起作用不取决于话说得多狠而取决于当那个“最后节点”真的到来时威胁者是否会真的执行。用一个最简单的进入阻挠博弈来说明市场里有个在位者对面来了个潜在进入者。进入者先决定进不进入如果进入在位者再决定是默许还是打价格战。进入者进入、在位者默许时双方各得一半市场收益都不错如果进入者进入、在位者打价格战两边都亏钱如果进入者不进入在位者独享市场。用倒推法看就会发现真正到了“打不打”这个节点在位者理性选择一定是默许因为默许至少还有钱赚打价格战是双输。所以进入者预判到这一步就会大胆进入。这时候在位者无论事前怎么叫嚣“你敢来我就敢打”都是不可信的威胁因为真到了那个节点他舍不得下手。这就是动态博弈里最核心的概念不可信威胁。这个案例看得我直拍大腿。它揭示了一个残酷又理性的现实别人是否相信你的威胁看的不是你嗓门多大而是你事后执行的激励结构。如果事后你没有能力或没有意愿执行那这个威胁就是空中楼阁理性的人会直接把你的狠话当成背景噪音。2.2 承诺把自己“绑住”反而赚得更多与威胁相对的是承诺。承诺的本质也很反直觉我愿意主动剥夺自己未来的某些选择权来换取对方当下的信任和合作。经典的例子是“自断退路”背后是悬崖、面前是敌人你烧掉战船士兵才知道除了胜利没有别的路才会拼死一战。这个动作的本质不是让自己更强大而是让自己“不得不打”。放在博弈论框架里承诺就是一种改变未来支付结构的机制。你把自己逼到“事后执行比不执行更划算”的位置让对手相信你的威胁是真的。你事先缴了高昂的沉没成本做抵押、签订了一份违约金高得吓人的合同、把自己最在乎的声誉押上台面都属于承诺机制。这里有一个特别重要的区分空洞威胁靠吼有效承诺靠“绑”。一个承诺要真正改变对手的行为必须做到“让不执行承诺的代价大于执行承诺的代价”。如果你能构造出这种利益结构就算你一句话不说对手也能从你的支付函数里读出你的决心。反过来如果你只是嘴上说“我肯定说到做到”但所有人都看得出你事后不会这么干那这个承诺就是无效的。可以说承诺就是“给自己上一道成功的枷锁”。2.3 可信性威胁和承诺之间的分界线在学习这一章的时候我意识到“可信性”是贯穿所有案例的那条暗线。威胁和承诺其实是一枚硬币的两面它们能不能改变结果完全取决于可信性。不可信的威胁是无效的不可信的承诺同样是无效的。而可信性来自什么来自事后的激励约束也就是“如果我不这么做我会损失多少”和“如果我这么做我会得到多少”之间的比较。教科书给的可信性定义非常精炼只有改变博弈支付结构使得在事后某个节点上履行威胁或承诺成为当事人的最优选择时这个威胁或承诺才是可信的。有一段时间我自己把“可信性”理解成了“语气坚定程度”结果做案例分析时老出错——比如老板说“谁迟到我就开除谁”如果这个员工是不可替代的技术骨干那这个威胁实际上就是不可信的哪怕老板说一千遍也没用。想明白这一点之后我再去看谈判、定价、商战新闻视角完全变了。这里我总结了一个个人心得放在后面でも反复会用判断一个威胁或承诺可不可信不要看说话的人多坚决要看他“事后翻脸”的成本和收益。成本高于收益就是可信的成本低于收益就是唬人的。3. 经典模型逐个数从博弈树到现实场景3.1 进入阻挠博弈不可信威胁的代表案例进入阻挠博弈是我前面已经简单用过的模型值得再展开细说一遍。假设市场里只有一个在位垄断者利润是10。外面有个潜在进入者进入成本是2。如果进入者不进入在位者赚10进入者赚0如果进入者进入在位者选择默许两家平分市场各赚5扣掉进入成本进入者净赚3如果进入者进入在位者选择打价格战双方都1扣掉成本进入者净亏1。倒推一下就特别清楚在“进入者已经进入”的节点上在位者面对两个收益默许收益5打价格战收益1。理性人当然选默许。进入者预见到这一点后会比较进入收益3和不进入收益0当然选择进入。均衡路径就是在位者默许、进入者进入。在位者事前喊的“你进我就打”纯粹是嘴炮。这个模型让我彻底明白为什么很多行业里的巨头在遇到新玩家时反而会选择“欢迎入场”或者只做象征性抵抗。表面的客气背后是理性的成本收益计算。也正因为这个道理真实世界里那些有效的“进入威慑”才显得珍贵——能做到的企业基本都手握一个共同的东西让事后战争变成理性选择的承诺机制。3.2 连锁店悖论理性计算的盲区连锁店悖论是进入阻挠博弈的精装升级版也是我学动态博弈时最烧脑的一个模型。设想一家连锁店在20个城市都开了分店每个城市都面临一个潜在进入者。按每个城市单独倒推进入者在任何城市进入连锁店的最佳反应都是默许。既然这样每个城市的潜在进入者都应该进入连锁店没法阻止任何人。但直觉告诉我们现实里的连锁巨头往往会杀鸡儆猴在前几个城市拼命打价格战宁可亏本也要把进入者打跑。这正是悖论的张力所在如果所有城市彼此独立那么为了威慑后来的进入者而在早期城市打价格战是“非理性”的因为过去的事情已经过去了没法改变。但现实中我们确实观察到大量“死磕到底”的个案。怎么解释答案在于现实博弈并不是单次的而是在位者与潜在进入者之间反复进行的多阶段博弈而且潜在进入者会观察在位者在其他市场上的行为并以此判断其类型和决心。连锁店悖论给我最大的启发是很多人做决策时收益里还藏着一个“名声”的变量宁可一时亏血也要在对手心里建立一个“我会发疯报复”的形象。这种行为模式从局部看“不理性”放到更大空间、更长时间、更多对手的格局里看却可能是另一种理性——建立声誉、筛选对手、降低未来被挑战的概率。博弈论的魅力就在于此它不会告诉你“人之初性本善还是性本恶”它只告诉你各种行为在什么激励结构下会自发涌现。3.3 鲁宾斯坦讨价还价耐心就是权力动态博弈里另一个绕不开的模型是鲁宾斯坦讨价还价模型。情境是这样的两个人要分一块价值为1的大饼A先提出分配方案B选择接受或拒绝如果B拒绝博弈进入下一轮由B提方案A选择接受或拒绝如果A也拒绝那就到了第三轮……一直持续到有人接受为止。每多一轮双方都会被“不耐烦”拖累蛋糕会打个折扣专业说法叫“折现因子”就相当于等得越久未来的收益越不值钱。用逆向归纳法这个小游戏能推出一个非常优雅的结果均衡分配取决于双方的耐心程度。越有耐心的一方分到的饼越多越不耐烦的一方越需要在早期做出让步。而且每一轮先提出方案的人都有微弱的先手优势但这个优势会被对方的耐心和拒绝能力抵消。这个模型我特别喜欢因为它把谈判里难以量化的“权力”翻译成了一种可计算的变量耐心。生活中那些谈判高手的秘诀往往不是什么话术技巧而是“我有时间等你没有”。企业谈判拖到最后一刻谁先松口家庭采购谁先失去耐心多付点钱都是这个模型的微缩版。当然现实谈判中还有其他变量但鲁宾斯坦模型提供了一个冷酷又清晰的起点你手里真正的筹码是对方等待的极限。4. 承诺机制的设计真实世界怎么让威胁变可信4.1 抵押与沉没成本把退路堵死前面说了承诺的本质是改变未来支付结构。怎么改最直接的一招就是抵押。你跟别人合作怕对方中途撂挑子于是让对方先交一笔保证金中途违约就没收。这笔保证金就是承诺机制它让“好好干活”成为对方事后更划算的选择。保证金不一定要是钱可以是客户名单、核心技术、品牌特许经营权任何一旦违约就会损失惨重的东西都可以充当抵押品。沉没成本也是同一种逻辑只是方向略有不同。很多企业进入新市场时会高调建厂、巨额投放广告、签长约锁定上下游这些动作看起来是“浪费”其实作用恰恰在于向潜在对手传递信号我已经投入这么多退出成本极高所以如果打起来我是真敢拼命的。换句话说主动制造沉没成本就是主动把自己的退路烧掉以此来提升自己威胁的可信度。我们生活中也常看到“把话挑明、让所有人都知道”这种操作本质上也是在利用“面子”和“舆论”作为抵押品让自己的立场无法轻易反悔。4.2 合同与违约金用制度锁住行为合同是现代社会最日常化的承诺机制。为什么很多合作要签合同、约定违约金不是为了报复违约者而是为了提前改变双方的激励结构让“守约”比“违约”更划算。违约金足够高的时候双方都知道对方不会轻易违约合作反而更顺畅。注意一个容易被忽视的点合同的价值不在于“惩罚”本身而在于它提供的“确定性”——因为知道对方违约的代价很高你才敢于做前期投入比如租场地、招人、备货。这一点放在博弈论框架里非常好理解合同把原本“事后可能不认账”的不确定博弈改造成了一个“事后不认账会损失更多”的可信承诺。所以真正专业的合作谈判重点不在“写满所有意外情况”而在于设置一套让双方都不想轻易翻脸的违约成本结构。现实里经常有人把合同当成“吓唬人的纸”但实际上合同真正的力量是它给人带来的安全感让双方都敢往前走。4.3 声誉机制无形的“保证金”比合同更隐蔽但同样强大的承诺机制是声誉。为什么很多老字号哪怕亏钱也要处理售后因为它的商家声誉就是它的资产。一次处理不好损失的远不止这个订单的利润而是未来无数客户的信任。声誉作为一种承诺机制等价于把“守信”变成了有长期收益的投资、把“失信”变成了代价高昂的贬值。这里最有趣的地方在于声誉并不需要一个中心化的机构来执行也不需要抵押什么实物。它只需要两样东西公开的记录和未来的交易。你以前的每一次行为都会形成记录而对手们会依据这些记录来判断你未来的做法。所以在重复博弈里声誉本身就构成了可信承诺的基础它比合同更无形但在长期关系里往往更有约束力。这一点在个人品牌、企业口碑、平台信用体系里表现得淋漓尽致。4.4 分而治之与重复博弈让每个节点都变得关键除了上述三种机制还有一种不太起眼但很实用提升承诺可信度的思路把一次性博弈拆成多次重复博弈。在一个单次博弈里你很容易做出“这次占完便宜就跑”的举动但在一个无限次重复博弈中任何一次背叛都可能引发连锁的惩罚和未来的合作崩溃理性的参与者就会更慎重。举例来说为什么企业采购喜欢把大单拆成多个批次分批交付除了风险控制还有一个隐藏功能每批次都是一次博弈节点哪个环节出了问题都可以及时停止合作而不是等到最后一次性翻脸。拆成小额多批次的做法等于增加了双方的“记仇”能力让每个阶段的行为都被后续合作机会所约束。这一思路在职场协作、供应商管理、长期合作里特别实用很多管理经验其实暗合了这套博弈逻辑——哪怕当事人完全没学过博弈论。5. 学习动态博弈时我踩过的那些坑5.1 把“均衡结果”当成“唯一预测”这是初学者最容易犯的错误。我在学进入阻挠博弈时倒推出“进入者进入、在位者默许”就以为这个模型是在预测现实一定会如此。但实际上博弈论模型给的不是“现实必然长这样”而是在“共同理性”假设下逻辑推演的结果。现实中由于信息不完全、情绪、非理性行为、制度环境等因素结果完全可能偏出均衡路径。更常见的是现实里存在多个均衡模型只能告诉你哪些结果是可以自我维持的而不是唯一宿命。所以我对自己的提醒是动态博弈更像是一种思维框架帮你看清楚“如果所有人理性我们应该预期什么”这个基准线。拿这个基准线去观察现实会发现偏差点往往就是信息、心理或制度等因素在起作用的地方。那才是现实世界真正有分析价值的部分。5.2 忽视“信息”的作用在学校里学逆向归纳法时默认前提是“共同知识”所有参与人知道规则、知道收益、知道对方理性也知道对方知道自己知道这一切。一旦这些假设松动倒推法就不那么灵了。比如说如果在位者是好战型的烟雾弹一向放得成功进入者可能误判在位者的类型以为他真的会打于是干脆不进。这就是不完全信息动态博弈的范畴属于信号传递、声誉模型等进阶内容。这个坑教会我一个道理模型里“信息”是最容易被低估的变量。同样是进入阻挠博弈如果进入者无法确知在位者的成本结构、决心和承受亏损的能力那么现实的均衡就会大不一样。这也是为什么现实中企业之间经常用“信号”——比如降价预告、投资公告、公开财报——来影响对手的信息判断。不要只盯住收益数字要盯住对方眼里的你。5.3 硬套模型忽略制度与文化背景还有一个很实际的误区就是拿博弈论硬套所有场景。博弈论是一个高度抽象的框架它的结论依赖于特定的支付结构、参与人集合和规则设定。你在公司内部用博弈论分析“是否应该惩罚迟到”跟你分析两个国家之间的贸易谈判机制细节完全不同。如果只是机械套用模型不看制度、文化、法律背景很容易得出脱离实际的结论。举个简单的例子同样一个“我威胁你你再闹我就断供”的局在一个签署了长协合同、违约金极高的行业里跟在一个大家靠口头默契、靠江湖道义维系的行业里均衡结果会完全不同。所以我在笔记里反复给自己写一句话先问“这个模型的假设在这个场景里是否成立”再谈它给出的结论。模型的用途是提供洞察而不是取代对具体情境的理解。5.4 误解“承诺”等于“固守承诺”最后一个坑是把博弈论里的“承诺”理解成道德或心理上的“说话算话”。博弈论关心的不是道德问题而是激励相容问题。一个承诺是否有效不是看承诺者人品多好而是看违背承诺对他造成的损失是否足够大。如果某人特别诚信那么他的承诺天然更容易取信于人这其实是把“诚信”变成了一种抵押品但如果一个人本来就想干一票就走、没有任何后续合作那他的“诚信承诺”就没什么可信度。所以分析现实场景时我的关键动作变成拆解承诺背后的“抵押物”。对方说了这句话他把什么押上去了如果什么都没押那这句话的信息含量就很低。这样思考之后我在生活和职场谈判里明显少吃了很多亏——不再因为对方语气诚恳就轻信而是先看对方的行为成本和利益结构再做判断。尾声一点个人的学习体会写完这第四篇动态博弈笔记我自己最大的感受是博弈论真正改变人的不是让你变得更精明、更算计而是让你学会在别人“说狠话”的时候先看利益结构在自己想“放狠话”的时候先问一句“我有没有机制让这句话可信”。你在职场里提出一个目标团队相不相信你不取决于你多激动而取决于你有没有拿出资源、时间、抵押物来兑现这个目标。这个问题想清楚了很多沟通困境其实会自动消解。最后再分享一个小技巧我每次学完一个博弈模型会强迫自己在两三天内找一个现实场景去“套用”一下哪怕套得很生硬也要硬套。这个动作非常有用因为模型讲的是抽象结构而现实里充满噪音只有反复练习你才能越来越快地从噪音里抓住那个“结构”。动态博弈、威胁与承诺这一章理论上虽然有一定门槛但它的应用范围覆盖谈判、定价、管理、恋爱甚至家庭沟通。下一篇笔记我计划把手上的这几个模型信息不对称方向再延展一下研究信号传递和筛选机制而且我预感那会是另一个让人大开眼界的世界。
返回列表