完全信息动态博弈和不完全信息静态博弈【中】

📅 2026/7/31 3:12:29 👁️ 阅读次数 📝 编程学习
完全信息动态博弈和不完全信息静态博弈【中】

博弈论关心你的核心利益——收益蛋糕和效用函数以及精益决策

​博弈论并不高深晦涩,它研究博弈入局者的类型、信息不对称、各种博弈类型、入局者的互动关系、策略组合、纳什均衡、帕累托最优、既竞争又合作关系下的均衡占优解以及在各阶段博弈策略组合下的支付(收益)量化矩阵,强调收集情报、研究对方的行为风格、规律特点、风险偏好、心智模式——预判你的预判,算计你的算计,推断你的推断,应对你的应对

​博弈论广泛应用于人际关系、社交、职场、恋爱、婚姻家庭、商业竞争、公共政策决策、对阵对垒、各种谈判、大国决策中

兵场、战场、情场、商场、名利场、大国博弈场...

特别是人际关系,作为社会性灵长类动物,我们几乎每天都在和各种形形色色的人打交道

​博弈论也强调和美化合作,强调同理心和集体理性来克制个克服经济学中关于人自私自利追求自身利益最大化理性经济人假设的缺陷,也为经典却不最优的囚徒困境纳什均衡提供了更美好的决策理论依据

从我个人的应用体会来说,博弈论让我在一些关系处理和思考决策中,通过理性分析和支付测算,搭配合理的策略,配合切实的行动,让我获得了一些实实在在的好处和利益

我是博弈论实战者、应用者和收获者

博弈论专辑——【上】 【中】 【下】三篇,完美覆盖博弈论经典理论,不需要更多

强烈推荐博弈论!

作者:孙铂植


目录

1、什么是完全信息下的动态博弈

2、动态博弈的分类

3、博弈的阶段和扩展式表述

4、博弈的扩展式表述的要素

5、动态博弈的基本特点

6、完全信息动态博弈的均衡

7、博弈论中的策略行动行为模式

8、策略中的可信性问题

9、子博弈

10、强盗分赃

12、生活中有哪些办法可以提高策略行为的可信度

13、重复博弈

14、重复博弈的基本思想

15、重复博弈的基本特征

16、影响重复博弈均衡结果的因素

17、合作的必要条件

18、重复博弈与信誉

19、《美德的起源》一书中关于博弈的描述

20、不完全信息博弈简介

21、注明的BF实验

22、纸老虎博弈


1、什么是完全信息下的动态博弈

现实中博弈双方同时决策,还面对很多依次决策,后行者可以看到先行者的选择,博弈各方先后依次行动;

2、动态博弈的分类

根据博弈方是否相互了解信息,动态博弈又可以分为完全信息动态博弈和不完全信息静态博弈;静态博弈中无论是同时行动还是先后行动,参与者均不能够在自己行动之前观测到别人的行动;在动态博弈中,参与者的行动一定分先后顺序,后行动者能够在行动之前观测到先行动者的行动,并据此进行自己下一步的行动决策;人生有很多分叉路,无论选择了哪条路,后面还会继续分出岔路,人的一生就是在和未来的自己博弈的过程;

3、博弈的阶段和扩展式表述

动态博弈中,每个参与者的选择行为分先后顺序,依次相连,其中一个博弈方的选择行为被称为一个阶段,几个博弈方同时决策也构成一个阶段;动态博弈中至少存在两个阶段,动态博弈也被称为多阶段博弈或序贯博弈;博弈的扩展式被称为博弈树,动态博弈又被称为扩展式博弈,博弈可以向任何方向延伸,由一些点和线段组成,点包括起点、中间点和终点,起点又称为起始决策点,起点是博弈树之根,是博弈的开始,也是最先行动者的起点;

4、博弈的扩展式表述的要素

参与者集合、参与者的行动顺序即谁在什么时候行动、参与者的行动选择空间、参与者知道的信息集、参与者在行动结束后得到的支付函数、自然选择外生事件的概率分布;博弈树基本构建包括节、枝和信息集,节分为决策节和终点节,枝表示从决策节到后续节的连线;信息集的完美信息是指在博弈者的每次行动中参与者完全知道博弈的历史;

5、动态博弈的基本特点

参与者是依次、多次决策形成多个阶段,决策具有完全性;计划具有过程性,得益具有不可分性;博弈方具有非对称性,动态博弈中决策具有次序性,在依次完成决策的过程中,后者总能通过观察前者的决策而获得更多信息,来做出更具有针对性的选择;

6、完全信息动态博弈的均衡

一以房地产开发博弈为例,两个房产商真的会按照实现设计好的策略方案行动吗?纳什均衡中博弈方是否采取行动取决于方案的可信性;

7、博弈论中的策略行动行为模式

威胁是指对不肯与你合作的对手进行惩罚的一种回应规则,是一种有条件的策略,如恐怖分子劫持人质,要求答应他所有的条件,不然就会杀光人质;强迫性威胁的用意在于促使对方按照自己的要求行动,阻吓性威胁的用意在于阻止对方的某些行动,当威胁作为讨价还价的策略时,这种威胁就很可能是不可置信的;如古巴导弹危机;核大国的核博弈只有一个均衡结果——核和平;博弈论中的许诺是指诱使对方采取对自己有利的策略行为,通过影响对方的预期判断而限制对方的选择,强迫有强迫性许诺和阻吓性许诺;威胁和许诺的结果都可能会陷入同样的结局——如果对方这样做(或不做),事先的行动是否还算数?这涉及到行动的可行性问题;需要注意!威胁和许诺必须是有行为对应的,而不是一个简单的警告或单方面的保证;威胁和许诺是必须有条件的,要求呢提前确定一个回应规则,威胁是惩罚不按你意愿行事的参与者的回应规则,许诺是对那些按你意愿进行行事的参与者的一种给与或奖励;我们会时常在生活或工作中思考什么时候使用威胁、什么时候使用许诺;承诺是一种无条件的策略;承诺行动,博弈结果已经改变,行动变得可信;

8、策略中的可信性问题

一房地产开发承诺为例,它是一个完美信息博弈,A先行动,B在知道A的选择后再行动,存在三个纳什均衡;如果你朋友找你借钱投资,并承诺投资成功后分一定的收益给你,如果没有任何制度或规则约束,借钱分收益就是一个不可置信许诺,最好是打借条订立合同约束;

9、子博弈

是动态博弈的局部次级博弈,是原博弈的一部分,也可以作为一个独立的博弈被加以分析;甄别和剔除不可置信解,就可以精炼子博弈纳什均衡;

10、强盗分赃

属于完美信息动态博弈,每个强盗都可以看到其他强盗之前的决策,也可以推断出其他强盗所能采取的策略和相应的收益,这个博弈的特征是次序起到关键作用,这个博弈中存在策略的依存性问题,某一参与者的策略不是仅仅取决于自己,而是需要考虑别人的策略后再进行决策;

12、生活中有哪些办法可以提高策略行为的可信度

承诺行动的成本越高,威胁的可信度越高;签订合同、建立信誉、不可逆转、分步前进、边缘政策、建立团队、授权代理人都可以提高策略行为的可信度!要让承诺可信,直截了当的方法就是同意你在不遵守承诺的时候接受惩罚,签订合同并让独立于合同的第三方负责强迫执行承诺或收取罚金;建立信誉,如果呢尝试了一个策略然后反悔,你可能会丧失可信度方面的信誉,当机遇千载难逢百年一遇那么承诺价值也不大可以撕毁承诺;一般地,你都会在同一时间和不同对手进行多个博弈,因此你有建立信誉的动机,这就相当于做出一个承诺以使自己的策略行动显得可信;说话算话的重要性在大国政治,保证说到做到也正是解决策略行动可行性问题的核心;总有办法使策略变得不可动摇,如切断沟通,如一份最后的遗嘱或证词中的条款,如军队切断退路,破釜沉舟背水一战都是属于不可逆转的策略,剥夺了改变承诺的机会;如两家厂商达成巧妙的价格联盟冻结价格战,保证对方不会背叛和降价,迅速察觉背叛行为并给予惩罚;分步前进,如多边贸易谈判,把一个大目标分成多个足够小的目标逐个博弈,分步前进在谈判进程中被普遍使用,可以增进双方的了解,产生互信,将谈判分成若干次;如签订合同分期付款,房主担心偷工减料或者粗制滥造,工程承包商担心房主一旦工程竣工可能会拒绝付款,因此合同中的支付条款一般是分期付款;边缘政策,危急时刻不能循序渐进分步前进,只需要一个能让人近乎让人相信的行动就能把问题解决;如冷战边缘政策通过军事行动将事情推到战争的边缘,以说服其他国家服从自己的政治要求,把事情推到它的边缘而没有演化为战争的能力是必要的艺术边缘政策到达战争的边缘,如今世界各国依然以核抗核、以守为攻来威慑对方保持克制,核战争就是现代世界战争的边缘,虽然选择边缘政策策略可能有效,但是会恶化博弈双方的关系,在谈判中奖威胁步步紧逼,从而将威胁步步放大,可以达到增强策略行动可信性的问题;如用枪指着头逐步扣下扳机威胁对方吐出秘密;建立团队,以为有其他人的监督和督促,守信就不难;授权代理人,寻找第三方加入以确保可信性做法,如工会谈判授权第三方公证监督,部落谈判请来酋长尊者,有人监督,要注意授权人与原合同的结果无利益关系,这样才能监督执行,实现守信的目的;

13、重复博弈

是指同样结构的博弈重复多次实际上构成动态博弈;在囚徒困境博弈中有效的取胜策略是以牙还牙以眼还眼,人家怎么对你,你也怎么对他,这个策略在开局时选择合作,以后则模仿对手在上一期的行动;

14、重复博弈的基本思想

囚徒困境所反映的深刻问题是,人类的个人理性有时能导致集体的非理性——聪明的人类会因为自己的聪明而作茧自缚,单词发生的囚徒困境和多次重复的囚徒困境结果不一样;如果博弈能被反复进行,每隔参与者都有机会去惩罚另一个与前一回合的不合作行为,这时,合作就可能会作为均衡结果出现;以牙还牙以眼还眼以其人之道还治其人之身体现了这种报复性惩罚,且通过这一策略克洛伊引发博弈的结束,以牙还牙策略使使对方欺骗的动机可能被惩罚的威胁所克服,从而可能会导致一个较好的、合作的结果,反复接近无数次无限次,纳什均衡趋向于帕累托最优;例如在囚徒困境中,两个囚犯的刑期都不是很长,刑满释放后又作案,作案之后又被判刑,释放后再作案再判刑,如此反复他们之间就是重复博弈,重复博弈中,每一次的博弈不会改变下一次博弈的结构,所有参与者都可以观测到博弈过去的历史;

15、重复博弈的基本特征

前一阶段的博弈不改变后一阶段的博弈结构;所有参与者都可以观测到博弈过去的历史,参与者的总支付是所有阶段博弈支付的贴现值之和或加权平均值;

16、影响重复博弈均衡结果的因素

博弈重复的次数,当博弈只进行一次时,参与者只关心一次性支付,但是如果博弈重复多次,参与者可能会为了长期利益牺牲眼前利益从而选择不同的均衡策略,这是重复博弈给出的一个强有力结果,为现实中观测到的许多合作行为和社会规范提供了解释;信息的完备性,当一个参与者的支付函数特征不为其他参与者所知时,该参与者可能有积极性建立一个好声誉换取长远利益,如本质不好的人在相当长时间里干好事;无限次重复博弈有可能出现合作,以牙还牙策略又称为针锋相对策略,计算机模拟后发现,它是促进合作成功率最高的策略;

17、合作的必要条件

关系要持续,在一次性或有限次博弈中,决策者是没有合作动机的,如火车站的小贩会经常骗人;对对方的行为要加以回报,一个永远合作的决策者是不会有人跟他合作的;如果提高合作性呢?要建立稳定的关系,工作中形成小组制度,要增强识别对方行动的能力,如果不清楚对方是合作还是不合作,就没办法回报他;要维持声誉,说要报复就一定要做到!人家才知道你是不好欺负的,才不敢不与你合作,能够分步完成的对局不要一次完成,以维持长久关系,以促使对方采取合作态度;不仅对背叛加以惩罚,对合作也要加以回报;

18、重复博弈与信誉

如果博弈重复进行,参与者过去行动的历史是可以被观察的;重复博弈理论最大的贡献是对人们之间的合作行为提供了理性解释,在囚徒困境中,一次性博弈的唯一均衡就是不合作,如果博弈重复无限次,合作就可能会出现;这就是旅游景区层出不穷地宰客,家门口小店信誉较好;实现信誉的条件有可以重复博弈、参与者有足够的耐心、相对确定的环境、欺骗可以被观察到、受骗人可以对欺骗方执行惩罚措施;以牙还牙策略是主动出击的,也是最能促进合作的一种策略,任何参与者的一次性不合作都将触发永远的不合作,该策略叫触发策略!

19、《美德的起源》一书中关于博弈的描述

人类是一个高度社会化的物种,我们谁也不愿意拱手让出我们的生育权;自私的个体怎样才会服从集体的利益?博弈论的回答就是奥秘在于双方的多次较量;路遥知马力日久见人心就是长期建立合作所关系的最好注解;萍聚只能催生不求天长地久但求曾经拥有;有人设计了一种叫做“以牙还牙”的计算机程序,它的策略是,当遇到对手时,先摆出友好的合作态度,若对方以诚相待,则继续合作,一个良好的互动关系就此诞生;当对方不识好歹,则实行报复,哪怕双方皆输;结果发现,这种程序颇有生存优势;这种程序提醒我们,在一个正常运行的社会中,信任是常态;从长期较量中建立的合作关系意味着个体必须记住对方的特性、策略,随之作出相应的反应;甚至有这样的猜测,人类的智力起源就与此有关;有无穷多种行为规则可以支持合作行为;

20、不完全信息博弈简介

博弈中,假设完全信息是所有参与者的共同知识;现实中的博弈往往不是完全信息博弈;博弈论中的不完全信息是指博弈参与者对其他博弈局势有关的事前信息了解得不充分,不完全信息不还完全没有信息,否则博弈双方的决策选择就完全失去依据,博弈分析变得没有意义;至少有一个参与者不知道其他参与者的支付函数的博弈被称为不完全信息博弈;,又称为贝叶斯博弈,在信息不完全的情况下,博弈参与者不是使自己的支付或效用最大,而是期望效用或收益最大;

21、注明的BF实验

把几只蜜蜂和几只苍蝇放进一个玻璃瓶,蜜蜂喜欢光亮在瓶底寻找出口直到累死,苍蝇对事物逻辑毫不在意,到处乱飞,探索有可能出现的任何机会,于是它们成功了;在这个实验中,实验、试错、冒险、迂回前进、混乱、随机应变,所有这些有助于应对未知的状况,表明要善于打破固定的思维模式,要有足够的探索未知领域的学习能力,在不完全信息静态博弈中,我们追求的实在任何情况下期望效用的最大化,而不是一个策略的效用最大化;

22、纸老虎博弈

中国人习惯上将表面强大实质软弱的对手称为纸老虎,但是,在实际的博弈中,对手是不是真正的纸老虎还是一个问题呢?!对手有可能是纸老虎,也有可能是真老虎;如果对手其实是真老虎,贸然挑战就会招致毁灭性的打击,后果是严重的;弱小的参与者在面对表面强大的对手时,有时候不知道对手是不是真老虎,因为信息是不对称的,但是战胜纸老虎带来的巨大声誉与遭遇真老虎带来的可怕后果会将弱小者置身于进退两难的境地。弱小的信息错误页时常驱使参与者铤而走险


以下为高清排版PDF图片版——方便大家保存💾