耶魯公開課-博弈論筆記_第1頁
耶魯公開課-博弈論筆記_第2頁
耶魯公開課-博弈論筆記_第3頁
耶魯公開課-博弈論筆記_第4頁
耶魯公開課-博弈論筆記_第5頁
已閱讀5頁,還剩9頁未讀 繼續免費閱讀

付費下載

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

第頁耶魯公開課—博弈論筆記第一節、名詞解釋優勢策略〔Dominantstrategy〕:不管其他局中人采取什么策略,優勢策略對一個局中人而言都是最好的策略。即某些時候它勝于其他策略,且任何時候都不會比其他策略差。注:1、“優勢策略〞的優勢是指你的這個策略對你的其他策略占有優勢,而不是無論對手采用什么策略,都占有優勢的策略。2、采用優勢策略得到的最壞的結果不一定比采用另外一個策略得到的最正確的結果略勝一籌。嚴格劣勢策略(strictlydominatedstrategy):被全面的嚴格優勢策略壓住的那個策略,也就是說不是嚴格優勢策略以外的策略。弱劣勢策略:原來不是嚴格劣勢策略,但是經過剔除嚴格劣勢策略后,這個策略就成了嚴格劣勢策略。例:囚徒困境囚徒到底應該選擇哪一項策略,才能將自己個人的刑期縮至最短?兩名囚徒由于隔絕監禁,并不知道對方選擇;而即使他們能交談,還是未必能夠盡信對方不會反口。就個人的理性選擇而言,檢舉背叛對方所得刑期,總比沉默要來得低。試設想困境中兩名理性囚徒會如何作出選擇:假設對方沉默、背叛會讓我獲釋,所以會選擇背叛。

假設對方背叛指控我,我也要指控對方才能得到較低的刑期,所以也是會選擇背叛。

二人面對的情況一樣,所以二人的理性思考都會得出一樣的結論——選擇背叛。背叛是兩種策略之中的支配性策略。因此,這場博弈中唯一可能到達的納什均衡,就是雙方參與者都背叛對方,結果二人同樣服刑2年。例:協和謬誤20世紀60年代,英法兩國政府聯合投資開發大型超音速客機,即協和飛機。該種飛機機身大、裝飾豪華并且速度快,其開發可以說是一場豪賭,單是設計一個新引擎的本錢就可能高達數億元。難怪政府也會被牽涉進去,竭力要為本國企業提供更大的支持。工程開展不久,英法兩國政府發現:繼續投資開發這樣的機型,花費會急劇增加,但這樣的設計定位能否適應市場還不知道;但是停頓研制也是可怕的,因為以前的投資將付諸東流。隨著研制工作的深入,他們更是無法做出停頓研制工作的決定。協和飛機最終研制成功,但因飛機的缺陷〔如耗油大、噪音大、污染嚴重等〕以及運營本錢太高,不適合市場競爭,英法政府為此蒙受很大的損失。在研制過程中,如果英法政府能及早放棄,本來可以使損失減少,但他們沒能做到。最后,英國和法國航空公司宣布協和飛機退出民航市場,才算是從這個無底洞中脫身。這也是“壯士斷腕〞的無奈之舉。人們往往會陷入類似的誤區:一項工作的本錢越大,對它的后續投入就越多。其實不僅是在制造協和飛機這樣的重大工程上,就是在日常的生活中,人們在決定是否繼續做一件事情的時候,不僅是看它對自己有沒有好處,而且也過于注意自己是不是已經在這件事情上面有過投入。我們把那些已經發生、不可收回的支出,如時間、金錢、精力稱為“漂浮本錢〞。漂浮的意思是說,你在正式完成交易之前投入的本錢,如果一旦交易不成,就會白白損失掉。但如果對漂浮本錢過分眷戀,就會繼續原來的錯誤,造成更大的虧損。在第一節課中得出的五個結論:1、不要選擇劣勢策略

2、理性選擇導致次優結果

3、站在他人立場分析他們會怎么做

4、先弄清你想要的,才能得到你想要的

5、人人都是自私的第二節、囚徒困境的解決之道:1、屢次博弈;2、設立規章制度,懲罰違規者;3、思想教育〔效果待定〕。博弈的要素:參與者i;策略S;收益U。符號的定義:Si表示參與者i的策略。S-i表示除參與者i以外其他人的策略。Ui表示i的收益。名詞解釋:共同知識:我知道這件事;你也知道這事;我知道你知道這事;你知道我知道你知道這事這事;此后循環。案例:教師在課堂上讓每位學生從1-100中選擇一個數字。選擇到最接近全班平均數的2/3的學生為勝利者。學生共有50個左右。勝利者平分獎金5美元。解決方案:step1、假設每個人都選擇100,平均數100*2/3=66.66。所以不能選擇67-100之間的數〔嚴格劣勢策略〕。現實中有兩名學生選擇了。

step2、剔除了step1中的嚴格劣勢策略后,重復迭代,66*2/3=44。所以不能選擇44-67之間的數〔弱劣勢策略〕。現實中有四名學生選擇了。

step3、44*2/3=29,所以不能選擇29-44之間的數。現實中有13個左右選擇了30-34區間,。選擇這個數區間的學生想法是1-100平均數是50,50*2/3=33,所以選擇33附近的數可能比擬接近。這些學生低估了其同班同學的智商。

step4、29*2/3=19,所以不能選擇19-29之間的數。現實中有12個選擇了。選擇這個區間的學生就像螳螂捕蟬中的螳螂,卻沒有想到還有更多的黃雀在后。這么一直迭代下去,理論上如果所有學生都是理性人。平均數應當是1。現實中有12個學生選擇了1。應該說選擇了1的學生都看出了這個博弈的竅門。但是他們的選擇不是最接近平均數的。因為在現實中不可能所有人都是理性人。最終12是最接近平均數2/3的數。有9人選擇了這個數。結論:迭代剔除劣勢策略是個好的方法,但在現實中不能過度迭代。因為不是所有人都是理性人,而且不是所有人都有共同知識〔概念見前述〕。應用案例:中間選民定理兩個政治候選人,為了選舉須確定自己的政治立場。共有10個立場:1、2、3、4、5、6、7、8、9、10。第個立場都有10%選票。兩個候選人要在一系列的政治主張中選擇一個。規那么:選民會投票給觀點最相近的候選人。距離相等,該立場平分選票。候選者希望選票最大化。step1:試證明:S2優于S1。比擬1號候選人選擇S1,S2其利益U1的大小。當2號候選人選擇1號策略S1時

U1(1、1)[表示2號候選人選擇S1,1號候選人選擇S1]為50%

<

U1(2、1)[表示2號候選人選擇S1,1號候選人選擇S1]為90%當2號候選人選擇2號策略S2時U1(1,2)=10%

<

U1(2,2)=50%當2號候選人選擇3號策略S3時U1(1,3)=15%

<

U1(2,3)=20%當2號候選人選擇4號策略S4時U1(1,4)=20%

<

U1(2,4)=25%下面

選擇S2得票率都比S1大5%,所以S2嚴格優于S1。同理S9優于S10。step2:試證明:S3優于S2剔除劣勢策略S1,S10當2號候選人選擇2號策略S2時U1(2,2)=50%

<

U1(3,2)=80%當2號候選人選擇3號策略S3時U1(2,3)=20%

<

U1(3,3)=50%當2號候選人選擇4號策略S4時U1(2,4)=25%

<

U1(3,4)=30%當2號候選人選擇5號策略S5時U1(2,5)=30%

<

U1(3,5)=35%下面

選擇S3得票率都比S2大5%,所以S3嚴格優于S2。同理S8優于S9。所以S2是弱劣勢策略,以下同理可證S4優于S3,S5優于S4。迭代剔除后將剩下S5,S6。結論:政治家為了贏得更多項選擇票,尤其是大量關鍵的“中間選民〞,會表現的趨中,各個政治家之間的差異會變得很小。如美國選舉時議題是:0.3%的稅收差異,給不給移民發駕照,同性戀能否結婚之類對生活不會有重大影響的事項。缺陷:在現實中每個立場的選民數非均勻分布;非所有人都投票;選民不只考慮政治立場,還有性格,甚至外貌;政治候選人的口號與實際行動未必一致;候選人不止兩位。第三節、之前的幾節課中,各個案例都是有嚴格劣勢策略的。接下來的幾個案例中沒有嚴格劣勢策略,通過對這些沒有嚴格劣勢策略案例,可以模擬更復雜的現實情況,同時對數學的要求會加深。例:

S1=u,m,d

S2=L,R

表格中的數值為play1,2選擇不同策略時的得分,兩個玩家都想得到更高的得分。在這個博弈中沒有嚴格劣勢策略,因為當play2選擇不同策略時,play1的策略中沒有一個是始終劣勢于其他策略的。我們可以用畫圖的方式來分析沒有嚴格劣勢策略時Play1應該如何選擇策略的案例。如圖:X軸P〔r〕表示、play2選擇R策略的概率;Y軸表示play1的預期得分。當P〔r〕=0時,就是說play2選擇L策略。play1選擇u,m,d時的得分分別是5,1,3。當P〔r〕=100%時,就是說play2選擇R策略。play1選擇u,m,d時的得分分別是0,4,2。將這六個點分別在圖中標出,然后連成直線。就得出了三個函數:U1(u,p(r))=5-5p(r);

...

...(play1選擇u策略時,得分隨play2選擇R策略的概率變化而變化的函數)U1(m,p(r))=3p(r)+1;U1(d,p(r))=-2p(r)+4.其中三條直線有三個交點,分別位于P〔r〕=1/3;1/2;3/5

三處。結論:從圖中可以看出,Play1要得分最高,要根據Play2的P〔r〕不同分三段來選擇策略。當P〔r〕小于1/3時,應該選擇u策略;當P〔r〕大于1/3小于3/5時;應該選擇中間的線外外代表的策略d;當P〔r〕大于3/5時,應該選擇m策略。上面這個案例是一個純理論闡述,下面介紹足球比賽中點球時,射手應該如何選擇的問題。這個案例的數據是基于實際比賽中的統計數據。

例:點球表格中前列數字表示射手射中球的概率,如4表示40%中球率。L表示左,R表示右,M表示中。用前例中的方法畫圖:從圖中可得出:為得到最高的點球成功率,當P(r)<50%時,應該射手應該選擇踢左邊;當P(r)?50%時,應該射手應該選擇踢右邊;表示踢中路成功率的那條線始終沒有最高概率,所以射手最好不要選擇踢中路。這個模型的缺陷:沒有考慮射手踢球的習慣;沒有考慮守門員守中路的情況〔考慮三個要素很復雜,而且中路是可以排除的嚴格劣勢策略〕;沒有考慮球速。比賽中的真實概率數據:

最正確對策定義:Ui(Si^,S-i)>=Ui(Si`.S-i)

或者

Si^=Max

Ui(Si,S-i)Si^表示對手策略S-i的最正確對策。Si`表示Playi的其它對策。第四節、例

合伙人博弈:2個股東都持有公司50%股份;兩者平分利潤;每個股東要選擇為公司投入多少時間,用工作小時數代表雙方策略Si=(0,4)[0~4是連續的數,而非只能選整數],雙方可以在0至4個小時之間選擇。這家公司利潤:

4*[S1+S2+b*S1*S2]

(0<b<1/4);

{S1+S2可以表示兩個股東工作時間的簡單相加對利潤的奉獻,b*S1*S2可以表示由于兩個股東相互協作對利潤的奉獻;考慮到了這兩個局部,所以這個公式可以很好的反映現實的情況}所以,U1(s1,s2)=1/2[4*(S1+S2+b*S1*S2)]-S1的平方。{S1的平方表示股東1的努力本錢}假設S2給定

對U1(s1,s2)求導數U1(s1,s2)`=2(1+bS2)-2S1

當U1(s1,s2)`=0時U1(s1,s2)值最大。所以當S1=bS2+1時,U1(s1,s2)最大。也就是S1的最正確策略〔BR〕。同理S2=bS1+1是S2的最正確策略。[BR意為bestresponse]給定b=1/4

畫出BR的函數圖

在0<S1<1和2<S1<4這兩個區間里play1沒有最正確策略,所以play1不會選擇這兩個區間,從圖上可以看出BR2(S2)只能選擇紅色一段。同理BR1(S1)也只能選擇紅色一段。將剩下的紅色區間放大,并重復上一階段剔除,如

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論