Skip to content

10.2 — Joy: Nash ও Prisoner's Dilemma

এই অধ্যায়ে কী শিখব: গেম থিওরির সবচেয়ে গুরুত্বপূর্ণ ধারণা Nash equilibrium (ন্যাশ ভারসাম্য) — যেখানে অন্যরা যা করছে তা ধরে নিয়ে কেউ আর নিজের payoff (প্রাপ্তি) বাড়াতে পারে না, অর্থাৎ সবাই একসাথে best response (সেরা জবাব) খেলছে। A Beautiful Mind-এর বার-দৃশ্য দিয়ে শুরু করে আসব গেম থিওরির সবচেয়ে বিখ্যাত ধাঁধা Prisoner's Dilemma (বন্দীর দ্বিধা)-তে — যেখানে defect (বিশ্বাসঘাতকতা) একটা dominant strategy (প্রভাবশালী কৌশল), তাই সবাই নিখুঁত বুদ্ধি খাটিয়েও দলের জন্য খারাপ ফলে গিয়ে ঠেকে। তারপর একে একে, উৎস বই ধরে ধরে, পুরো বিস্তারিতসহ দেখব বাস্তব উদাহরণ: coordination failure, used product কেনার ফাঁদ, প্রাচীন ভারতীয় (Telugu) প্রবাদ, ডাক্তারের কাছে যাওয়া, Las Vegas-এর ক্যাসিনো, JC Penney-র $163M ক্ষতি, Snooki-র unbranding, The Economist-এর "competitive edge", Southwest Airlines-এর $144M, আর Golden Balls টিভি শো — শেষে দেখব কীভাবে এক-দানের খেলায় Prisoner's Dilemma-কে হারানো যায়।

উৎস (source): The Joy of Game Theory — Presh Talwalkar (pdf p58–101)। এই অধ্যায়ে গল্পগুলো উৎস অনুসরণ করে প্রতিটা যুক্তি, সংখ্যা, quote ও সূত্রসহ পূর্ণ বিস্তারিতভাবে সাজানো।


১. কেন শিখব? (Motivation)

আগের অধ্যায়ে (10.1) আমরা একটা মূল কথা শিখেছি: একা optimize করা আর অন্যের কৌশল হিসেব করে optimize করা এক জিনিস নয়। রাস্তায় একা হাঁটলে সোজা পথে যাওয়াই সেরা; কিন্তু ভিড়ের রাস্তায় সবাই একই সোজা পথ ধরলে ধাক্কাধাক্কি লাগে। এই অধ্যায়ে সেই "কৌশলগত চিন্তা"-র দুটো স্তম্ভ দাঁড় করাব।

প্রথমটা একটা সংজ্ঞা: যখন সবাই একসাথে বুদ্ধি খাটায়, তখন খেলা কোথায় গিয়ে "থিতু" হয়? উত্তরটাই Nash equilibrium (ন্যাশ ভারসাম্য) — এমন একটা অবস্থা যেখান থেকে একা সরে গিয়ে কেউ লাভবান হতে পারে না। এটা গেম থিওরির কেন্দ্রীয় ধারণা; গণিতবিদ John Nash এই ধারণার জন্য Nobel পেয়েছিলেন, আর A Beautiful Mind সিনেমা (একই নামের বইয়ের Hollywood রূপায়ণ) তাঁকে নিয়েই।

দ্বিতীয়টা একটা সতর্কবার্তা: প্রত্যেকে নিজের স্বার্থে নিখুঁত যুক্তি খাটালেও, দল হিসেবে সবাই খারাপ ফলে গিয়ে আটকে যেতে পারে। এই তিক্ত-কিন্তু-অনিবার্য ফাঁদই Prisoner's Dilemma (বন্দীর দ্বিধা)। একবার এই ছাঁচটা চিনে গেলে তুমি চারদিকে এটা দেখতে পাবে — দোকানের দামাদামি থেকে বিমানের আসন, খেলোয়াড়ের ডোপিং থেকে দেশে-দেশে অস্ত্র প্রতিযোগিতা, এমনকি ট্রাফিক জ্যাম পর্যন্ত।

মূল স্বজ্ঞা

দুটো বাক্যে পুরো অধ্যায়:

  • Nash equilibrium — অন্যরা যা করছে ধরে নিয়ে আমি আমার সেরা জবাব (best response) খেলছি, আর সবাই একসাথে তা-ই করছে। কেউ একা সরে গিয়ে লাভ করতে পারে না।
  • Prisoner's Dilemma — প্রত্যেকের একটা প্রভাবশালী কৌশল (dominant strategy) আছে "defect (বিশ্বাসঘাতকতা)" করার, কিন্তু সবাই তা খেললে ফলটা মিলে "cooperate (সহযোগিতা)"-র চেয়ে খারাপ হয়। যুক্তি নিখুঁত, তবু ফল খারাপ — এটাই দ্বিধা।

২. মূল ধারণা (Core idea)

২.১ Coordination failure — সমন্বয়ের ব্যর্থতা

আগের অধ্যায়ে দেখেছি coordination game (সমন্বয় খেলা)-তে একটা focal point কাজে আসে। focal point মানে এমন একটা পছন্দ যা স্বাভাবিকভাবেই চোখে পড়ে ও আকর্ষণীয় — এটা সবার উপকার করে, কারণ কেউ কারও সাথে কথা না বলেও সবাই একই সিদ্ধান্তে পৌঁছাতে পারে (যেমন: "রাস্তার কোন পাশ দিয়ে চালাব?" — যে-পাশটা সবাই স্বাভাবিকভাবে বাছে, সেটাই সবার জন্য ভালো)।

কিন্তু সব খেলায় আকর্ষণীয় পছন্দ ভালো নয়। competitive game (প্রতিযোগিতামূলক খেলা)-তে ঠিক ওই স্বাভাবিক-আকর্ষণীয় পছন্দটাই দ্বন্দ্ব তৈরি করে — কারণ সবাই একই জিনিস চায়, অথচ সবার তা পাওয়া সম্ভব নয়। উদাহরণ চারপাশে ছড়ানো:

  • খেলার দল একই "star" খেলোয়াড়ের জন্য দর হাঁকায় (bidding war) — সবাই সেরাটাই চায়, দাম আকাশ ছোঁয়।
  • সাংবাদিক ও সংবাদমাধ্যম একই বড় খবরের (most prominent story) পেছনে ছোটে, একে অন্যকে ছাড়িয়ে বেশি কভারেজ দিতে চায়।
  • মেধাবী ছাত্ররা একই সেরা-র‍্যাঙ্কের কলেজের সীমিত আসনের জন্য লড়ে।
  • মানুষ একই সবচেয়ে আকর্ষণীয় সঙ্গীর মন জয়ে নামে — কখনো তা নিষ্ঠুর কৌশল (vicious tactics) পর্যন্ত গড়ায়।

মোদ্দা পার্থক্য: coordination game-এ স্বাভাবিক-আকর্ষণীয় পছন্দ একটা ভালো জিনিস (সবাইকে এক জায়গায় আনে); competitive game-এ প্রত্যেকে বিজয়ী হতে চায় বলে সহযোগিতা ভেঙে পড়ে — এটাই coordination failure (সমন্বয়ের ব্যর্থতা)। এই অধ্যায়ের বাকিটা এমন খেলা নিয়েই, যেখানে ব্যক্তিস্বার্থ প্রায়ই দলস্বার্থের বিরুদ্ধে দাঁড়ায়। প্রথম গল্পটা একদল ছেলের, যারা একটা বারে "date" জেতার আশায়।

২.২ Nash equilibrium ও best response — বারের দৃশ্য

দৃশ্যটা সাজাই। কল্পনা করো তুমি আর তোমার তিন পুরুষ বন্ধু একটা বারে — চারজন মিলে "পরিচয়" জমাতে এসেছ। হঠাৎ একদল ঢুকল: একজন blonde আর চারজন brunette। প্রশ্ন — প্রত্যেকের individual কৌশল কী হওয়া উচিত? নিয়মগুলো (একটু সরলীকৃত, "stylized"):

  • চারজনই blonde-এর সাথে কথা বলতে চায় (সে সবার চোখে সবচেয়ে আকর্ষণীয়)।
  • কিন্তু একের বেশি জন blonde-এর দিকে গেলে সে বিরক্ত হয়ে কারও সাথেই কথা বলবে না।
  • তখন brunette-দের কাছে যাওয়াও দেরি হয়ে যাবে — কেউ "দ্বিতীয় পছন্দ (second choice)" হতে চায় না, তাই brunette-রাও ফিরিয়ে দেবে।
  • যে শুরু থেকেই একজন brunette-এর দিকে যায়, ধরে নাও সে সফল হয়।

এই দৃশ্যটাই A Beautiful Mind সিনেমায় আছে — এটা একই নামের বইয়ের Hollywood রূপায়ণ, আর বইটা গেম থিওরিস্ট John Nash-এর জীবন নিয়ে। এখানে blonde একটা focal point — সবার চোখেই স্বাভাবিকভাবে সবচেয়ে আকর্ষণীয়।

কিন্তু সবাই তাকেই চায় বলেই সমস্যা। চারজনই blonde-এর দিকে গেলে বড়জোর একজন সফল হবে (আসলে কেউই নয়, কারণ সে বিরক্ত হয়ে সরে যাবে), আর brunette-রাও অপমানিত বোধ করবে — গোটা রাতটাই মাটি। দল হিসেবে এটা coordination failure

সিনেমায় John Nash একটা সহযোগিতার প্রস্তাব দেন: সবাই যদি শুরুতেই brunette-এর দিকে যায়, তাহলে কেউ blonde-এর জন্য লড়বে না, প্রত্যেকের একজন brunette পাওয়ার ভালো সুযোগ থাকবে, সবাই একটা "good option" নিয়ে ঘরে ফিরবে। প্রশ্ন — এটা কি ভালো পরিকল্পনা, টেকসই? বিশ্লেষণ করতে আগে দরকার একটা নির্ভুল সংজ্ঞা।

সংজ্ঞা — Nash equilibrium (স্বজ্ঞা-স্তরে)

Nash equilibrium হলো এমন একটা পরিস্থিতি যেখানে অন্যরা যা করছে তা ধরে নিলে, কেউই একা নিজের প্রাপ্তি (payout) বাড়াতে পারে না। অন্যভাবে বললে — অন্যরা যা বাছছে, তা দেখে প্রত্যেকে তার সেরা সম্ভব পছন্দ, অর্থাৎ একটা best response (সেরা জবাব), খেলছে (শব্দটা মনে আছে Hotelling-এর খেলা থেকে)।

পুরনো দুই উদাহরণে Nash equilibrium ঝালাই। নতুন সংজ্ঞাটা হাতে নিয়ে আগের দুই খেলায় ফিরে দেখি:

  • Hotelling-এর খেলা: দুই হটডগ-স্ট্যান্ড সৈকতে বেশি খদ্দের চায়। একটা স্ট্যান্ড যেখানেই থাক, অন্যটা আরও কেন্দ্রের দিকে সরে বেশি খদ্দের টানতে পারে। যেহেতু দুজনেই কেন্দ্রের দিকে সরতে চায়, শেষে দুজনেই ঠিক মাঝখানে দাঁড়ায়। এখান থেকে সরলেই লোকসান (খদ্দের কমে), তাই কেউ সরতে পারছে না — এটাই Nash equilibrium। (যদিও সৈকতে ছড়িয়ে থাকলে খদ্দেরদের হাঁটা কমত, সমাজের জন্য ভালো হতো।)
  • Bertrand duopoly: দুই ফার্ম শুধু দামে প্রতিযোগিতা করে। প্রত্যেকে অন্যের চেয়ে সামান্য কম দাম দিয়ে লাভবান হয় (undercut), তাই দাম নামতে নামতে সর্বনিম্নে ঠেকে। এখান থেকে দাম কমালে লোকসান, আর বাড়ালে সব খদ্দের প্রতিদ্বন্দ্বীর কাছে চলে যায়। তাই দুজনেই এই কম-দামে "আটকে (stuck)" যায় — এটাই Nash equilibrium। (যদিও ফার্মরা দাম এত কম চায়নি।)

এই দুটো একটা গুরুত্বপূর্ণ পাঠ দেয়: Nash equilibrium সবসময় সামাজিকভাবে সর্বোত্তম (socially optimal) নয়, খেলোয়াড়দের জন্য সেরাও নয়। এটা কেবল প্রতিযোগিতার ফল — যেখানে প্রত্যেকে অন্যের চাল হিসেব করে ও কীভাবে খেলাকে প্রভাবিত করা যায় ভেবে নিজেরটা বাছে। কোনো ভারসাম্য ন্যায্য মনে হবে, কোনোটা নয়। কিন্তু যখন ফলটা অবাঞ্ছিত, তখন আমরা হতাশ হব না — পরের অধ্যায়ে (Section II) দেখব কীভাবে খেলাটাই বদলে ফাঁদ থেকে বেরিয়ে সহযোগিতা ফিরিয়ে আনা যায়।

Go for the blonde? — একটা চিন্তা-পরীক্ষা (best response খুঁজি)। এবার বারের দৃশ্যের Nash equilibrium বের করি। চারজন brunette-এর জন্য আর একজন blonde-এর জন্য লড়ছে — "সবাই brunette-এ যাক" কি সত্যিই বুদ্ধিমানের কৌশল? ধরো তোমার তিন বন্ধু সত্যিই brunette-দের দিকে গেল। এখন তোমার best response কী — অর্থাৎ তারা যা করছে ধরে নিয়ে তোমার সবচেয়ে ভালো করণীয় কী?

  • তোমার দুটো পছন্দ: brunette-এ যাওয়া, নাকি blonde-এ।
  • তুমি একজন brunette-এর দিকে গেলে সফল হওয়ার ভালো সুযোগ।
  • কিন্তু একটা ভাবনা মাথায় আসে: বন্ধুরা সবাই brunette-এর দিকে গেছে, মানে blonde-এর দিকে তোমার কোনো প্রতিদ্বন্দ্বী নেই। তাই এখন blonde-এর দিকে গেলে তোমার দারুণ সুযোগ — কেউ ভাগ বসাবে না।
  • সিদ্ধান্ত স্পষ্ট: বন্ধুরা brunette-এ গেলে, তোমার উচিত blonde-এ যাওয়া।

তাহলে "সবাই brunette-এ যাক" প্রস্তাবটা Nash equilibrium নয় — কারণ তুমি একা সরে গিয়ে (blonde-এ গিয়ে) লাভবান হতে পারো, আর যেখানে কেউ একা সরে লাভ করতে পারে, সেটা Nash equilibrium হতে পারে না।

তাহলে Nash equilibrium কোনটা? ধরো ঠিক একজন (ধরো তুমি) blonde-এর দিকে যায়, বাকি সবাই brunette-এ। এখন যাচাই করি — কেউ কি একা সরে লাভ করতে পারে?

  • তুমি (blonde-এ): তোমার প্রতিদ্বন্দ্বী নেই, তাই তুমি ইতিমধ্যে সেরা জবাব খেলছ। brunette-এ সরলে বরং তুমি হারাবে।
  • প্রতিটা বন্ধু (brunette-এ): সে যদি blonde-এর দিকে সরে, তাহলে দুজন (তুমি ও সে) blonde-এ পড়ে দুজনেই ব্যর্থ হবে। তাই তার brunette-এ থাকাই ভালো।

কেউ একা সরে লাভ করতে পারছে না — অতএব "একজন blonde-এ, বাকিরা brunette-এ" একটা Nash equilibrium

একটু পাশের কথা — সিনেমাটা আসলে Nash equilibrium দেখায় না

মজার ব্যাপার: A Beautiful Mind-এর দৃশ্যটা আসলে Nash equilibrium দেখায় না! Nash প্রস্তাব দেন সবাই brunette-এ যাক, তারপর হঠাৎ একটা আইডিয়া মাথায় এসে তিনি বার ছেড়ে চলে যান। কিন্তু আমরা এইমাত্র দেখলাম "সবাই brunette" ভারসাম্যই নয় — একজন সরে blonde-এ গেলেই লাভ।

একাধিক Nash equilibrium। Hotelling ও Bertrand-এ Nash equilibrium ছিল একটাই (unique)। কিন্তু এই বার-খেলায় একাধিক Nash equilibrium আছে। "তুমি blonde-এ, বাকিরা brunette-এ" যেমন একটা ভারসাম্য, তেমনি "অন্য যে-কোনো একজন blonde-এ, বাকিরা brunette-এ"-ও ভারসাম্য — যুক্তিটা প্রতিসম (symmetrical): যে-ই একা blonde-এ যায় সে সেরা জবাব খেলছে, আর বাকিদের কেউ brunette থেকে blonde-এ সরে লাভ করতে পারে না। মানে চারজনের যে-কেউ blonde-এ যেতে পারে — তাই অন্তত চারটি Nash equilibrium।

বাস্তবে তাহলে কী হয়? একাধিক ভারসাম্য থাকায় সমস্যা: সবাই চায় অন্যদের brunette-এ পাঠাতে, যাতে সে নিজে blonde-এ যেতে পারে। (ঠিক যেন কেউ বলছে "তুমি brunette-এ যাও" — যার আসল মানে "তুমি বোকা বনো, আমি blonde নিই"।) বাস্তবে "ঠিক একজন blonde-এ" ভারসাম্যে পৌঁছানো কঠিন — প্রতিযোগিতা লেগে গিয়ে কেউ হয়তো পুরো মিশন ভেস্তে (sabotage) দেয়। তাই মানুষ এই সরল খেলার বাইরের কৌশল খাটায়:

  • "wait and see" কৌশল: এই দলটাকে বাদ দিয়ে পরের কোনো দলের অপেক্ষা করা।
  • "wingman" কৌশল: দলের একজনকে blonde-এ পাঠানো, বাকিরা brunette-দের ব্যস্ত রেখে তাকে জায়গা করে দেয়।

গুরুত্বপূর্ণ সতর্কতা — মডেল বনাম বাস্তব

এই গোটা উদাহরণটা নারীদের অত্যন্ত ভুলভাবে ও সরলীকৃতভাবে ধরে নিয়েছে — যেন তারা কেবল পুরুষদের চালের প্রতিক্রিয়া দেয়, নিজেরা কৌশল খেলে না। বাস্তবে dating এমন একটা খেলা যেখানে দুই পক্ষই পরিশীলিত কৌশল খাটায়। শিক্ষা: গেম থিওরি প্রায়ই একটা সরলীকৃত, কাল্পনিক (stylized, hypothetical) খেলার সমাধান দেয়; বাস্তবে কতটা প্রয়োগ হবে তা নির্ভর করে বাস্তব বিবেচনার (practical considerations) ওপর। এই সাবধানবাণী গোটা বইয়ের সব উদাহরণেই খাটে।

২.৩ Should you buy used products? — পরামর্শও একটা চাল

অনেক আর্থিক প্রবন্ধ পুরনো (used) জিনিস কেনার প্রশংসা করে — যেমন "The Stuff I Never Buy Used" (Wisebread) বা "Why First-Rate Folks Love Second-Hand Stuff" (MSN Money)। ভাসা-ভাসা দেখলে (on face value) পরামর্শটা ভালো, কারণ used জিনিস সাধারণত সস্তা। কিন্তু গেম থিওরির চোখে পরামর্শকে সমালোচনামূলকভাবে (critically) ভাবা খুবই জরুরি।

মনে করো বারের দৃশ্য: যে বলল "তুমি brunette-এ যাও", সে আসলে মনে মনে বলছিল "আশা করি এই বোকাটা brunette-এ যাবে, তাহলে আমি blonde নিতে পারব।" পুরনো জিনিস কেনার পরামর্শেও একই ছল থাকতে পারে — চলো একটা চিন্তা-পরীক্ষা দিয়ে দেখি।

চিন্তা-পরীক্ষা। ধরো তুমি আর ওই প্রবন্ধগুলোর সব পাঠক সত্যিই পরামর্শ মেনে used জিনিস কিনতে শুরু করল। ফলে —

  1. used জিনিসের চাহিদা বাড়বে, আর নতুন জিনিসের চাহিদা কমবে
  2. যথেষ্ট চাহিদা হলে used জিনিসের দাম বেড়ে যাবে
  3. চাহিদার এই আকস্মিক পালাবদলে used জিনিস তুলনামূলকভাবে দামি হয়ে পড়বে, আর নতুন জিনিস তুলনামূলকভাবে সস্তা — দুটো কারণে: (ক) নতুনের চাহিদা কমেছে, আর (খ) "used কেনা এখন ফ্যাশন" হওয়ায় নতুন জিনিসের resale value বেড়ে গেছে।
  4. চরম ক্ষেত্রে — সবাই "used কেনো" পরামর্শ মানলে আসলে নতুন কেনাই সঠিক সিদ্ধান্ত হয়ে যাবে!

আসল মোচড়টা (the kicker) এবার। প্রথম যারা বুঝবে যে "নতুন জিনিসই এখন ভালো ডিল", তারা হলো এই personal finance বিশেষজ্ঞরাই। প্রবণতা স্পষ্ট হলে তারা উল্টো ঘুরে লিখবে "নতুন কেনো" — আর গোটা চক্রটা আবার শুরু হবে!

মোদ্দা কথা: বন্ধুসুলভ আর্থিক পরামর্শের একটা কৌশলগত মানে (implication) আছে। পরামর্শটা তোমার জন্য সামান্য ভালো হতে পারে, কিন্তু পরামর্শদাতার জন্য প্রায়ই বেশি ভালো। তাই personal finance পরামর্শে সন্দিহান হওয়া বুদ্ধিমানের কাজ — এর অনেকটাই আসলে সেই "বন্ধু যে আমাকে brunette-এ পাঠিয়ে নিজে blonde-এ যায়"-এর সমতুল্য।

২.৪ The Prisoner's Dilemma — বন্দীর দ্বিধা

এবার গেম থিওরির সবচেয়ে বিখ্যাত উদাহরণ। এটি নিয়ে আস্ত বই লেখা হয়েছে — যেমন William Poundstone-এর The Prisoner's Dilemma (১৯৯২)। খেলাটি ১৯৫০-এর দশকে RAND Institute-এ তৈরি হয়। এর পরিণতি বেদনাদায়ক হলেও গল্পটা এত চিত্তাকর্ষক আর দৈনন্দিন অভিজ্ঞতার সাথে এত জড়ানো যে এটিই গেম থিওরিকে জনপ্রিয় করে তোলে।

গল্পটা একটা থানায়। দুই সন্দেহভাজনকে একটা অপরাধে ধরা হয়েছে। পুলিশ প্রায় নিশ্চিত তারা দোষী, কিন্তু জোরালো (physical) প্রমাণ নেই — দৃঢ় সাজার জন্য অন্তত একজনের স্বীকারোক্তি দরকার। দুজনকে আলাদা ঘরে জেরা করা হয়। পুলিশ এখানে ধাপ্পা (bluffing) দেয় না; বদলে প্রত্যেককে সরাসরি বলে দেয় যে ফল নির্ভর করবে দুজন কী করে তার ওপর:

  • দুজনেই তথ্য লুকালে (conceal): সামান্য প্রমাণে দুজনেরই ১ বছর জেল।
  • দুজনেই ফাঁস করে স্বীকার করলে (disclose): দুজনেরই দোষ প্রমাণ, ৩ বছর জেল।
  • শুধু একজন ফাঁস করলে: সে মুক্ত (পুরস্কার), আর অন্যজন স্বীকার না করার শাস্তি হিসেবে ভারী ৪ বছর জেল।

প্রথম দেখায় মনে হয় তারা বেশ সুবিধাজনক অবস্থায়: দুজনেই চুপ থাকলে পুলিশের হাতে সামান্য প্রমাণ, দুজনেই হালকা সাজা পায় — এটাই দুজনের যৌথ সেরা ফল (best joint outcome), আর নিজেদের ভাগ্য যেন নিজেদেরই হাতে। কিন্তু প্রত্যেকে কৌশলগতভাবে ভাবলে কি সত্যিই সেটাই ঘটবে?

Prisoner's Dilemma payoff matrix with jail terms for two suspects

চিত্র ১: বন্দীর দ্বিধার payoff matrix। প্রতিটা ঘরে জোড়া সংখ্যা — একটা ordered pair (সন্দেহভাজন ১-এর জেল, সন্দেহভাজন ২-এর জেল)। প্রত্যেকের দুটো করে চাল বলে মোট চারটে ঘর। সংখ্যা ঋণাত্মক, কারণ জেল একটা অবাঞ্ছিত ফল (কম ঋণাত্মক = ভালো)। এটাই একটা "game theory matrix" — বইজুড়ে বারবার আসবে।

বিশ্লেষণ (best response দিয়ে)। মনে রাখো, Nash equilibrium মানে প্রত্যেকে অন্যের চালের সেরা জবাব খেলছে। তাই সিদ্ধান্ত নেওয়ার সঠিক উপায় — সঙ্গীর প্রতিটা সম্ভাব্য চালের জবাবে আমার সেরা করণীয় আলাদা করে ভাবা। তুমি একজন সন্দেহভাজন সেজে ভাবো:

  • সঙ্গী যদি ফাঁস করে (disclose): তুমিও ফাঁস করলে \(3\) বছর; তুমি লুকালে ভারী \(4\) বছর। ফাঁস করাই ভালো।
  • সঙ্গী যদি লুকায় (conceal): তুমি লুকালে \(1\) বছর; তুমি ফাঁস করে পুলিশকে সাহায্য করলে \(0\) বছর (মুক্ত)। আবারও ফাঁস করাই ভালো।

অর্থাৎ সঙ্গী যা-ই করুক, তোমার পক্ষে ফাঁস করাই ভালো — তথ্য ফাঁস করা তোমার একটা প্রভাবশালী কৌশল (dominant strategy)। আর আগের পাঠ বলে: প্রভাবশালী কৌশল থাকলে সেটাই খেলা উচিত (প্রতিপক্ষের চাল আন্দাজ করারও দরকার নেই)। তাই তুমি ফাঁস করো। সঙ্গীও ঠিক একই যুক্তিতে ফাঁস করে। ফল — দুজনেই ৩ বছর

অথচ দুজনেই যদি নিছক চুপ থাকত (প্রভাবশালী কৌশল উপেক্ষা করে), দুজনের হতো মাত্র ১ বছর করে! সেরা জবাব খেলেই দুজনে আরও খারাপ ফলে পৌঁছাল — এই-ই দ্বিধা: প্রত্যেকে যখন কেবল ব্যক্তিস্বার্থ ভাবে, ফলটা হয় এমন এক Nash equilibrium যা দলের প্রত্যেকের জন্যই খারাপ।

Best-response arrows all pointing to the mutual-defect Nash equilibrium

চিত্র ২: প্রতিটা best-response তীর একই ঘরে এসে ঠেকে — (Defect, Defect)। এখানে ছবিটা "বেশি সংখ্যা = ভালো" রূপে (payoff, জেল নয়)। নীল তীর তোমার সেরা চাল, লাল তীর প্রতিপক্ষের সেরা চাল; প্রতিটা ঘর থেকেই একা সরে "defect"-এ যাওয়া লাভজনক, তাই সব তীর Nash ঘরে জড়ো হয়। অথচ (Cooperate, Cooperate) ঘরটাই জোড়ার জন্য সবচেয়ে ভালো (মোট \(3+3=6\))।

কেন সন্দেহভাজনদের আলাদা ঘরে রাখা হয়?

কয়েকটা বাস্তব প্রশ্ন মাথায় আসতে পারে:

  • সবাই কি সত্যিই স্বীকার করে? না — বাস্তবে সন্দেহভাজনরা সবসময় স্বীকার করে না। একটা কারণ: "snitch (মুখবির)" বলে গাল খাওয়ার একটা ঋণাত্মক প্রাপ্তি আছে, যা এই সরল মডেলে ধরা হয়নি।
  • কথা বলতে পারলে? তারা যদি পরস্পরের সাথে কথা বলতে পারত, হয়তো দুজনে চুপ থাকতে রাজি হতো — ঠিক এই কারণেই তাদের আলাদা ঘরে রাখা হয়, যাতে যোগাযোগ না করতে পারে।
  • রাজি হলেও? এমনকি একসাথে কাজ করতে রাজি হলেও কোনো বাধ্যতামূলক চুক্তি (binding contract) নেই। কথায় খরচ নেই ("talk is cheap") — একজন "চুপ থাকব" বলে গোপনে মত বদলে অন্যজনের পিঠে ছুরি মারতে পারে।

Prisoner's Dilemma একই সাথে বেদনাদায়ক (সহযোগিতা হলো না) আর চমৎকার (প্রত্যেকের যুক্তি নিখুঁত, আর স্বার্থপরতার প্রলোভন প্রায় অনিবার্য)।

এই দ্বিধার ছাঁচটা এবার দৈনন্দিন জীবনের নানা ঘটনায় খুঁজে দেখব — প্রতিটা গল্প উৎস ধরে ধরে, পুরো বিস্তারিতসহ।

২.৫ An Ancient Indian Proverb — বালি ও গোবর

Prisoner's Dilemma ১৯৫০-এর দশকে সূত্রবদ্ধ হলেও, ব্যক্তি ও দলস্বার্থের এই দ্বন্দ্ব প্রাচীনকাল থেকেই জানা। A Collection of Telugu Proverbs বইয়ে (Telugu ভারতের একটি ভাষা) এমন একটা প্রবাদ আছে; বইটা প্রকাশিত হয় ১৮৬৮ সালে, তাই প্রবাদটা নিশ্চয়ই আরও শত শত বছরের পুরনো। প্রবাদটা:

"Cheating with sand, cheating with cowdung" (বালি দিয়ে ঠকানো, গোবর দিয়ে ঠকানো)।

গল্পটা এই। দুই ভ্রমণকারীর দেখা হলো, আর তারা অস্বচ্ছ (opaque) পুঁটুলিতে লুকানো পণ্য বিনিময় করতে রাজি হলো — একজনের কাছে কাঁচা চাল (raw rice), অন্যজনের কাছে সেদ্ধ চাল (parboiled rice)। রাজি হয়ে দুজনেই সঙ্গে সঙ্গে দুই দিকে ছুটল। কিন্তু শেষে দুজনেই দেখল, অন্যজন তাকে ঠকিয়েছে: একজনের পুঁটুলিতে চালের বদলে বালি, আর অন্যজনের পুঁটুলিতে চালের বদলে গোবর

এটা সরাসরি একটা Prisoner's Dilemma — প্রত্যেক ব্যবসায়ীর প্রণোদনা (incentive) দেখো:

  • অন্য ব্যবসায়ী সৎ হবে ভাবলে — নিজে কিছু না দিয়ে ঠকানোই বেশি লাভজনক (বিনা মূল্যে চাল পেলাম!)।
  • অন্য ব্যবসায়ী ঠকাবে ভাবলে — কিছু দিয়ে ঠকার চেয়ে বিনিময়ে ঠকানোই স্পষ্ট বুদ্ধিমানের কাজ।

দুজনেরই ঠকানো একটা প্রভাবশালী কৌশল, তাই দুজনেই ঠকায়। অথচ দুজনে সৎ থাকলে দুজনেই ঠিক সেই চালের বিনিময়টা পেত যা তারা শুরুতে চেয়েছিল।

শিক্ষা: বিশ্বাস (trust) না থাকলে যে-কোনো দ্বিপাক্ষিক লেনদেন (bilateral transaction) Prisoner's Dilemma-য় গড়াতে পারে। আধুনিক সমাজ ও অর্থব্যবস্থার একটা বড় কৃতিত্ব — reputation (সুনাম)punishment (শাস্তি)-র মতো নানা ব্যবস্থা বিশ্বাস তৈরি করে, তাই সহযোগিতা সম্ভব হয়। নইলে নিজের ভরসায় ছেড়ে দিলে আমরা হয়তো কিছুই সম্পন্ন করতে পারতাম না। যেমন স্প্যানিশ প্রবাদ বলে — "One trick is met by another" (এক ছলের জবাব আরেক ছল)।

২.৬ Visiting the Doctor — চিকিৎসা-পরামর্শের খেলা

"So take these pills, get a blood report, and see me in a few weeks," — বললেন লেখকের ডাক্তার।

লেখক একটু থমকে গেলেন। এটা ছিল তাঁর প্রথম প্রাপ্তবয়স্ক শারীরিক পরীক্ষা (physical)। তিনি মোটামুটি সুস্থ, তবু সতর্কতা হিসেবে তাঁকে একটা prescription ওষুধ খাওয়ার পরামর্শ দেওয়া হলো — সম্ভবত সারাজীবনের জন্য। কী করবেন, বুঝতে পারছিলেন না। ডাক্তারকে কি বিশ্বাস করা যায়?

সাধারণত ডাক্তাররা বিশ্বাসযোগ্য ও ভালো মানুষ। কিন্তু রোগীর মনে prescription, test বা surgery-র প্রয়োজনীয়তা নিয়ে সন্দেহ জাগতে পারে — কারণ মার্কিন স্বাস্থ্যসেবা স্বাস্থ্য-ফলাফলের (health outcomes) বদলে প্রায়ই কাজের পরিমাণে (activity) টাকা দেয়। আর এই বিশ্বাসের প্রশ্নটাই একটা Prisoner's Dilemma হয়ে উঠতে পারে।

The Medical Consultation Game (চিকিৎসা-পরামর্শের খেলা)। ধরো এক স্থূলকায় প্রাপ্তবয়স্ক, যার চিকিৎসা দরকার কিন্তু ইচ্ছে নেই, বন্ধুদের অনুরোধে ডাক্তারের কাছে গেলেন।

  • ডাক্তারের দুই পছন্দ: (ক) ৫ মিনিটে সামান্য কার্যকর (mildly effective) একটা ওষুধ লিখে দেওয়া, অথবা (খ) ১৫ মিনিট ব্যয় করে খাদ্য ও ব্যায়ামে বেশি কার্যকর জীবনধারার পরামর্শ (lifestyle changes) দেওয়া — এটা বাড়তি খাটুনি (extra effort)।
  • রোগীর দুই পছন্দ: (ক) পরামর্শ উপেক্ষা করে দ্বিতীয় মত (second opinion) নেওয়া, অথবা (খ) ডাক্তারের কথা মেনে চলা — এটাও বাড়তি খাটুনি।

চারটে সম্ভাব্য ফল:

  1. দুজনেই বাড়তি খাটল: ডাক্তার জীবনধারার পরামর্শ দিলেন, রোগী তা মানলেন — এটাই দুজনের জন্য সেরা ফল
  2. শুধু ডাক্তার বাড়তি খাটল: ভালো পরামর্শ দিলেন, রোগী উপেক্ষা করলেন।
  3. শুধু রোগী বাড়তি খাটল: ডাক্তার ওষুধ দিলেন, রোগী তা খেলেন।
  4. কেউই বাড়তি খাটল না: ডাক্তার ওষুধ দিলেন, রোগী তা খেলেন না।

সেরা ফল "দুজনেই বাড়তি খাটল"। কিন্তু কৌশলগতভাবে ভাবলে প্রাপ্তির ছাঁচটা Prisoner's Dilemma-র মতো — দুজনেই বাড়তি খাটুনি এড়াতে চায়। কেন, দেখো:

  • রোগীর ভাবনা: ওষুধ যদি অকার্যকর হয়, তাহলে উপেক্ষা করাই ভালো। আবার ভালো জীবনধারার পরামর্শ পেলেও উপেক্ষার প্রলোভন থাকে — কারণ দ্বিতীয় মত তো সবসময় নেওয়া যায়। → উপেক্ষা প্রভাবশালী।
  • ডাক্তারের ভাবনা: রোগী উপেক্ষা করবে জানলে দ্রুত ওষুধ লিখে সময় বাঁচানোই ভালো। রোগী মানবে সন্দেহ করলেও ওষুধ লেখার প্রলোভন থাকে — কারণ সাধারণ ধারণা হলো, রোগীরা জীবনধারা বদলায় না, তবে prescription খায়। → ওষুধ লেখা প্রভাবশালী।

ফল: কেউই বাড়তি খাটে না — ডাক্তার prescription লেখেন, রোগী তা খান না বা দ্বিতীয় মত নেন। সম্ভাব্য লাভ সত্ত্বেও দুজনের সহযোগিতার সেরা ফলটা অধরাই থাকে।

খারাপ খবর: এটা বাস্তবের চিকিৎসা-পরামর্শ থেকে খুব দূরের কিছু নয়। ভালো খবর: এটা কেবল একটা মডেল — সব ডাক্তার-রোগী এমন আচরণ করেন না। অনেক ডাক্তার দারুণ, বাড়তি খাটেন; অনেক রোগীও তাই। আর রোগী যদি ডাক্তারকে বিশ্বাস করতে শেখে, দুজনেই বাড়তি খাটতে বেশি আগ্রহী হন। বিশ্বাসের প্রশ্নটা গুরুত্বপূর্ণ — চিকিৎসার ঘরেও Prisoner's Dilemma ফলাফলকে প্রভাবিত করে।

সূত্র (Source)

গল্পটা নেওয়া হয়েছে Quality and Safety in Health Care-এর ২০০৪ সংখ্যার একটি প্রবন্ধ থেকে: "Models of the medical consultation: opportunities and limitations of a game theory perspective" — লেখক C. Tarrant, T. Stokes ও A. M. Colman।

২.৭ Prisoner's Dilemma at the Casino — পোকার চিপ

লেখকের বন্ধু Jamie একজন পেশাদার পোকার খেলোয়াড়, সমস্যা কৌশলগতভাবে বিশ্লেষণ করায় অভ্যস্ত। একবার Las Vegas-এ থাকাকালীন সে একটা টুর্নামেন্টের প্রবেশ-নিয়মের মধ্যেই একটুকরো গেম থিওরি খুঁজে পেল।

Jamie নাম লেখাচ্ছিল Caesar's Palace-এর একটা টুর্নামেন্টে। নিয়ম: $65 প্রবেশ-ফি-তে (entry fee) পাওয়া যায় \(2{,}500\) চিপ। তার সাথে বাড়তি $5 দিলে অতিরিক্ত \(500\) চিপ। কেনা উচিত?

Jamie মাথায় একটা দ্রুত হিসাব করল: প্রথম কেনায় (buy-in) চিপ-প্রতি খরচ \(2.5\) সেন্ট, কিন্তু বাড়তি কেনায় চিপ-প্রতি মাত্র \(1\) সেন্ট। বাড়তি চিপ তুলনায় অনেক সস্তা — তাই এটা "no-brainer", সে কিনে নিল।

কিন্তু একটা ফাঁক (catch) আছে। বাড়তি টাকাটা prize pool-এ যায় না — সেটা সরাসরি ক্যাসিনোর ঘরে যায়। এই একটা খুঁটিনাটিই খেলাটাকে একটা বহু-ব্যক্তির (multi-person) Prisoner's Dilemma বানিয়ে দেয়। কেন? প্রত্যেক খেলোয়াড় এভাবে ভাবে:

  • অন্যরা বাড়তি চিপ না কিনলে — তুমি কিনলে সস্তায় "big stack"-এর সুবিধা পাও। পোকার টেবিলে বেশি চিপ থাকা মানে বেশি বাজি-ক্ষমতা (betting power), বিরাট সুবিধা। তাই কেনো।
  • অন্যরা বাড়তি চিপ কিনলে — তোমাকেও কিনতে হবে শুধু ওদের সাথে সমান থাকতে (stay even)। তাই আবারও কেনো।

সবার কাছেই তাই বাড়তি চিপ কেনা প্রভাবশালী কৌশল। ফল: সবাই \(3{,}000\) চিপ নিয়ে খেলা শুরু করে, কিন্তু prize pool একই থাকে। মোট ফলাফল — সবাই একই পুরস্কারের জন্য লড়তে জনপ্রতি $5 বেশি দিল। লাভ কার? একমাত্র ক্যাসিনোর।

Jamie বাড়তি চিপ কিনেছিল, আর লেখকের সন্দেহ নেই যে তিনি নিজেও একই কাজ করতেন। Jamie শুনেছে Las Vegas-এর বেশির ভাগ ক্যাসিনোর একই রকম "optional buy-in" নীতি আছে — আর তাতে অবাক হওয়ার কিছু নেই, কারণ ক্যাসিনোর জন্য এটা একটা চতুর চাল।

২.৮ JC Penney Loses $163 Million

খুচরো-বিক্রেতা (retailer) JC Penney খেলাটা বদলাতে চেয়েছিল। এই বড় কোম্পানিটা ভাবল, খদ্দেররা জটিল clearance sale আর বিরক্তিকর দামের কৌশলে (pricing tricks) ক্লান্ত। তাই ২০১২ সালে তারা চালু করল একটা সরল দামের ব্যবস্থা — প্রতিদিন অনুমেয় (predictable) কম দাম, এমনকি গোল সংখ্যায় (যেমন একটা শার্ট $6.99-এর বদলে $7)।

চালটা বড় ঝুঁকির ছিল, আর জুয়াটা ভেস্তে গেল। ২০১১-র প্রথম প্রান্তিকে (quarter) JC Penney লাভ করেছিল $64 million; ঠিক এক বছর পরে, ২০১২-র একই প্রান্তিকে, তারা $163 million ক্ষতি করল।

কী ভুল হলো? সমস্যাটা সততায় নয় — বরং সৎ দাম বেশির ভাগ দোকানের "nickel and dime" কৌশলের তুলনায় সতেজ (refreshing)। সমস্যা ছিল কৌশলগত চালটার প্রেক্ষাপটে (context): অন্য কোম্পানিগুলো সৎ দাম গ্রহণ করেনি। একটা খেলা দিয়ে বোঝা যাক। ধরো দুই কোম্পানি "honest" বা "tricky" দাম বাছতে পারে, আর খেলার বৈশিষ্ট্য:

  • বাজারের মোট মূল্য \(100\) ইউনিট মুনাফা।
  • "tricky" দাম চালাতে খরচ \(10\) ইউনিট (ক্রমাগত promotion চালানোর খরচ)।
  • দুজনেই honest বা দুজনেই tricky হলে বাজার সমান ভাগ।
  • একজন honest, একজন tricky হলে — tricky কোম্পানি প্রায় পুরো বাজার নেয় (net \(80\)), আর honest কোম্পানি পায় সামান্য (\(10\))।

JC Penney honest-vs-tricky pricing payoff matrix

চিত্র ৩: দুই দোকানের "honest / tricky" দামের payoff matrix। দুজনেই honest হলে বাজার পুরো \(100\) (৫০-৫০ ভাগ)। দুজনেই tricky হলে প্রত্যেকে \(10\) করে খরচ করে বলে পায় \(40\) করে (বাজার নেমে আসে \(80\)-এ)। একজন honest একজন tricky হলে honest পায় \(10\), tricky পায় net \(80\) — মোট \(90\), বাকি \(10\) tricky চালানোর খরচে হারিয়ে যায় (এই হারানো অংশটাকে বলে deadweight loss)।

কৌশল কী? সঙ্গী কোম্পানির প্রতিটা চালের জবাব আলাদা করে দেখো:

  • অন্যজন honest হলে: আমি honest-এ পাই \(50\), tricky-তে \(80\)tricky ভালো।
  • অন্যজন tricky হলে: আমি honest-এ পাই \(10\), tricky-তে \(40\) → আবারও tricky ভালো।

অতএব অন্যজন যা-ই করুক, tricky দামই প্রভাবশালী কৌশল। দুজনেই tricky খেলে \(40\) করে পায় — অথচ দুজনেই honest হলে \(50\) করে পেত। আচরণ-অর্থনীতিবিদ (behavioral economist) Xavier Gabaix MSNBC-র একটা প্রবন্ধে ব্যাখ্যা করেন কেন সৎ দাম ভালো আইডিয়া ছিল না:

"Once you educate consumers on the right way to shop, they will seek out the lowest cost store, and that will be the one with the shrouded prices. Once they are savvier consumers, you make less money from them." (খদ্দেরদের সঠিক কেনাকাটা শেখালে তারা সবচেয়ে কম দামের দোকান খুঁজবে — আর সেটা হবে যার দাম আড়াল করা (shrouded)। খদ্দের চালাক হলে তাদের কাছ থেকে কম লাভ হয়।)

এটা Prisoner's Dilemma-র অনুরূপ: দুই কোম্পানিই honest খেললে দুজনের লাভ হতো, কিন্তু প্রত্যেকে ছাড় দিয়ে প্রতিদ্বন্দ্বীর খদ্দের চুরির প্রলোভনে পড়ে। ফল — সবাই ছাড় দিতে থাকে, খদ্দের ছাড়ের পেছনে অঢেল সময় নষ্ট করে; আর এটা সম্ভবত সবার জন্যই খারাপ — JC Penney আর ক্রেতা, দুয়ের জন্যই।

সূত্র (Source)

Sullivan, Bob. "NBC News Technology." NBC News, ২৫ মে ২০১২।

২.৯ Unbranding — যেখানে দ্বিধায় একজন বিজয়ী থাকে

এতক্ষণ দেখলাম Prisoner's Dilemma খেলোয়াড়দের জন্য খারাপ। এই উদাহরণে একটা মোচড় — এখানে প্রণোদনার ফাঁদে পড়া খেলোয়াড়দের বাইরে একজন সুবিধাভোগী (beneficiary) আছে।

সাধারণত celebrity endorsement দুই পক্ষেরই লাভ (win-win): কোম্পানি তার পণ্যের প্রচার (visibility) বাড়ায়, আর তারকা টাকা পান। কিন্তু তারকার ভাবমূর্তি যখন বিতর্কিত বা "trashy", তখন ব্যাপারটা জটিল — কোম্পানি নিজেকে দূরে সরাতে চায়, অথচ তারকার ভক্তদেরও চটাতে চায় না।

Jersey Shore ছিল MTV-র একটা স্বল্পস্থায়ী রিয়্যালিটি শো (২০০৯–২০১২)। এর ধারণা ছিল — ইতালীয় বংশোদ্ভূত কিছু আমেরিকান গ্রীষ্মকালে Jersey Shore-এ হইহুল্লোড় করছে। শো-টা তুমুল জনপ্রিয় হলো, MTV-র জন্য রেকর্ড রেটিং আনল; আর তাতে দেখানো হইহুল্লোড় ছিল বুনো — অনেক সময় দেখা যেত cast-এর সদস্যরা মাত্রাতিরিক্ত পার্টি করছে।

একটা উদাহরণ — Nicole Polizzi, ডাকনাম "Snooki" — যাকে প্রায়ই দেখা যেত Gucci, Coach-এর মতো দামি designer handbag-এ বমি করতে! এই নেতিবাচক প্রচারে নিজেদের সুনাম নষ্ট হওয়ার ভয়ে handbag কোম্পানিগুলো একটা ছোট্ট খেলা শুরু করল — "unbranding"।

Snooki অভিযোগ অনুসারে Gucci ও Coach — দুই কোম্পানি থেকেই handbag পাচ্ছিল। কিন্তু NBC Philadelphia এই টাকা-দেওয়া endorsement-এ একটা মোচড় জানাল:

"The kicker: Coach is not sending [Snooki] Coach bags. They're sending her Gucci bags, and any other competing designer product they can..." (আসল মোচড়: Coach আসলে Snooki-কে Coach নয়, বরং Gucci — এবং যত প্রতিদ্বন্দ্বীর পণ্য পারে — পাঠাচ্ছে।)

মজার ব্যাপার, প্রতিটা কোম্পানি প্রতিদ্বন্দ্বীকে ধ্বংস করার চেষ্টায় লড়ছিল, সম্ভবত "the enemy of my enemy is my friend" যুক্তিতে। কিন্তু কাছ থেকে দেখলে এই brand warfare কোম্পানিগুলোর জন্য মোটেও ভালো নয় — এটা একটা Prisoner's Dilemma। Coach ও Gucci-র প্রতিটার সামনে দুই পছন্দ — কিছু না পাঠানো, অথবা টাকা খরচ করে প্রতিদ্বন্দ্বীকে ঘায়েল করা:

  • অন্য কোম্পানি পিঠে ছুরি মারলে (তোমার bag Snooki-কে পাঠালে) — তুমিও পাল্টা তাদের bag পাঠিয়ে প্রতিশোধ নেবে।
  • অন্য কোম্পানি কিছু না করলে — তবু Snooki-কে প্রতিদ্বন্দ্বীর bag পাঠিয়ে তাদের "unbrand" করার আরও বেশি কারণ।

তাই পিঠে-ছুরি-মারা (backstab) প্রভাবশালী কৌশল। শেষে দুজনেই একে অন্যের bag Snooki-কে পাঠায় → দুজনের ভাবমূর্তিই ক্ষতিগ্রস্ত হয়, আর টাকাও খরচ হয়। স্পষ্ট পরাজিত — দুই কোম্পানি। আর বিজয়ী... Snooki! বিনামূল্যে দামি handbag। নেতিবাচক ভাবমূর্তি যে বিনামূল্যের designer bag এনে দেয়, তা প্রায়ই ঘটে না। কিন্তু এটাই Prisoner's Dilemma-র শক্তি: অন্যদের যদি এটা খেলাতে পারো, তুমি নিজে বিজয়ী হয়ে বেরোতে পারো।

সূত্র (Source)

Masterson, Teresa. "No Backsies! Designers Unload Competitors' Swag on Snooki." NBC 10 Philadelphia, ২০ আগস্ট ২০১০।

২.১০ The Competitive Edge — The Economist

Snooki-র রিয়্যালিটি শো থেকে এবার হঠাৎ লাফ দিয়ে সম্মানিত সাময়িকী The Economist-এ (এই বাক্যটা সম্ভবত আগে কেউ কখনো লেখেনি!)। কিন্তু Snooki-র আকস্মিক বিজয়ী কৌশল আর The Economist-এর subscription-প্রচারের কৌশলে একটা যোগসূত্র আছে — দুটোতেই Prisoner's Dilemma খাটে।

লেখক The Economist পড়তে ভালোবাসেন। মাঝেমধ্যে সাময়িকীটার ভেতরে ছাত্রদের জন্য gift subscription-এর প্রচারপত্র (promotional insert) থাকে। বিজ্ঞাপনের ভাষা সাধারণত ঘোরে "world-class insights"-এর কথায়, যা "inform and inspire"। কিন্তু একটা বিজ্ঞাপন কৌশলগত দিক থেকে বেশি চিত্তাকর্ষক ছিল। তার লেখা:

"Give the student the competitive edge with a gift subscription to The Economist." (একটা gift subscription দিয়ে ছাত্রকে দাও প্রতিযোগিতামূলক এগিয়ে-থাকা।)

ওই নির্দিষ্ট শব্দবন্ধ — "competitive edge" — লেখকের চোখ টানল। এটা The Economist-এর একটা চতুর কৌশল বলে মনে হলো: subscription-এর সিদ্ধান্তটাকেই একটা Prisoner's Dilemma-য় সাজানো, যেখানে বিজয়ী সাময়িকী নিজেই

ভালো trivia কী? ভাবো এই প্রশ্নটা — "MTV-তে প্রথম বাজা গান কোনটি?" trivia হিসেবে এতে ভালো প্রশ্নের সব উপাদান আছে: টিভি-ইতিহাসের একটা মজার মুহূর্ত, আর উত্তরটাও মানানসই — "Video Killed the Radio Star"। কিন্তু একটাই বড় সমস্যা: সবাই এই উত্তর জানে, তাই এটা কার্যত অকেজো trivia। যে গর্ব করে এটা বলে, তাকে চালাক ভাবা হয় না — বরং লোকে চুপচাপ হাসে, কারণ সে বোঝেনি যে সবাই আগে থেকেই জানে।

শিক্ষা: জ্ঞান কখনো একটা প্রতিযোগিতামূলক পণ্য (competitive good) হয়ে ওঠে। trivia-তে এগিয়ে থাকতে হলে সবাই-জানা জিনিস বললে চলবে না — এমন কিছু জানতে হবে যা অন্যরা জানে না। আর এখানেই ফেরত আসে The Economist-এর দাবি।

পড়ার Prisoner's Dilemma। subscribe করার লাভ কী? এক দৃষ্টিতে — ব্যক্তিগত লাভ: শুধু ভাবো, সাময়িকীটা তার দামের চেয়ে বেশি মূল্য দেয় কি না। কিন্তু আরেক দৃষ্টিতে — competitive edge: তখন তোমাকে অন্যদের সিদ্ধান্তও ভাবতে হবে, আর সেখানেই গেম থিওরি ঢোকে। ধরো তুমি "read" বা "don't read" বাছো, অন্যরাও একই সিদ্ধান্ত নিচ্ছে:

  • কেউ পড়ে না → স্থিতাবস্থা (status quo), প্রত্যেকের প্রাপ্তি \(0\)
  • একজন পড়ে, অন্যজন নয় → পাঠক পায় প্রতিযোগিতামূলক এগিয়ে-থাকা (\(+1\)), আর অন্যজন পিছিয়ে পড়ে (competitive disadvantage, \(-2\))।
  • দুজনেই পড়ে → কোনো "edge" নেই (একই জ্ঞান দুজনেই পেল), উপরন্তু দুজনেই subscription-এর টাকা ও পড়ার সময় খরচ করল → দুজনেই স্থিতাবস্থার চেয়ে খারাপে (\(-1\) করে)।

The Economist read-vs-don't-read payoff matrix

চিত্র ৪: "read / don't read" খেলার payoff matrix। কেউ না পড়লে \(0\); একা পড়লে পাঠক \(+1\), অন্যজন \(-2\); দুজনেই পড়লে \(-1\) করে — এগিয়ে-থাকার সুবিধা কাটাকাটি হয়ে যায়, শুধু খরচটুকু থেকে যায়।

কৌশল যাচাই:

  • অন্যজন না পড়লে → পড়া দেয় \(+1\), না-পড়া দেয় \(0\) → পড়া ভালো।
  • অন্যজন পড়লে → পড়া দেয় \(-1\), না-পড়া দেয় \(-2\) (পিছিয়ে পড়ার শাস্তি) → পড়াই ভালো।

তাই পড়া প্রভাবশালী কৌশল; দুজনেই subscribe করে, আর দুজনেই স্থিতাবস্থার চেয়ে খারাপে ঠেকে — শুধু টাকা ও সময় খরচ হলো যাতে অন্যজন এগিয়ে না যায়। বিজয়ী — The Economist, যে কিনা দুটো নতুন গ্রাহক পেল!

কিছু সতর্কতা (Caveats)

উপরের বিশ্লেষণ কেবল এই সংকীর্ণ প্রশ্নে সীমাবদ্ধ — "একটা বহুল-প্রচারিত সাময়িকী পড়া কি প্রতিযোগিতামূলক সুবিধা দেয়?" বাস্তবে অনেক দিক আছে:

  • খবর পড়ার আরও অনেক উপায় আছে — বিনামূল্যে বা কম খরচে — যা সাময়িকীর subscription কমিয়ে দিয়েছে।
  • subscribe করা মানেই কেউ সেটা পড়ে বা বোঝে, তা নয়।
  • দুজনেরই লাভ হতে পারে — একজন হয়তো রাজনৈতিক প্রবন্ধ থেকে উপকৃত, অন্যজন ব্যবসায়িক প্রবন্ধ থেকে।
  • সর্বোপরি, জ্ঞান পারস্পরিক উপকারীও (mutually beneficial): সমাজ বেশি শিক্ষিত হলে, মানুষ বেশি সমালোচনামূলকভাবে ভাবলে সবার লাভ। ছাত্র হয়তো "competitive edge"-এর এই দ্বিধায় হারে, কিন্তু সে ও সমাজ দীর্ঘমেয়াদে জিততে পারে

২.১১ Southwest Airlines Makes $144 Million

একটা প্যাটার্ন স্পষ্ট হচ্ছে। বন্ধু Jamie আর retailer JC Penney — দুজনেই Prisoner's Dilemma-য় খেলোয়াড় হয়ে টাকা হারাল। অন্যদিকে Snooki (আকস্মিকভাবে) Coach ও Gucci-কে খেলিয়ে বিরাট লাভ করল, আর The Economist তার বিজ্ঞাপন দিয়ে নতুন পাঠকদের খেলায় টেনে subscription বাড়াতে চাইছে। সাধারণ শিক্ষা: তুমি Prisoner's Dilemma-র খেলোয়াড় হতে চাও না; তুমি চাও এমন পরিস্থিতি বানাতে যেখানে অন্যদের খেলতে হয় আর তুমি মুনাফা করো। খেলোয়াড়দের ক্ষতিই হতে পারে তোমার লাভ — এটা একটা গুরুত্বপূর্ণ ব্যবসায়িক শিক্ষা।

Southwest-এর বৈশিষ্ট্য — open-seating। Southwest Airlines-এর বোর্ডিং-প্রক্রিয়া অন্যরকম: নির্দিষ্ট আসন (assigned seat) নেই, বরং "open-seating" — যাত্রীরা উঠে যে-কোনো খালি আসনে বসতে পারে।

মানুষের এই open-seating নিয়ে একটা love/hate সম্পর্ক আছে। খারাপ দিক: দল বা পরিবার আগে থেকে পাশাপাশি আসন সংরক্ষণ করতে পারে না, আলাদা হয়ে যেতে পারে। ভালো দিক: এটা assigned seating-এর চেয়ে অনেক দ্রুত; গেটে কম সময় লাগা মানে Southwest-এর খরচ বাঁচে, আর তাতে পরোক্ষভাবে ভাড়াও কম থাকে। এই খরচ-সাশ্রয়ের কারণেই Southwest তার ৪২ বছরের পুরো ইতিহাসে open-seating চালিয়েছে। তবে ২০০৭ সাল থেকে কয়েকটা উল্লেখযোগ্য পরিবর্তন এসেছে — যার একটা ২০১০-এ $98 million আর ২০১১-এ $144 million আয় এনে দিল। আর এই আয়টাই আসলে যাত্রীদের একটা Prisoner's Dilemma-য় ফেলার ফল।

open-seating-এ সাম্প্রতিক পরিবর্তন। Southwest আসন নির্দিষ্ট না করলেও, বোর্ডিংয়ের একটা সুশৃঙ্খল পদ্ধতি রাখে:

  • ২০০৭-এর আগে: যাত্রীরা first-come, first-serve ভিত্তিতে বোর্ড করত — যে সবার আগে গেটে পৌঁছাত সে আগে উঠে সেরা আসন বেছে নিত। এতে যাত্রীরা গেটে "camping out" করত (আগেভাগে গিয়ে বসে থাকা), আর আসন বাঁচানো বা লাইন কাটা নিয়ে ছোটখাটো ঝগড়া লাগত।
  • ২০০৭-এ Southwest এই "cattle call" বন্ধ করল। নতুন নিয়মে প্রতিটা যাত্রীকে একটা বোর্ডিং গ্রুপ (A, B, বা C) আর একটা নম্বর দেওয়া হয়। গ্রুপ A আগে ওঠে, তারপর B, তারপর C; প্রতিটা গ্রুপের ভেতরে কম নম্বরওয়ালা আগে ওঠে। যাত্রীরা প্লেনে উঠে তবু যে-কোনো আসন বাছতে পারে, কিন্তু গেটে বিশৃঙ্খলা অনেক কমে যায়, কারণ সবাই নির্দিষ্ট ক্রমে লাইন দিতে পারে।

বোর্ডিং নম্বর কীভাবে ঠিক হয়? যাত্রী কখন check-in করল তার ওপর। যে সবচেয়ে আগে — ফ্লাইটের ২৪ ঘণ্টা আগে — check-in করে, সে ভালো বোর্ডিং-অবস্থান পায়। আর যে অনলাইনে check-in করতে ভুলে যায়, সে প্রায়ই "doomed" — লাইনের একদম শেষে।

এই বোর্ডিং-নিয়ম খেলাটাকে একটা মজার উপায়ে বদলে দিল। আগে পুরস্কার পেত যারা গেটে সবচেয়ে বেশিক্ষণ অপেক্ষা করত (অর্থাৎ যারা নিজের সময়ের মূল্য দিত না); এখন পুরস্কার পায় যারা আগেভাগে অনলাইনে check-in করতে পারে (সংগঠিত ও সাধারণত সচ্ছল মানুষ)।

একটা গৌণ বাজার (secondary market) গজাল। কিছু ওয়েবসাইট প্রযুক্তি দিয়ে যাত্রীকে ফ্লাইটের ২৪ ঘণ্টা আগে স্বয়ংক্রিয়ভাবে check-in করিয়ে দিত। সেবাটা নির্ভরযোগ্য, দাম মাত্র $1 — ব্যস্ত business traveler-দের কাছে খুবই আকর্ষণীয়। Southwest এগুলো কিছুদিন সহ্য করল, তারপর বন্ধ করে দিল, সিদ্ধান্ত নিল লাভটা তার নিজেরই তোলা উচিত। ২০০৯-এ তারা আনল open-boarding-এর সবচেয়ে সাম্প্রতিক পরিবর্তন — EarlyBird Check-in, আর এই অপশনটাই লক্ষ লক্ষ ডলার বাড়তি ফি এনে দিল।

The EarlyBird Prisoner's Dilemma। Southwest একটা press release-এ EarlyBird ব্যাখ্যা করল:

"Don't race. We'll save your place! Southwest is proud to announce its newest product, EarlyBird Check-in, which gives Customers the option to score an early boarding position by adding an additional $10 to the price of a one-way fare. The low-cost service automatically reserves a boarding position for Customers prior to general check-in..."

অর্থাৎ আসনের lottery না খেলে, যারা রাজি তারা এক-মুখী ভাড়ায় $10 বেশি দিয়ে অগ্রাধিকার-বোর্ডিং কিনতে পারে। একটা সূক্ষ্মতা (nuance): EarlyBird ভালো আসনের নিশ্চয়তা দেয় না — এটা শুধু নিশ্চিত করে যে এয়ারলাইন যাত্রীকে স্বয়ংক্রিয়ভাবে আগে check-in করিয়ে দেবে।

অনেক travel column ভাবল, সেবাটা কি $10-এর যোগ্য? কিন্তু ওই আলোচনাগুলো আসল ব্যাপারটা মিস করল। আসল প্রতিভা (genius) হলো — EarlyBird যাত্রীদের একটা Prisoner's Dilemma-য় ফেলে দিল, যেখান থেকে Southwest বিপুল মুনাফা করতে পারে। একজন যাত্রী ভাবে সে $10 দেবে কি না — তার মাথায় খেলাটা এমন: "$10 দিয়ে ভালো আসন, নাকি $0 দিয়ে lottery-র আসন?" কিন্তু আসল খেলাটা আরও জটিল, কারণ সে অন্য যাত্রীদের সাথে প্রতিযোগিতা করছে — যারা ঠিক একই সিদ্ধান্ত নিচ্ছে। দুই যাত্রীর মধ্যে খেলাটা দেখো:

  • কেউ EarlyBird না নিলে → দুজনেই seating-lottery-তে মোটামুটি (okay) আসন পায়।
  • শুধু একজন $10 দিলে → সে ভালো (good) আসন পায়।
  • দুজনেই $10 দিলে → দুজনেই আবার অগ্রাধিকার-lottery-তে পড়ে, কিন্তু এবার দুজনেই $10 খরচ করেছে।

Southwest EarlyBird Check-in payoff matrix with seat outcomes

চিত্র ৫: EarlyBird Check-in-এর payoff matrix (আসনের ফলে)। কেউ না দিলে দুজনেই "okay" আসন; একা দিলে সে "good", অন্যজন "bad"; দুজনেই দিলে দুজনেই আবার "okay" — কিন্তু এবার দুজনেই $10 খরচ করেছে।

কৌশল যাচাই:

  • অন্যজন না দিলে → ভালো আসন চাইলে $10 দাও (good বনাম okay)।
  • অন্যজন দিলে → তুমিও দাও, নাহলে নিশ্চিত খারাপ (bad) আসন (okay বনাম bad)।

তাই $10 দেওয়া প্রভাবশালী কৌশল। দুজনেই $10 বাঁচিয়ে lottery খেললেই ভালো হতো, কিন্তু যেহেতু তারা প্রতিযোগিতা করে, দুজনেই lottery খেলার "অধিকার" কিনতে $10 খরচ করে।

The Bottom Line — Profits, Profits, Profits। কিছু যাত্রী কখনোই $10 দেবে না। কিন্তু বাস্তবে একটা ভালো অংশ দিতে রাজি, আর তারা এই Prisoner's Dilemma-য় ধরা পড়ে। Southwest বিপুল লাভ করল: ২০১০-এ EarlyBird থেকে বাড়তি $98 million আয় (প্রত্যাশা ছাড়িয়ে); ২০১১-এ সেই আয় ৪৪% বেড়ে দাঁড়াল প্রায় $144 million-এ (বইয়ের এক জায়গায় $142M-ও উল্লেখ)।

শুরুতে অল্প লোক $10 দিত, তাই তখন এটা ভালো আসনের নিশ্চয়তাই দিত। এখন এত লোক দেয় যে খোদ Southwest-ও স্বীকার করে — $10 দিলেও প্রথম ৬০টি অবস্থানের (A boarding position) মধ্যে বোর্ডিং নিশ্চিত নয়:

"While EarlyBird Check-In doesn't guarantee an A boarding position [that is, the first 60 positions], it improves your seat selection options to help you get your favorite seat."

উজ্জ্বল দিকটা হলো — যাত্রীরা এই খেলায় কার্যত আটকে (stuck) পড়ে। একজন যাত্রী একা এই খেলা ছেড়ে দিতে পারে না, কারণ ছাড়লেই খারাপ আসন। উপরন্তু, যত বেশি লোক অগ্রাধিকার-বোর্ডিং কেনে, বাকিদের অবস্থান তত খারাপ হয় — তাই খেলাটা আরও বেশি লোককে $10 দিতে টানে।

অবশ্য একটা সীমাবদ্ধতাও আছে: খুব বেশি লোক EarlyBird নিলে Southwest সবাইকে ভালো আসন দিতে পারবে না; কেউ কেউ খারাপ অবস্থানে পড়ে, টাকা দিয়েও ঠকল ভেবে বিরক্ত হবে — তাতে EarlyBird-এর মূল্য কমে যাবে। তবু নিকট ভবিষ্যতে এটা সমস্যা হওয়ার আশঙ্কা কম: Southwest খরচ-সচেতন যাত্রীদের এয়ারলাইন, তাই অনেকেই কখনো $10 দেবে না, আর EarlyBird অগ্রাধিকার দিতেই থাকবে। মানে EarlyBird বহু বছর লাভজনক থাকবে। সাবাশ, Southwest।

২.১২ Golden Balls TV Show — Split or Steal

ব্রিটিশ টিভি গেম-শো Golden Balls-এর একটা পর্ব "Split or Steal"। একটা পুরস্কারের টাকা (ধরো £১০০,০০০) দুই প্রতিযোগীর "split" বা "steal" বাছাইয়ের ওপর ভাগ হয়:

  • দুজনেই split করলে → পুরস্কার সমান ভাগ।
  • একজন split, একজন steal করলে → যে steal করে সে সব নেয়, অন্যজন শূন্য
  • দুজনেই steal করলে → দুজনেই শূন্য হাতে ফেরে।

Golden Balls Split-or-Steal payoff matrix in percentages

চিত্র ৬: "Split or Steal"-এর payoff matrix (শতাংশে)। দুজনেই split হলে ৫০-৫০; একজন steal করলে সে ১০০%, অন্যজন ০%; দুজনেই steal হলে দুজনেই ০%।

এটা Prisoner's Dilemma-র একটা নিখুঁত উদাহরণ: প্রত্যেকের steal একটা প্রভাবশালী কৌশল, কিন্তু দুজনেই steal করলে দুজনেই শূন্য হাতে ফেরে। তবে একটা মোচড় আছে — দুজন প্রতিযোগী একই ঘরে, বাছার আগে কথা বলতে পারে। এই বাড়তি যোগাযোগ কি সাহায্য করবে?

১৪ মার্চ ২০০৮-এর একটা পর্বে £১০০,১৫০ বাজি ছিল। SarahStephen কৌশল নিয়ে আলোচনা করলেন। Stephen বললেন তিনি split করবেন, কারণ steal করলে টিভির সব দর্শক তাঁকে ঘৃণা করবে বলে তাঁর মনে হচ্ছে। Sarah-ও একই সুরে বললেন তিনি split করবেন, কারণ steal করলে তাঁর বন্ধু তাঁর ওপর বিরক্ত হবে।

দুজনে শেষ প্রতিশ্রুতি দেওয়ার পর সঞ্চালক তাঁদের বল খুলে দেখাতে বললেন। Stephen দেখালেন "split", আর Sarah দেখালেন... "steal"! Sarah পুরো £১০০,১৫০ জিতে নিলেন।

সত্যি বলতে দৃশ্যটা দেখা কষ্টকর। Stephen সাধ্যমতো চেষ্টা করেছিলেন, কিন্তু শেষে তাঁর আর জেতার উপায় ছিল না — কারণ Sarah একটা আগের খেলায় প্রতারিত হওয়ার তিক্ততা কাটিয়ে উঠতে পারেননি। Sarah আসলে সামনের ছোট খেলাটা খেলছিলেন না, বরং একটা বড় খেলা ভাবছিলেন, যেখানে তিনি আর দ্বিতীয়বার ঠকতে (double-crossed) চাননি। তিনি প্রভাবশালী কৌশলই খেললেন।

শিক্ষা: Prisoner's Dilemma-য় কথা বলতে পারলেও তা যথেষ্ট নাও হতে পারে, কারণ চুক্তি বাধ্য (enforce) করার কোনো উপায় নেই

সূত্র (Source)

Golden Balls. "£100,000 Split Or Steal? 14/03/08." YouTube ভিডিও ক্লিপ, ১৪ মার্চ ২০০৮।

২.১৩ Beating the Prisoner's Dilemma — দ্বিধাকে হারানো

বেশির ভাগ মানুষ Prisoner's Dilemma-র মুখে একইভাবে ভাবে। তারা জানে প্রভাবশালী স্বার্থপর কৌশল সবাই খেললে দলের জন্য খারাপ, তাই তারা অন্যকে বোঝায় "প্রভাবশালী কৌশল খেলো না"। Golden Balls-এ প্রতিযোগীরা সাধারণত সময়টা কাটায় বারবার প্রতিশ্রুতি দিয়ে — "আমি split করব, তুমিও করো"।

কিন্তু আগের উদাহরণেই দেখলাম, এটা নিশ্চিত (foolproof) কৌশল নয়, ভালো কৌশলও নয়। Prisoner's Dilemma-য় অন্যজনকে বিশ্বাস করার আগে সাবধান হওয়া উচিত, আর অন্যজনেরও তোমার উদ্দেশ্য নিয়ে সন্দিহান হওয়া উচিত। তবু, Golden Balls-এরই আরেকটা পর্বে দেখা গেছে দ্বিধা হারানোর একটা চাতুর্যপূর্ণ (ingenious) উপায়।

কেন "আমি split করব" প্রতিশ্রুতি খারাপ। এই প্রতিশ্রুতি দিয়ে তুমি আসলে খেলাটা বদলাতে চাইছ — অন্যজনকে বলছ, মূল payoff-গুলো ভুলে গিয়ে শুধু এইটুকু ধরে নাও যে তুমি split করছ, আর সেই অনুমানে খেলাটা ভাবো।

Golden Balls sub-game after you promise to split

চিত্র ৭: তুমি "split করব" প্রতিশ্রুতি দিলে অন্যজনের সামনে থাকে শুধু এই একটা সারি — সে split করলে ৫০%, steal করলে পুরো ১০০%। তাই তোমার প্রতিশ্রুতি অন্যজনের কাছে steal-কেই আকর্ষণীয় করে তোলে।

সমস্যাটা দেখতে পাচ্ছ? তুমি split করবে বললে অন্যজনের সামনে steal-এর এক লোভনীয় সুযোগ খুলে যায়: সে split করলে পায় মোটে ৫০%, কিন্তু steal করলে পুরো ১০০%। মানে তুমি "আমি split করব" বলে কার্যত অন্যজনকে বলছ "mutual steal নিয়ে ভেবো না" — তাতে তার পক্ষে steal করাই দারুণ বুদ্ধি হয়ে যায়। তাহলে অন্য উপায় আছে?

Know Thyself — শয়তানি চাল। সহযোগিতা আদায়ের একটা অদ্ভুত-চতুর (remarkably devious) উপায় আছে: তাকে বলো তুমি steal করবে! এক পর্বে প্রতিযোগী Nick সঙ্গে সঙ্গে ঘোষণা করল:

"I want you to trust me. 100 percent I am going to pick the steal ball. I want you to choose split, and I promise you that I will split the money with you [after the show]." (আমাকে বিশ্বাস করো। ১০০% আমি steal বলটাই বাছব। তুমি split বাছো, আর কথা দিচ্ছি — শো শেষে টাকাটা তোমার সাথে ভাগ করব।)

অন্য প্রতিযোগী এই কৌশলে হতভম্ব, দর্শকও মজা পেল। পরের দুই মিনিট এক মজার তর্ক চলল: Nick বারবার ব্যাখ্যা করে যাচ্ছে কেন সে steal করবে, আর অন্যজন এই হুমকিতে দিশেহারা — সে ভাবছে, দুজনে মিলে split করলেই তো হয়! সঞ্চালক মনে করালেন, Nick-এর পরিকল্পনা ঝুঁকিপূর্ণ, কারণ শো শেষে টাকা ভাগ করার প্রতিশ্রুতি রাখতে সে আইনত বাধ্য নয়

অন্য প্রতিযোগী Nick-কে "বোকা (idiot)" বলল, কিছুতেই নিজের এই বিপাক বিশ্বাস করতে পারছিল না। Nick খেলার নিয়ন্ত্রণ নিয়ে নিয়েছিল, আর সে মোটেও "ভালো মানুষ" সাজেনি। অন্যজন কেন সহযোগিতা করবে? Nick বারবার বলে গেল সে একজন সৎ মানুষ, শো শেষে নিশ্চয়ই টাকা ভাগ করবে।

আলোচনা শেষে দুজনে বল খুলল। অন্য প্রতিযোগী দেখাল "split", আর Nick-ও দেখাল... "split"! দুজনে ৫০-৫০ ভাগ করে নিলেন। অন্যজন অবাক হয়ে ভাবল, Nick কেন steal করবে বলে এত ভয় দেখাল — সে তো সহজে বলতে পারত যে সেও ভালো ব্যবহার করবে।

Nick-এর চাল কেন কাজ করেছিল? সে steal করার একটি জোরালো claim করেছিল, কিন্তু কোনো binding commitment করেনি—প্রমাণ হলো, শেষে সে নিজেই split বেছে নিয়েছিল। তার চালটি formal credible commitment নয়; এটি অন্য contestant-এর belief ও expected payoff প্রভাবিত করা strategic communication:

Golden Balls decision after the other contestant believes Nick's steal claim

চিত্র ৮: অন্য contestant যদি Nick-এর "steal করব" claim এবং পরে টাকা ভাগ করার promise—দুটিই বিশ্বাস করে, তবে তার perceived decision এমন হয়: steal করলে দুজনেই শূন্য; split করলে official payoff শূন্য, কিন্তু পরে positive transfer পাওয়ার সম্ভাবনা থাকে। তাই split তার best response হতে পারে। এটি weakly dominant strategy নয়, কারণ dominance বলতে opponent-এর সব possible strategy-র বিরুদ্ধে comparison বোঝায়।

অন্য contestant যদি probability \(p>0\) দেয় যে Nick steal করে পরে অর্ধেক transfer করবে, split-এর expected post-show payoff positive; নিজে steal করলে Nick-এর ঘোষিত steal-এর বিরুদ্ধে official payoff শূন্য। সেই belief-এর অধীনে split best response হতে পারে। কিন্তু Nick সত্যিই steal করতে বাধ্য ছিল না, transfer promise-ও enforceable ছিল না; তাই original one-shot game-এর strategy বা payoff আনুষ্ঠানিকভাবে বদলায়নি।

অন্য প্রতিযোগী ফলটায় খুশি হলেও চিৎকার করে বলল, "Why did you put me through that?" (আমাকে এত কষ্ট দিলে কেন?) — কারণ সিদ্ধান্ত নিতে তাকে সত্যিই ধস্তাধস্তি করতে হয়েছিল, অথচ শেষে জানল Nick তো সহযোগিতাই করবে।

Nick দেখিয়েছিল, one-shot game-এ persuasive communication কীভাবে opponent-এর belief বদলে cooperation-এর সম্ভাবনা বাড়াতে পারে। তবে তার "আমি steal করব" একটি সফল bluff, formal credible threat বা commitment নয়। অন্য contestant claim-টি না মানলে, post-show promise-কে অবিশ্বাস করলে, বা হুমকিতে রেগে গেলে কৌশলটি ব্যর্থ হতে পারত।

সূত্র (Source)

Golden Balls. "golden balls. the weirdest split or steal ever!" YouTube ভিডিও ক্লিপ, ৩ ফেব্রুয়ারি ২০১২।

৩. মূল সংজ্ঞা ও যুক্তি

এবার ধারণাগুলো একটু আনুষ্ঠানিকভাবে (formally) সাজাই।

খেলার উপাদান। একটা (strategic-form) খেলায় থাকে: কয়েকজন player (খেলোয়াড়) \(1, 2, \dots, n\); প্রতিটা খেলোয়াড় \(i\)-এর একটা strategy set (কৌশল-সেট) \(S_i\); সবার বাছাই মিলে একটা strategy profile (কৌশল-বিন্যাস) \(s = (s_1, \dots, s_n)\); আর প্রতিটা খেলোয়াড়ের একটা payoff function (প্রাপ্তি-অপেক্ষক) \(u_i(s)\), যা তার কাছে ফলাফলের মূল্য মাপে (বেশি \(u_i\) = ভালো)। খেলোয়াড় \(i\) ছাড়া বাকিদের বাছাই একসাথে লিখি \(s_{-i}\)

সংজ্ঞা — best response ও Nash equilibrium

Best response (সেরা জবাব): অন্যদের বাছাই \(s_{-i}\) স্থির ধরলে, খেলোয়াড় \(i\)-এর কৌশল \(s_i^{*}\) একটা সেরা জবাব যদি

\[ u_i(s_i^{*},\, s_{-i}) \ \ge\ u_i(s_i,\, s_{-i}) \quad \text{for all } s_i \in S_i . \]

Nash equilibrium (ন্যাশ ভারসাম্য): একটা কৌশল-বিন্যাস \(s^{*} = (s_1^{*}, \dots, s_n^{*})\) Nash equilibrium যদি প্রতিটা খেলোয়াড় একসাথে সেরা জবাব খেলে — অর্থাৎ

\[ u_i(s_i^{*},\, s_{-i}^{*}) \ \ge\ u_i(s_i,\, s_{-i}^{*}) \quad \text{for all } i \text{ and all } s_i \in S_i . \]

সহজ কথায়: অন্যরা যা করছে ধরে নিয়ে কেউ একা সরে গিয়ে নিজের প্রাপ্তি বাড়াতে পারে না

দুটো সতর্কতা মনে রাখো: (১) Nash equilibrium একাধিক হতে পারে (বারের দৃশ্য — চারজনের যে-কেউ blonde-এ), আবার (pure strategy-তে) নাও থাকতে পারে। (২) Nash equilibrium সামাজিকভাবে সর্বোত্তম নয় এবং খেলোয়াড়দের জন্য সেরাও নয় — এটা কেবল প্রতিযোগিতার স্থিতিশীল ফল (Hotelling, Bertrand, আর Prisoner's Dilemma — তিনটেই এর সাক্ষী)।

Dominant strategy (প্রভাবশালী কৌশল)। খেলোয়াড় \(i\)-এর কৌশল \(s_i^{\text{dom}}\) অন্য একটা কৌশল \(s_i'\)-কে strictly dominate করে যদি অন্যরা যা-ই করুক তা সবসময় বেশি প্রাপ্তি দেয়:

\[ u_i(s_i^{\text{dom}},\, s_{-i}) \ >\ u_i(s_i',\, s_{-i}) \quad \text{for all } s_{-i} . \]

একটা কৌশল যদি বাকি সব কৌশলকে dominate করে, সেটাই প্রভাবশালী কৌশল — আর প্রভাবশালী কৌশল থাকলে সেটাই খেলা উচিত (প্রতিপক্ষের চাল আন্দাজ করারও দরকার নেই)। বিপরীতে, "\(>\)"-এর জায়গায় "\(\ge\)" (এবং অন্তত এক ক্ষেত্রে "\(>\)") হলে সেটা weakly dominant (দুর্বলভাবে প্রভাবশালী)। Golden Balls-এর original payoff matrix-এ Steal, Split-কে weakly dominate করে; Nick-এর communication-এর পরে Split কেবল একটি belief-dependent best response হতে পারে, weakly dominant নয়।

Prisoner's Dilemma-র আনুষ্ঠানিক রূপ। দুই খেলোয়াড়, প্রত্যেকের দুই কৌশল — Cooperate (C)Defect (D)। চারটে প্রাপ্তি-মান (নিজের দিক থেকে, বেশি = ভালো):

  • \(T\) = Temptation (প্রলোভন): তুমি defect, অন্যজন cooperate।
  • \(R\) = Reward (পুরস্কার): দুজনেই cooperate।
  • \(P\) = Punishment (শাস্তি): দুজনেই defect।
  • \(S\) = Sucker (বোকার প্রাপ্তি): তুমি cooperate, অন্যজন defect।

খেলাটা Prisoner's Dilemma হয় যখন

\[ T \ >\ R \ >\ P \ >\ S . \]

কেন defect প্রভাবশালী? দুটো টুকরো দেখো:

  • অন্যজন cooperate করলে: তোমার defect দেয় \(T\), cooperate দেয় \(R\); আর \(T > R\), তাই defect ভালো।
  • অন্যজন defect করলে: তোমার defect দেয় \(P\), cooperate দেয় \(S\); আর \(P > S\), তাই defect ভালো।

সঙ্গী যা-ই করুক defect বেশি প্রাপ্তি দেয় — অতএব defect একটা প্রভাবশালী কৌশল, আর \((D, D)\)-ই একমাত্র Nash equilibrium। অথচ \(R > P\) বলে \((C, C)\) দুজনের জন্যই \((D, D)\)-র চেয়ে ভালো — এই ফাঁকটাই দ্বিধা। জেলের উদাহরণে প্রাপ্তি = ঋণাত্মক জেল-বছর, তাই

\[ T = 0 \ >\ R = -1 \ >\ P = -3 \ >\ S = -4 , \]

মানে "disclose" ঠিক এই ছাঁচে defect, আর দুজনেই disclose করে \((-3, -3)\)-এ আটকে যায়।

Bar chart: disclosing gives fewer jail years whatever the partner does

চিত্র ৯: কেন "disclose" প্রভাবশালী তার ছবি। বাঁ জোড়া — সঙ্গী conceal করলে: তুমি conceal-এ \(1\) বছর, disclose-এ \(0\) বছর। ডান জোড়া — সঙ্গী disclose করলে: তুমি conceal-এ \(4\) বছর, disclose-এ \(3\) বছর। দুই ক্ষেত্রেই disclose কম বছর দেয় (কম = ভালো), তাই disclose প্রভাবশালী কৌশল।

৪. উদাহরণ ও Analogy

Prisoner's Dilemma-র payoff matrix (table আকারে)। জেল-বছরের প্রাপ্তি (ঋণাত্মক, কম ঋণাত্মক = ভালো), সারি = সন্দেহভাজন ১-এর চাল, কলাম = সন্দেহভাজন ২-এর চাল:

সন্দেহভাজন ২: Disclose সন্দেহভাজন ২: Conceal
সন্দেহভাজন ১: Disclose -3, -3 0, -4
সন্দেহভাজন ১: Conceal -4, 0 -1, -1

একই খেলা "বেশি = ভালো" রূপে (\(T, R, P, S\) চিহ্নসহ), যেখানে Cooperate = চুপ থাকা, Defect = ফাঁস করা:

অন্যজন: Cooperate অন্যজন: Defect
তুমি: Cooperate R, R = 3, 3 S, T = 0, 5
তুমি: Defect T, S = 5, 0 P, P = 1, 1

এখানে \(T=5 > R=3 > P=1 > S=0\) — নিখুঁত Prisoner's Dilemma। প্রতিটা সারিতে Defect বেশি দেয় (কলাম স্থির রেখে), তাই Defect প্রভাবশালী; অথচ \((C,C)=(3,3)\) মোট \(6\), যা \((D,D)=(1,1)\)-এর মোট \(2\)-এর চেয়ে ঢের ভালো।

JC Penney (honest / tricky) — সংখ্যায়। বাজার \(100\), tricky-র খরচ \(10\):

Store 2: Honest Store 2: Tricky
Store 1: Honest 50, 50 10, 80
Store 1: Tricky 80, 10 40, 40

সেরা জবাব যাচাই: অন্যজন Honest হলে আমি \(50\) (Honest) বনাম \(80\) (Tricky) → Tricky; অন্যজন Tricky হলে \(10\) (Honest) বনাম \(40\) (Tricky) → Tricky। তাই Tricky প্রভাবশালী, দুজনেই \(40\) পায় — অথচ দুজনেই Honest হলে \(50\)। এখানেও \(T=80 > R=50 > P=40 > S=10\)

Southwest (EarlyBird) — একটা দৃষ্টান্তমূলক সংখ্যা-রূপ। ভালো আসন \(= 6\), মোটামুটি \(= 3\), খারাপ \(= 0\); আর $10 ফি-এর অস্বস্তি \(= 2\) (একই এককে)। তাহলে:

Traveler B: EarlyBird Traveler B: Not
Traveler A: EarlyBird 1, 1 4, 0
Traveler A: Not 0, 4 3, 3

(হিসাব: দুজনেই দিলে "okay" \(=3\) থেকে ফি \(2\) বাদ \(=1\); একা দিলে "good" \(=6\) থেকে ফি \(2\) বাদ \(=4\), অন্যজন "bad" \(=0\); কেউ না দিলে "okay" \(=3\) করে।) সেরা জবাব: অন্যজন Not হলে \(4\) (দাও) বনাম \(3\) (দিও না) → দাও; অন্যজন দিলে \(1\) (দাও) বনাম \(0\) (দিও না) → দাও। EarlyBird দেওয়া প্রভাবশালী, দুজনেই \(1\)-এ ঠেকে — অথচ কেউ না দিলে \(3\) করে পেত। ঠিক Prisoner's Dilemma (\(T=4>R=3>P=1>S=0\))।

Analogy — চারপাশে Prisoner's Dilemma। ছাঁচটা এক: সহযোগিতা করলে সবার ভালো, কিন্তু প্রত্যেকের একা defect করার লোভ, তাই দল খারাপে ঠেকে।

  • অস্ত্র প্রতিযোগিতা (arms race): দুই দেশ নিরস্ত্র থাকলে ভালো, কিন্তু প্রত্যেকের অস্ত্র বাড়ানোর প্রণোদনা → দুজনেই অস্ত্রে ভরে যায়।
  • অতিরিক্ত মাছ ধরা / চারণভূমি: সবাই সংযত থাকলে সম্পদ টেকে, কিন্তু প্রত্যেকে বেশি নিতে চায় → সম্পদ শেষ ("tragedy of the commons")।
  • খেলায় ডোপিং: কেউ ডোপ না করলে ন্যায্য, কিন্তু প্রত্যেকের এগিয়ে থাকার লোভ → সবাই ডোপ করে, কারও লাভ নেই, সবার ক্ষতি (স্বাস্থ্যহানি)।
  • বিজ্ঞাপন-যুদ্ধ, কনসার্টে দাঁড়িয়ে দেখা, ট্রাফিকে লেন বদল — সবই একই ছাঁচ।

৫. Python-এ করো

দুই ভাগে দেখি — প্রথমে একটা \(2 \times 2\) খেলায় best response ও pure-strategy Nash equilibrium খোঁজা, তারপর পুনরাবৃত্ত Prisoner's Dilemma-য় Tit-for-Tat-এর simulation।

(ক) \(2 \times 2\) খেলায় Nash equilibrium খোঁজা। প্রতিটা ঘরে দেখি — সারি-খেলোয়াড় কি একা সরে লাভ করতে পারে? কলাম-খেলোয়াড় কি পারে? কেউ না পারলে ঘরটা Nash equilibrium।

import numpy as np

# Prisoner's Dilemma, "বেশি = ভালো" রূপে (row = তুমি, col = অন্যজন)
# কৌশল 0 = Cooperate, 1 = Defect ;  T=5, R=3, P=1, S=0
A = np.array([[3, 0],    # row-খেলোয়াড়ের payoff (তোমার প্রাপ্তি)
              [5, 1]])
B = np.array([[3, 5],    # col-খেলোয়াড়ের payoff (অন্যজনের প্রাপ্তি)
              [0, 1]])
labels = ["Cooperate", "Defect"]

# প্রতিটা ঘর (i, j) যাচাই: কেউ একা সরে ভালো করতে পারে কি না
for i in range(2):
    for j in range(2):
        # সারি-খেলোয়াড় j কলাম স্থির রেখে সেরা সারি বাছবে?
        row_best = A[i, j] >= A[:, j].max()
        # কলাম-খেলোয়াড় i সারি স্থির রেখে সেরা কলাম বাছবে?
        col_best = B[i, j] >= B[i, :].max()
        if row_best and col_best:
            print(f"Nash equilibrium: ({labels[i]}, {labels[j]}) "
                  f"-> payoff ({A[i, j]}, {B[i, j]})")
# আউটপুট: Nash equilibrium: (Defect, Defect) -> payoff (1, 1)

লক্ষ করো — একমাত্র Nash equilibrium \((Defect, Defect)\), যদিও \((Cooperate, Cooperate)\) দুজনের জন্যই ভালো ছিল। A[:, j].max() মানে "ওই কলামে সারি-খেলোয়াড়ের সেরা সম্ভব প্রাপ্তি" — তার সমান হলে সেই সারি একটা best response। একই কোড দিয়ে JC Penney বা EarlyBird ম্যাট্রিক্সও যাচাই করতে পারো (শুধু A, B বদলে দাও) — সব ক্ষেত্রেই Nash ঘরটা defect-defect।

(খ) পুনরাবৃত্ত Prisoner's Dilemma — Tit-for-Tat। এক-দানে defect প্রভাবশালী; কিন্তু খেলা বারবার হলে "Tit-for-Tat (যেমন-কে-তেমন)" — প্রথমে সহযোগিতা, তারপর প্রতিপক্ষ আগের দানে যা করেছে তা-ই ফেরত — দারুণ কাজ করে।

import numpy as np

# প্রাপ্তি: (আমার চাল, প্রতিপক্ষের চাল) -> (আমার, প্রতিপক্ষের)
PAY = {('C','C'): (3, 3), ('C','D'): (0, 5),
       ('D','C'): (5, 0), ('D','D'): (1, 1)}

def all_d(mine, opp):   return 'D'                       # সবসময় defect
def all_c(mine, opp):   return 'C'                       # সবসময় cooperate
def tft(mine, opp):     return 'C' if not opp else opp[-1]   # যেমন-কে-তেমন
def grudger(mine, opp): return 'D' if 'D' in opp else 'C'    # একবার ঠকালে চিরশত্রু

def play(fa, fb, rounds=100):
    """দুই কৌশলের মধ্যে rounds দান খেলে মোট স্কোর ফেরত দেয়।"""
    ha, hb, sa, sb = [], [], 0, 0
    for _ in range(rounds):
        a, b = fa(ha, hb), fb(hb, ha)      # যে-যার ইতিহাস দেখে চাল বাছে
        pa, pb = PAY[(a, b)]
        sa, sb = sa + pa, sb + pb
        ha.append(a); hb.append(b)
    return sa, sb

# round-robin টুর্নামেন্ট: প্রত্যেকে সবার সাথে (নিজের সাথেও) খেলে
strategies = [("Always Defect", all_d), ("Always Cooperate", all_c),
              ("Tit-for-Tat", tft), ("Grudger", grudger)]
totals = {name: 0 for name, _ in strategies}
for na, fa in strategies:
    for nb, fb in strategies:
        sa, _ = play(fa, fb)
        totals[na] += sa

for name, score in sorted(totals.items(), key=lambda kv: -kv[1]):
    print(f"{name:18s}: {score}")
# আউটপুট (উপরে ভালো):
# Grudger           : 999
# Tit-for-Tat       : 999
# Always Cooperate  : 900
# Always Defect     : 808

Iterated Prisoner's Dilemma: head-to-head and round-robin tournament

চিত্র ১০: বাঁয়ে—Tit-for-Tat বনাম Always Defect মুখোমুখি। Always Defect প্রথম দানে TFT-কে একবার ঠকিয়ে সামান্য এগিয়ে থাকে (তারপর দুজনেই defect করে দানপ্রতি \(1\))। ডানে—round-robin tournament-এ মোট score: Tit-for-Tat ও Grudger শীর্ষে (\(999\)), কারণ তারা cooperative opponent-এর সঙ্গে দানপ্রতি \(3\) পায়; Always Defect (\(808\)) সবার সঙ্গে conflict তৈরি করে দানপ্রতি \(1\)-এ আটকে যায়। Repeated interaction-এ future retaliation incentive বদলাতে পারে; এটি Nick-এর non-binding one-shot bluff থেকে আলাদা mechanism।

৬. সাধারণ ভুল (Common mistakes)

  1. Nash equilibrium = সেরা ফল ভাবা। না — Nash equilibrium প্রায়ই সামাজিকভাবে সর্বোত্তম নয়। Prisoner's Dilemma-তে \((Defect, Defect)\) Nash, কিন্তু \((Cooperate, Cooperate)\) দুজনের জন্যই ভালো ছিল।
  2. dominant strategy আর Nash equilibrium গুলিয়ে ফেলা। প্রতিটা dominant-strategy ফল Nash equilibrium, কিন্তু সব Nash equilibrium-এ dominant strategy থাকে না (বারের দৃশ্যে কারও প্রভাবশালী কৌশল নেই, তবু একাধিক Nash আছে)।
  3. "যোগাযোগ থাকলেই দ্বিধা মিটে যায়" ভাবা। না — বাধ্যকর চুক্তি না থাকলে যোগাযোগ যথেষ্ট নয়। Golden Balls-এ Sarah কথা দিয়েও steal করেছিলেন।
  4. payoff জোড়া উল্টো পড়া। \((a, b)\)-তে সাধারণত প্রথম সংখ্যা সারি-খেলোয়াড়ের, দ্বিতীয়টা কলাম-খেলোয়াড়ের — কার প্রাপ্তি কোনটা, খেয়াল রাখো।
  5. "খেলোয়াড় হওয়া ভালো" ভাবা। Prisoner's Dilemma-য় খেলোয়াড় হয়ে সাধারণত হারো (Jamie, JC Penney)। বুদ্ধিমানের কাজ — এমন পরিস্থিতি বানানো যেখানে অন্যদের খেলতে হয় (Snooki, The Economist, Southwest)।
  6. Nash equilibrium-এ "একা সরা" ভুলে "দল বেঁধে সরা" ভাবা। সংজ্ঞাটা unilateral — অন্যরা স্থির, একজন সরলে লাভ হয় কি না। দুজন একসাথে \((C,C)\)-তে গেলে ভালো হতো, কিন্তু সেটা Nash-এর প্রশ্ন নয়।
  7. এক-দান আর পুনরাবৃত্ত খেলা মেলানো। Tit-for-Tat কেবল পুনরাবৃত্ত খেলায় সহযোগিতা টেকায়; এক-দানের খেলায় defect-ই প্রভাবশালী।
  8. জেল-ম্যাট্রিক্সে সংখ্যা ধনাত্মক ভাবা। সংখ্যাগুলো ঋণাত্মক (জেল-বছর), তাই \(-3\) ভালো, \(-4\) খারাপ — "কম ঋণাত্মক = ভালো"।

৭. এক্সারসাইজ (Exercises)

নিজে চেষ্টা করো, তারপর নিচের সমাধান খোলো।

  1. জেলের payoff matrix থেকে দেখাও যে সন্দেহভাজন ১-এর জন্য "Disclose" প্রভাবশালী — সন্দেহভাজন ২-এর দুটো চালের জবাবেই যাচাই করো। এরপর Nash equilibrium আর সামাজিকভাবে সেরা ফল চিহ্নিত করো।
  2. বারের দৃশ্যে ব্যাখ্যা করো কেন "সবাই brunette-এ যাক" Nash equilibrium নয়, আর একটা কৌশল-বিন্যাস লেখো যা Nash equilibrium।
  3. JC Penney-র বর্ণনা থেকে (বাজার \(100\), tricky-র খরচ \(10\)) honest/tricky ম্যাট্রিক্সটা নিজে বানাও এবং দেখাও tricky প্রভাবশালী। কোন ফলটা সামাজিকভাবে সেরা?
  4. The Economist-এর read/don't-read ম্যাট্রিক্সে যাচাই করো read প্রভাবশালী, আর হিসাব করো দুজনেই পড়লে তারা স্থিতাবস্থার চেয়ে কতটা খারাপে থাকে।
  5. দুই ফার্ম "Advertise" (defect) বা "Don't advertise" (cooperate) বাছে। প্রাপ্তি: দুজনেই Don't → \((8, 8)\); দুজনেই Advertise → \((5, 5)\); একজন Advertise, অন্যজন Don't → \((10, 3)\)। এখানে প্রভাবশালী কৌশল আছে কি? এটা কি Prisoner's Dilemma?
  6. Golden Balls (one-shot): (ক) দেখাও Steal, Split-কে weakly dominate করে; (খ) Nick-এর claim ও post-show promise বিশ্বাস করলে কেন অন্য contestant-এর কাছে Split best response হতে পারে ব্যাখ্যা করো; (গ) কেন এটি formal commitment বা weak dominance নয় বলো।
  7. সাধারণ Prisoner's Dilemma-তে \(T, R, P, S\)-এর দুটো শর্ত লেখো, আর বলো প্রতিটা শর্ত কী নিশ্চিত করে (কোনটা defect-কে প্রভাবশালী করে, কোনটা সহযোগিতাকে ভালো করে)।
  8. নিজের জীবন থেকে (বা: অতিরিক্ত মাছ ধরা / ডোপিং / ট্রাফিক) একটা বাস্তব Prisoner's Dilemma দাও — Cooperate ও Defect কী তা চিহ্নিত করো, আর ব্যাখ্যা করো কেন প্রভাবশালী কৌশল দলকে খারাপ ফলে ঠেলে দেয়।

৮. সমাধান (ব্যাখ্যাসহ)

১-নং সমাধান দেখাও

জেল-বছর (কম = ভালো)। সন্দেহভাজন ১-এর জন্য:

  • সন্দেহভাজন ২ Disclose করলে: ১ Disclose করলে \(3\) বছর, Conceal করলে \(4\) বছর → Disclose ভালো।
  • সন্দেহভাজন ২ Conceal করলে: ১ Disclose করলে \(0\) বছর, Conceal করলে \(1\) বছর → Disclose ভালো।

দুই ক্ষেত্রেই Disclose ভালো → Disclose প্রভাবশালী। প্রতিসাম্যে সন্দেহভাজন ২-এরও তাই। তাই Nash equilibrium = (Disclose, Disclose), ফল \((-3, -3)\)। কিন্তু সামাজিকভাবে সেরা = (Conceal, Conceal), ফল \((-1, -1)\) — মোট জেল সবচেয়ে কম।

২-নং সমাধান দেখাও

"সবাই brunette-এ যাক" Nash equilibrium নয়: ধরো বাকি তিনজন brunette-এ। তখন blonde-এর দিকে তোমার কোনো প্রতিদ্বন্দ্বী নেই, তাই একা সরে blonde-এ গেলে তুমি লাভবান — কেউ একা সরে লাভ করতে পারলে সেটা Nash equilibrium নয়।

একটা Nash equilibrium: ঠিক একজন (ধরো তুমি) blonde-এ, বাকি তিনজন brunette-এ। যাচাই: তুমি blonde-এ সেরা জবাব খেলছ (প্রতিদ্বন্দ্বী নেই); প্রতিটা বন্ধু blonde-এ সরলে দুজন blonde-এ পড়ে দুজনেই ব্যর্থ হবে, তাই কেউ সরবে না। কেউ একা সরে লাভ করতে পারে না → Nash equilibrium। (এমন চারটে ভারসাম্য আছে — যে-কোনো একজন blonde-এ।)

৩-নং সমাধান দেখাও

বাজার \(100\), tricky-র খরচ \(10\):

Store 2: Honest Store 2: Tricky
Store 1: Honest 50, 50 10, 80
Store 1: Tricky 80, 10 40, 40
  • অন্যজন Honest হলে: \(50\) (Honest) বনাম \(80\) (Tricky) → Tricky।
  • অন্যজন Tricky হলে: \(10\) (Honest) বনাম \(40\) (Tricky) → Tricky।

তাই Tricky প্রভাবশালী, Nash equilibrium \((Tricky, Tricky) = (40, 40)\)সামাজিকভাবে সেরা = (Honest, Honest) = (50, 50) (মোট মূল্য \(100\), কোনো অপচয় নেই)।

৪-নং সমাধান দেখাও

read/don't-read ম্যাট্রিক্স (তুমি সারি, অন্যরা কলাম):

অন্যরা: Read অন্যরা: Don't
তুমি: Read -1, -1 1, -2
তুমি: Don't -2, 1 0, 0
  • অন্যরা Don't হলে: Read দেয় \(1\), Don't দেয় \(0\) → Read ভালো।
  • অন্যরা Read হলে: Read দেয় \(-1\), Don't দেয় \(-2\) → Read ভালো।

তাই Read প্রভাবশালী, Nash equilibrium \((Read, Read) = (-1, -1)\)। স্থিতাবস্থা ছিল \((0, 0)\), তাই দুজনেই মাথাপিছু \(0 - (-1) = 1\) ইউনিট খারাপে — শুধু খরচ ও সময় গেল, কারও edge বাড়ল না।

৫-নং সমাধান দেখাও

ম্যাট্রিক্স (Cooperate = Don't advertise, Defect = Advertise):

ফার্ম ২: Don't ফার্ম ২: Advertise
ফার্ম ১: Don't 8, 8 3, 10
ফার্ম ১: Advertise 10, 3 5, 5
  • অন্যজন Don't হলে: \(8\) (Don't) বনাম \(10\) (Advertise) → Advertise।
  • অন্যজন Advertise হলে: \(3\) (Don't) বনাম \(5\) (Advertise) → Advertise।

তাই Advertise প্রভাবশালী, Nash equilibrium \((Advertise, Advertise) = (5, 5)\)। এটা Prisoner's Dilemma, কারণ \(T = 10 > R = 8 > P = 5 > S = 3\) — দুজনেই Don't করলে \((8, 8)\) পেত, কিন্তু প্রভাবশালী কৌশল তাদের \((5, 5)\)-এ ঠেলে দেয়।

৬-নং সমাধান দেখাও

(ক) এক-দানে (শতাংশ প্রাপ্তি):

  • অন্যজন Split করলে: তুমি Split-এ \(50\), Steal-এ \(100\) → Steal কঠোরভাবে ভালো।
  • অন্যজন Steal করলে: তুমি Split-এ \(0\), Steal-এ \(0\) → সমান।

একটা ক্ষেত্রে কঠোরভাবে ভালো, অন্যটায় সমান — তাই Steal, Split-কে দুর্বলভাবে dominate করে

(খ) অন্য contestant যদি ধরে Nick Steal করবে, নিজে Steal করেও সে \(0\) পায়। সে Split করলে official payoff-ও \(0\), কিন্তু Nick পরে ভাগ করবে—এতে probability \(p>0\) দিলে expected transfer positive। ওই belief-এর অধীনে Split best response হতে পারে।

(গ) Nick Steal বেছে নিতে বাধ্য ছিল না এবং পরে transfer-এর promise enforceable ছিল না; শেষে Nick Split-ই বেছে নেয়। তাই এটি binding commitment বা formal credible threat নয়। Split opponent-এর সব strategy-র বিরুদ্ধে ভালোও নয়, তাই weakly dominant নয়।

৭-নং সমাধান দেখাও

Prisoner's Dilemma-র শর্ত: \(T > R > P > S\)। এটাকে দুই টুকরোয় ভাঙা যায়:

  • \(T > R\) এবং \(P > S\) → defect প্রভাবশালী: অন্যজন cooperate করলে (\(T > R\)) বা defect করলে (\(P > S\)) — দুই ক্ষেত্রেই defect বেশি দেয়।
  • \(R > P\) → সহযোগিতাই ভালো: দুজনেই cooperate (\(R\)) করলে দুজনেই defect (\(P\))-এর চেয়ে ভালো।

প্রথমটা দ্বিধা তৈরি করে (সবাই defect করতে চায়), দ্বিতীয়টা দ্বিধাকে বেদনাদায়ক করে (সহযোগিতা সম্ভব ছিল)। (পুনরাবৃত্ত খেলার জন্য বাড়তি শর্ত \(2R > T + S\)-ও ধরা হয়, যাতে পালা করে ঠকানোর চেয়ে দুজনের সহযোগিতা ভালো হয়।)

৮-নং সমাধান দেখাও

একটা উদাহরণ — অতিরিক্ত মাছ ধরা। দুই জেলে একটা পুকুরে মাছ ধরে।

  • Cooperate (সহযোগিতা): সংযত হয়ে অল্প মাছ ধরা (মাছের বংশ টেকে)।
  • Defect (বিশ্বাসঘাতকতা): যত পারো মাছ ধরা।

যেই অন্যজন যা-ই করুক, বেশি ধরাই ব্যক্তিগতভাবে বেশি লাভ (অন্যজন সংযত হলে বেশি মাছ মেলে; অন্যজন লোভী হলে অন্তত পিছিয়ে থাকি না) — তাই যত পারো ধরা প্রভাবশালী। ফল: দুজনেই অতিরিক্ত ধরে, মাছ শেষ, দুজনেই দীর্ঘমেয়াদে ক্ষতিগ্রস্ত — যদিও দুজনে সংযত থাকলে পুকুর চিরকাল মাছ দিত। (ডোপিং, ট্রাফিকে লেন-বদল ইত্যাদিও একই ছাঁচ।)

৯. সারসংক্ষেপ ও Checklist

এই অধ্যায়ের পর নিজেকে যাচাই করো:

  • [ ] Nash equilibrium সংজ্ঞা দিতে পারি: অন্যরা যা করছে ধরে নিয়ে কেউ একা সরে নিজের প্রাপ্তি বাড়াতে পারে না; সবাই একসাথে best response খেলছে।
  • [ ] জানি Nash equilibrium একাধিক হতে পারে (বারের দৃশ্য), আর প্রায়ই সামাজিকভাবে সর্বোত্তম নয় (Hotelling, Bertrand, PD)।
  • [ ] Prisoner's Dilemma চিনি: প্রত্যেকের defect একটা প্রভাবশালী কৌশল, তবু সবাই defect করলে ফল cooperate-এর চেয়ে খারাপ।
  • [ ] কেন defect প্রভাবশালী বোঝাতে পারি: \(T > R\) (অন্যজন cooperate করলে) আর \(P > S\) (অন্যজন defect করলে), তাই সঙ্গী যা-ই করুক defect ভালো; আর \(R > P\) বলে সহযোগিতা ভালো ছিল।
  • [ ] payoff matrix পড়তে ও বানাতে পারি; জেল-ম্যাট্রিক্সে সংখ্যা ঋণাত্মক মনে রাখি।
  • [ ] বাস্তব উদাহরণে PD ধরতে পারি: coordination failure, used product, প্রাচীন Telugu প্রবাদ, ডাক্তার, ক্যাসিনো, JC Penney, unbranding, The Economist, Southwest, Golden Balls।
  • [ ] বুঝি Prisoner's Dilemma-য় খেলোয়াড় হয়ে সাধারণত হারি; বুদ্ধিমানের কাজ অন্যদের খেলানো (Snooki, The Economist, Southwest)।
  • [ ] Golden Balls-এ Nick-এর সফল communication/bluff-কে binding commitment থেকে আলাদা করতে পারি; belief-dependent best response আর weakly dominant strategy এক নয়।
  • [ ] Python-এ \(2 \times 2\) খেলায় Nash equilibrium খুঁজতে পারি, আর পুনরাবৃত্ত PD-তে Tit-for-Tat simulate করতে পারি।

➡️ পরের অধ্যায়: 10.3 — Joy: Changing the Game — credible threat, ultimatum, MAD, Braess paradox, burning bridges ও dollar auction দিয়ে কীভাবে খেলাটাই বদলে ফাঁদ থেকে বেরোনো যায়।