Skip to content

10.3 — Joy: Changing the Game

এই অধ্যায়ে কী শিখব: আগের দুই অধ্যায়ে আমরা খেলা চিনতে শিখেছি — Hotelling, Prisoner's Dilemma, Nash equilibrium, dominant strategy। কিন্তু ফল যখন খারাপ হয়, তখন কী করব? মানুষের ওপর রাগ না করে খেলাটাই বদলে দাও (change the game) — এটাই এই অধ্যায়ের মূল সুর। ধাপে ধাপে, গল্পে-গল্পে, উৎসের প্রতিটা লাইন ধরে শিখব: office phone problem ও free rider; game of chicken (মুরগি-খেলা) ও তা জেতার ৪টা কৌশল; credible threat (বিশ্বাসযোগ্য হুমকি), non-credible threat (অবিশ্বাসযোগ্য হুমকি), ৫টা পদ্ধতি ও commitment (অঙ্গীকার); ultimatum game (চূড়ান্ত-প্রস্তাব খেলা) এবং backward induction (পশ্চাৎ-অনুমান) দিয়ে তার subgame-perfect equilibrium (উপ-খেলা নিখুঁত ভারসাম্য); mutually assured destruction / MAD (পারস্পরিক নিশ্চিত ধ্বংস) ও gossip war; "honesty isn't the best policy"; একসাথে অনেককে হুমকি (principle of embarrassment); limiting options (বিকল্প সীমিত করা)-র আশ্চর্য শক্তি — airline food থেকে salary negotiation পর্যন্ত; withholding supply (জোগান আটকে রাখা) ও added value (যোগকৃত মূল্য); Braess paradox (ব্রেস প্যারাডক্স) — রাস্তা বাড়ালেও সবার দেরি; burning bridges (সেতু পোড়ানো) — Cortés থেকে Kathy Griffin; leader's dilemma (নেতার উভয়সংকট) ও mixed strategy; market unraveling (বাজার খুলে-পড়া / lemons) ও signaling (সংকেত প্রদান); smart pill; voting paradox (ভোট প্যারাডক্স / Condorcet) ও Arrow's impossibility theorem; tissue scheme; dollar auction (ডলার নিলাম)-এর escalation (উত্তরোত্তর বৃদ্ধি) ও loudness war; লাইনে দাঁড়ানো / উঁচু হিল / পরীক্ষার পড়া-র ব্যর্থ সমন্বয়; আর সবশেষে jealousy (ঈর্ষা) কীভাবে একটা লাভজনক খেলাকে zero-sum ধ্বংসাত্মক খেলায় বদলে দেয়। প্রতিটা ধারণা ছবিসহ, সংখ্যাসহ, Python ও সমাধানসহ এক্সারসাইজ দিয়ে।

উৎস (source): The Joy of Game Theory — Presh Talwalkar, "Section II: Changing the Game" (মূল বইয়ের দ্বিতীয় ভাগ)।


১. কেন শিখব? (Motivation)

Part 10-এর প্রথম দুই অধ্যায়ের মূল শিক্ষা ছিল একটাই: খারাপ ফল মানেই বোকা খেলোয়াড় নয়। Hotelling-এর গ্যাস স্টেশন পাশাপাশি বসে, Bertrand-এ দাম শূন্যের কাছে নামে, Prisoner's Dilemma-তে দুজনেই ধরা খায় — এসব খারাপ ফল আসে ঠিক এই কারণে যে খেলোয়াড়েরা বুদ্ধি খাটাচ্ছে, বোকামি করছে বলে নয়। incentive (প্রণোদনা) যেদিকে ঠেলে, যুক্তিবাদী মানুষ সেদিকেই যায়।

বইয়ের প্রথম ভাগ ছিল কেবল কৌশলগত পরিস্থিতি চেনা আর incentive কীভাবে নির্দিষ্ট ফল ডেকে আনে তা দেখা। game theory যদি কেবল একবার, একসাথে (simultaneous, one-shot) খেলা নিয়েই ভাবত — স্থির খেলোয়াড়, স্থির নিয়ম, স্থির payoff — তাহলে এটুকুই যথেষ্ট হতো। কিন্তু বাস্তব জীবন তার চেয়ে জটিল:

  • মানুষ প্রায়ই ক্রমানুসারে (sequential) চাল দেয় — একজন আগে, আরেকজন দেখে পরে। এতে "কে আগে জানে" ব্যাপারটা কৌশলে ঢুকে পড়ে।
  • একই খেলা বারবার (repeated) খেলা হতে পারে, তাই reputation (সুনাম) আর প্রতিশোধের হিসাব জেগে ওঠে।
  • খেলোয়াড়েরা নিজেরাই নিয়ম বদলে ফল প্রভাবিত করতে পারে — এটাই এই অধ্যায়ের হাতিয়ার-বাক্স।

তাহলে ফল খারাপ হলে করব কী? স্বাভাবিক প্রবৃত্তি হলো রাগ করা — "লোকগুলো এমন করল কেন?" কিন্তু এই ভাগের কেন্দ্রীয় বার্তা: রাগ করে লাভ নেই; যে খেলাটা তুমি খেলছ, তার নিয়ম-কাঠামোই ফলটা তৈরি করেছে। তাই আচরণকে বকাঝকা না করে খেলার কাঠামো (rules, order, players, payoffs) বদলানোর পথ খোঁজো। একটা ছোট নিয়ম-বদল প্রায়ই অসংখ্য মানুষের আচরণ নিঃশব্দে বদলে দেয়। এই ভাগটা সেই "খেলা বদলানোর" নানা উপায় একে একে দেখাবে।

মূল স্বজ্ঞা

"খেলা বদলানো"-র বেশিরভাগ কৌশল আসলে একটাই কৌশলের ভিন্ন ভিন্ন মুখ: নিজের বিকল্প ইচ্ছাকৃতভাবে কমিয়ে ফেলা (limiting your own options)। স্বজ্ঞা বলে বেশি বিকল্প = বেশি শক্তি, কিন্তু কৌশলগত খেলায় প্রায়ই উল্টো — যে জাহাজ পথ বদলাতে পারে না (lighthouse), যে steering wheel জানালা দিয়ে ফেলে দেয়, যে সেনাপতি নিজের জাহাজ পুড়িয়ে ফেলে পিছু হটার পথ রাখে না (Cortés), যে অধ্যাপক নিজের হাত থেকে নিয়ম-বদলের ক্ষমতা কেড়ে নেয় — সে-ই সবচেয়ে শক্তিশালী। কারণ commitment (অঙ্গীকার) তোমার হুমকিকে credible (বিশ্বাসযোগ্য) করে তোলে। এই এক সুতোই chicken, ultimatum, MAD, burning bridges, salary negotiation — সবকিছু গেঁথে রাখে।


২. মূল ধারণা (Core idea) — উৎসের ২০টি গল্প, প্রতিটা লাইন ধরে

এই অংশে আমরা মূল বইয়ের গল্পগুলো একে একে, পূর্ণ বিস্তারে দেখব — Talwalkar-এর প্রতিটা যুক্তি, সংখ্যা, ঐতিহাসিক উদাহরণ, quote আর "কীভাবে জিতবে" উপদেশ সহ। প্রতিটা গল্প একটা করে "খেলা বদলানোর" কৌশল বা প্যারাডক্স শেখায়। সহজ গল্প থেকে শুরু করে ধীরে ধীরে গভীরে যাব; আনুষ্ঠানিক সংজ্ঞা ও যুক্তি একটু গুছিয়ে আসবে পরের অংশে (৩ নং)।

২.১ Office phone problem — free rider ও game of chicken

অফিসে নিয়ে যাওয়ার মতো একটা উপদেশ দিয়ে শুরু করি: যে খেলাটা খেলছ তাতে যদি জিততে না পারো, খেলাটা বদলানোর কথা ভাবো। আর নিজেকে যদি কারো ওপর চিৎকার করতে দেখো, একটু থেমে ভাবো — লোকটা এমন করছে কেন। কেবল "বদলাও" বলে দিলে কেউ বদলায় না; যুক্তিবাদী মানুষ incentive-এর জবাব দেয়, বকুনির নয়। ফল উন্নত করতে হলে আচরণকে বকা দেওয়ার চেয়ে খেলাটা বদলানো প্রায়ই ভালো।

লেখকের এক বন্ধু একটা ছোট consulting অফিসে কাজ করতেন। একবার সেই অফিসে সমস্যা দাঁড়াল — administrative staff সব incoming ফোন সামলাতে পারছিল না। কাজের সময়ের মধ্যেই client-এর কল voicemail-এ চলে যাচ্ছিল, যা দেখতে খুবই বাজে।

তাই নতুন একটা ব্যবস্থা চালু হলো: main line-এর কল প্রথম দুই রিং-এর পর সব entry-level কর্মীর ফোনে গড়িয়ে যাবে। শুরুতে ব্যবস্থাটা দারুণ মনে হলো — administrator-রা আগের মতোই বেশির ভাগ কল ধরবে, আর "safety mechanism" হিসেবে বাড়তি ৫ জন entry-level কর্মী কল ধরতে প্রস্তুত থাকবে। কিন্তু চালুর মাত্র দুই দিনের মাথায় একটা গুরুত্বপূর্ণ কল মিস হলো।

তদন্তটা ছিল অস্বস্তিকর। দেখা গেল, দুজন entry-level কর্মী চাইলে ফোনটা ধরতে পারত, কিন্তু ধরেনি। administrator রেগে আগুন হয়ে তাদের বকল — ফোন না ধরার জন্য। তাদের ওপর চিৎকার করাটা কি ঠিক ছিল? একজন game theorist হিসেবে লেখক আঙুল তোলেন ব্যবস্থার দিকে, কারণ ব্যবস্থাটাই ভুল incentive তৈরি করেছে।

ভাবো, কল যখন কোনো কর্মীর ফোনে গড়িয়ে আসে, সে কী ভাবে। সম্ভবত এই যুক্তি: "ফোন বাজছে জানি, কিন্তু এখন বিরক্ত হতে চাই না। আরও চারজন তো ধরতে পারে। দেখি অন্য কেউ ধরে কিনা — আমি একটু অপেক্ষা করি।" এই যুক্তিই আসে খেলার দুটো গুরুত্বপূর্ণ (ও বিপজ্জনক) বৈশিষ্ট্য থেকে।

১. free rider (বিনা-শ্রমে সুবিধাভোগী) আছে। free rider হলো তারা, যারা একটা সাধারণ সুবিধার (common good) ফল ভোগ করে অথচ তা তৈরিতে কিছুই অবদান রাখে না। ফোনের খেলায় কোম্পানি কেবল চায় ফোনগুলো ধরা হোক — তাতে গোটা অফিস ভালো দেখায়। যে কখনো ফোন ধরে না, সে-ও এই "ভালো দেখানোর" সুবিধা পায়, নিজে একটা কলও না ধরে। তাই সে একজন free rider।

২. ফোন ধরা একটা game of chicken (মুরগি-খেলা) হয়ে যায়। ক্লাসিক chicken-এ দুই গাড়ি মুখোমুখি প্রচণ্ড বেগে ছুটে আসে। প্রত্যেকের দুই পথ: "swerve" (সরে যাওয়া) বা "maintain course" (পথ ধরে রাখা)। দুজনেই সরলে দুজনেই "chicken"/ভীতু; দুজনেই পথ ধরে রাখলে সংঘর্ষে মৃত্যু; একজন সরলে অন্যজন সরে না-থাকা গর্বিত বিজয়ী। কৌশল হলো — প্রত্যেকে দাবি করবে সে কখনো সরবে না, দরকারে মরতেও রাজি, যাতে অন্যজন সরে যায়। খেলার এই কাঠামোই খেলোয়াড়দের বিপজ্জনক আচরণে ঠেলে দেয়। ফোনের বেলাতেও তাই — ফোন বাজলে প্রত্যেক কর্মী অন্যদের বোঝাতে চায় "আমি ধরব না"। কেউ না ধরলে অফিস খারাপ দেখায়, তাই প্রত্যেকে টিকে থেকে দেখতে চায় কে বেশি "chicken"। আর এই টানাপোড়েনে অনিবার্যভাবে কিছু কল হারিয়ে যায়।

ফোন সমস্যার সমাধান। এই ব্যবস্থা free rider সহ একটা game of chicken তৈরি করেছে; কাঠামোটাই ফোন এড়ানোকে স্বাভাবিক করে তুলেছে। কর্মীদের বকলে কি কাজ হবে? সম্ভবত না! খেলার কাঠামো একই থাকবে — মানুষ বকুনির চেয়ে incentive-এ বেশি সাড়া দেয়। administrator বদলে individual responsibility (ব্যক্তিগত দায়িত্ব) দিয়ে খেলাটা বদলাতে পারেন: একটা schedule বানাও যেখানে প্রত্যেকে দিনে এক-দুই ঘণ্টা ফোন কভার করবে। কারো মিটিং থাকলে বিকল্প কাউকে খুঁজে দেওয়ার দায়িত্বও তার। এই নতুন খেলা free rider সমস্যা ও game of chicken — দুটোই মুছে দেয়, আর বাজি ধরে বলা যায় খুব কম কল, বা কোনো কল-ই, মিস হবে না।

কাউকে তার আচরণের জন্য বকা শুরু করার আগে দেখো সে কেন এমন করছে। খেলাটা বদলাও — সবাই জিততে পারে।

২.২ Game of chicken জেতার ৪টা কৌশল

আগের উদাহরণে "কে অফিসের ফোন ধরবে" প্রশ্নটা একটা game of chicken হয়ে গিয়েছিল। কেউ স্বেচ্ছায় ধরতে চায়নি, ফলে কয়েকটা কল হারিয়েছে। game of chicken-এ মানুষ প্রমাণ করতে চায় সে অন্যদের চেয়ে কঠোর — আর কেউ না নরম হলে সেটা বিপর্যয়ের রেসিপি। তাই সাধারণভাবে chicken খেলা এড়িয়ে চলা বা অন্য কিছুতে বদলে ফেলাই ভালো।

কিন্তু দুর্ভাগ্যবশত সব chicken এড়ানো যায় না। স্কুলের মারামারি, drinking contest, negative campaign — সবখানে chicken আছে। প্রতিযোগিতামূলক দুনিয়ায় chicken-এর মুখোমুখি হতেই হবে, তাই কার্যকরভাবে খেলার কৌশল জানা ভালো। চারটি কৌশল:

১. নিজেকে অনড় করো (make yourself immovable)। chicken-এ নমনীয়তাই দুর্বলতা। সেরা সমাধানগুলোর একটা — প্রমাণ করা যে তুমি পথ বদলাবে না। এক US ও এক Canadian জাহাজের বিখ্যাত (যদিও কল্পিত) রেডিও-কথোপকথন এটা চমৎকার দেখায়। US জাহাজ বলে সংঘর্ষ এড়াতে ওপাশকে ০.৫ ডিগ্রি দক্ষিণে সরতে; ওপাশ পাল্টা বলে US-কেই ১৫ ডিগ্রি সরতে; US গর্জে ওঠে "THIS IS THE AIRCRAFT CARRIER USS CORAL SEA, DIVERT YOUR COURSE NOW!!"; আর ওপাশ শান্ত জবাব দেয় — "This is a lighthouse. Your call." (আমি একটা বাতিঘর; সিদ্ধান্ত তোমার।) গল্পটা মজার হলেও একটা urban legend; তবু কৌশলগত শিক্ষাটা আসল — বিকল্প সীমিত করে, রূপকভাবে বাতিঘরের মতো অনড় হয়ে, অন্যপক্ষকে দেখানো যায় যে তুমি পিছু হটবে না। দুই গাড়ির chicken-এ একজন চালক steering wheel lock লাগিয়ে, বা এমনকি চাকা খুলে জানালা দিয়ে ফেলে দিয়ে অনড় হতে পারে। অন্য চালক যদি দেখে তুমি পথ বদলাতেই পারবে না, সে কি সরে যাবে না?

২. কঠোর হওয়ার সুনাম গড়ো (get a reputation for being tough)। ভাবো এক ভোক্তা এক বড় কোম্পানির বিরুদ্ধে $১০০,০০০-এর একটা তুচ্ছ (frivolous) মামলা করল। তার কি মামলা চালানো উচিত? মামলাটা ভোক্তা ও কোম্পানি দুজনকেই একটা chicken-এ ফেলে। যে পিছু হটবে সে হারবে; কেউ না হটলে ভোক্তা সময় ও আইনি খরচ নষ্ট করবে, আর কোম্পানি নেতিবাচক প্রচারে ক্ষতিগ্রস্ত হবে। কোম্পানি ভাবতে পারে পুরো ঝামেলাটা বড্ড ঝুঁকিপূর্ণ, তাই আদালতের বাইরে settle করে ফেলা যাক। কিন্তু এর ফল দুর্ভাগ্যজনক — settlement-এর আশায় ভোক্তারা আরও তুচ্ছ মামলা তুলবে। এই চক্র থেকে বেরিয়ে জেতার এক উপায়: সব মামলা শেষ পর্যন্ত লড়ার "কঠোর" সুনাম গড়া। স্বল্পমেয়াদে কিছু ক্ষতি ও কিছু বদনাম হলেও, দীর্ঘমেয়াদে কম মামলার কারণে net লাভ হতে পারে।

৩. হারানোর কিছু নেই দেখাও (go for broke)। সিনেমা Nothing to Lose-এ Martin Lawrence-এর চরিত্র (এক ডাকাত) বন্দুকের মুখে Tim Robbins-এর চরিত্রের গাড়ি ছিনতাই করতে চায়। এটা একটা chicken: যে নরম হবে সে গাড়ি পাবে না, কিন্তু কেউ নরম না হলে বন্দুক চলে যেতে পারে — Robbins-এর চরিত্র মরবে আর Lawrence-এর চরিত্রকে খুনের দায় নিতে হবে। Robbins-এর চরিত্র খেলাটা জেতে ঘোষণা করে যে সে হাল ছাড়বে না। সে ব্যাখ্যা করে — সে সবে খুব খারাপ খবর পেয়েছে, তাই তার "হারানোর কিছু নেই"। এমনকি নিজের কথা প্রমাণ করতে সে অদ্ভুতভাবে ডাকাতটিকে অপহরণ করে মরুভূমিতে নিয়ে যায়, আর দুই বেমানান লোকের ভাগ্য এক সুতোয় বাঁধা পড়ে (সিনেমার কমেডি এখান থেকেই)। শিক্ষা: যার হারানোর কিছু নেই, তার হুমকি সবচেয়ে বিপজ্জনক, আর সেটা সবাই বেশি সিরিয়াসলি নেয়।

৪. ঝুঁকি বাড়াও — brinkmanship (খাদের কিনারায় ঠেলা)। brinkmanship একটা কৌশলগত চাল — অন্যপক্ষ নরম না হলে তুমি গোটা খেলার ঝুঁকি বাড়িয়ে দাও, সবাইকে "খাদের কিনারায়" এনে ফেলো। এই "scare tactics" নিজে ব্যবহার করতে না-ও চাইতে পারো, কিন্তু বোঝা জরুরি, কারণ প্রতিপক্ষ তা ব্যবহার করতে পারে। ২০০৯-এ New Jersey-তে একটা মজার উদাহরণ ঘটে। বিদ্যুৎ সরবরাহকারী PSE&G একটা বড় transmission line সম্প্রসারণ (Susquehanna-Roseland লাইন) ও rate বৃদ্ধির প্রস্তাব দিচ্ছিল; করদাতারা প্রকল্প নিয়ে দ্বিধায় ছিল। পরিস্থিতি ছিল chicken-এর মতো: যে পক্ষ নরম হবে সে টাকায় হারবে, কিন্তু দুই পক্ষ দীর্ঘ নিয়ন্ত্রক লড়াই চালিয়ে গেলে ব্যবস্থা উন্নয়নের অন্য গঠনমূলক পথও আটকে দুজনেই হারবে। PSE&G তাদের দাবি চোখে-আঙুল দিয়ে দেখাতে brinkmanship-এর বিজ্ঞাপন দেয়: ১৫ জানুয়ারি ২০০৯-এ Star-Ledger পত্রিকায় বিজ্ঞাপন — transmission প্রকল্প পাশ না হলে বাসিন্দারা ২০০০ সালের California-র মতো বা ২০০৩ সালের Northeast-এর মতো blackout-এর মুখে পড়তে পারে। বিজ্ঞাপনের উদ্দেশ্য ছিল ঝুঁকি বাড়িয়ে হুমকি দেওয়া। প্রকল্প পাশ না হওয়ায় বিদ্যুৎ কোম্পানির ইচ্ছাকৃত blackout তৈরি করা জনরোষ-জাগানো ও বেআইনি হতো; বিজ্ঞাপনটা কেবল বার্তা দিল — পদক্ষেপ ছাড়া PSE&G-র যথেষ্ট নিয়ন্ত্রণ থাকবে না, তাই সবাই (কোম্পানি ও করদাতা) খাদের কিনারায় সরে আসবে। এটা ছিল নিয়ন্ত্রক ও জনসমর্থন আদায়ের প্রচারণার একটা অংশ। (নভেম্বর ২০১৩ নাগাদ transmission line-এর নির্মাণ চলছিল।)

২.৩ Credible threat — হুমকি কখন বিশ্বাসযোগ্য

game of chicken জেতার কৌশল হলো কঠোর দেখানো, আর — খুব গুরুত্বপূর্ণ — অন্যকে সেটা বিশ্বাস করানো। অন্যকে নিজের কথা বিশ্বাস করানোর ক্ষমতা বহু ক্ষেত্রে কাজে লাগে, আর এখান থেকেই আসে game theory-র মূল ধারণা credibility (বিশ্বাসযোগ্যতা)

হুমকি দুই ভাগে পড়ে — credible ও non-credible।

  • credible threat (বিশ্বাসযোগ্য হুমকি): যেটা বাস্তবে কার্যকর হওয়ার সম্ভাবনা বেশি। যেমন বিল না দিলে utility company লাইন কেটে দেবে — এটা credible, কারণ তারা সত্যিই কাটতে পারে ও প্রায়ই কাটে।
  • non-credible threat (অবিশ্বাসযোগ্য হুমকি): যেটা কার্যকর হওয়ার সম্ভাবনা কম, তাই চতুর লোক বিশ্বাস করবে না। এসব হুমকি দেওয়া হয় আচরণ বদলাতে, কিন্তু বুদ্ধিমান লোক গায়ে মাখে না। যেমন এক defense attorney হুমকি দেয় — প্রমাণ যেমনই হোক, তার মক্কেল মামলা আদালতে টেনে লম্বা করবে (যাতে prosecution আদালতের বাইরে settle করতে চায়)। কিন্তু হুমকিটা credible নয়, কারণ শক্ত প্রমাণ এলে defense সম্ভবত দরকষাকষিতেই যাবে।

দুটো মূল ফল: (১) সিদ্ধান্তে কেবল credible হুমকিই বিবেচনা করো; (২) হুমকি তখনই credible, যখন তুমি সত্যিই তা পালন করতে যাবে। তবে ব্যবহারিকভাবে, non-credible হুমকিকেও credible দেখিয়ে লক্ষ্য হাসিল করা যায়। পাঁচটা পদ্ধতি:

পদ্ধতি ১ — বিকল্প রাখো (have an alternative)। বিক্রেতাকে সবচেয়ে বেশি ভয় দেখায় প্রতিযোগীর কাছে চলে যাওয়ার হুমকি। cable rate, internet connection, বা গাড়ির দাম কমাতে চাইলে বিক্রেতাকে তোমার অন্য offer-টা বলো, বোঝাও তুমি সত্যিই থাকতে চাও কিন্তু দরকারে চলে যেতেও রাজি (যদিও হয়তো নও) — দেখো কত সহজে সে নরম হয়। সত্যি বলতে, সত্যিকারের বিকল্প থাকলে তোমার game theory-র দরকারই নেই; বাকি পদ্ধতিগুলো তখনকার জন্য, যখন প্রকৃত leverage নেই অথচ থাকার ভ্রম তৈরি করতে হয়।

পদ্ধতি ২ — "risky threat" ব্যবহার করো। এক গ্রীষ্মে লেখক Stanford-এ high-school ছাত্রদের এক মাসব্যাপী camp-এর counselor ছিলেন। ৩০ জন high-school ছাত্র সামলানো সহজ নয়, কারণ counselor-দের হাতে সত্যিকারের শাস্তি কম ছিল। ছোটখাটো দুষ্টুমিতে তারা প্রায়ই হুমকি দিত — "বাবা-মাকে ফোন করব।" বেশির ভাগ ছাত্র ভয়ে লাইনে আসত, কিন্তু বাস্তবে হুমকিটা non-credible ছিল: বাবা-মাকে ফোন করলে তাঁরা রাগতেন (তাঁরা তো ভালো টাকা খরচ করে ছেলেকে camp-এ পাঠিয়েছেন), আর boss-এর মনেও প্রশ্ন উঠত counselor-রা খারাপ কিনা। কিছু ছাত্র তবু বারবার দুষ্টুমি করত (হয়তো ফাঁপা হুমকিটা ধরে ফেলেছিল)। তাদের জন্য একটা ভালো সমাধান বেরোল — হুমকি: "তোমার বাজে চরিত্রের কথা college admission officer-দের জানাব, তাতে তোমার ভর্তির সুযোগ নষ্ট হবে।" লেখক জানতেন না college officer-রা এমন ফাইল রাখে কিনা, কিন্তু ছাত্ররাও জানত না, আর তাদের পক্ষে খুঁজে বের করা কঠিন ছিল। এই অনিশ্চয়তার মধ্যেই হুমকিটা ভীষণ কার্যকর হলো — এত দ্রুত ছাত্রদের বাধ্য হতে লেখক আগে দেখেননি।

পদ্ধতি ৩ — বিকল্প থাকার ইঙ্গিত দাও (suggest you have alternatives)। লেখকের এক বন্ধু কলেজে থাকতেই তার top-choice কোম্পানি থেকে চাকরির offer পায়, কিন্তু তাতে signing bonus ছিল না — অথচ সে শুনেছিল কোম্পানিটা কিছু নতুন কর্মীকে signing bonus দেয়। বন্ধুটি বিপাকে: সরাসরি দরকষাকষি করলে তার প্রকৃত আগ্রহ ফাঁস হয়ে যেতে পারে, তাতে কোম্পানি offer উন্নত করার তাগিদ কম বোধ করবে। interview ও অভিনন্দন-কলের সূত্রে সে নিশ্চিত ছিল কোম্পানির তার প্রতি আগ্রহ বেশি — তাই সে সামান্য এগিয়ে ছিল। offer-এ সিদ্ধান্ত নিতে তার দুই সপ্তাহ ছিল। সে কোম্পানিকে জানাল offer-টা ভালো, কিন্তু ভাবতে আরেকটু সময় লাগবে — একটা ছোট extension চাইল এবং পরোক্ষে ইঙ্গিত দিল যে সে অন্য offer বিবেচনা করছে। শিগগিরই কোম্পানি নিজেই signing bonus দিল এবং ফোন করে তাকে যোগ দিতে উৎসাহ দিল — আর সে যোগও দিল। (সতর্কতা: কিছু কোম্পানিতে সরাসরি দরকষাকষিই ভালো কাজ করে, আর কিছু কোম্পানি এত শক্তিশালী যে তারা নরম হবেই না।)

পদ্ধতি ৪ — প্রকাশ্যে যাওয়ার হুমকি (threaten to go public)। লেখকের পরিচিত একজন এক cell phone কোম্পানির সঙ্গে ভয়ংকর অভিজ্ঞতার শিকার হন। কোম্পানির পাঠানো ফোনটা ত্রুটিপূর্ণ ছিল; ফেরত পাঠালে কোম্পানি দায় অস্বীকার করে দাবি করল ফোনে "water damage" আছে (যা ছিল না)। প্রমাণ ছিল কোম্পানির হাতে, তাই বন্ধুটির পক্ষে মিথ্যা প্রমাণ করা কঠিন ছিল। কয়েক দিন ভদ্র জবাব না পেয়ে সে বাজি বাড়াল — একটা বড় সংবাদপত্রের সঙ্গে যোগাযোগ করে এমন এক সাংবাদিক জোগাড় করল যিনি গল্পটা লিখতে রাজি। এরপর সে কোম্পানির এক উচ্চপদস্থ executive-কে নিজের পরিস্থিতি জানিয়ে ইঙ্গিত দিল — সন্তোষজনক সমাধান না পেলে তার সাংবাদিক-বন্ধু খবরটা ছাপবে। দ্রুতই সে executive-এর কাছ থেকে লিখিত ক্ষমা ও ঝামেলার জন্য প্রয়োজনের চেয়ে বেশি ক্ষতিপূরণ পেল।

পদ্ধতি ৫ — unpredictable হওয়ার reputation তৈরি করা (নিজ ঝুঁকিতে)। স্বাভাবিক money-only model-এ মানুষ নিজের monetary payoff maximize করে। ১০ সেন্ট বনাম ০ সেন্টের মধ্যে বেছে নিতে বললে, প্রতিপক্ষ যাই পাক, সে ১০ সেন্ট নেবে। এবার ultimatum game ভাবো (পরের ২.৪-এ বিস্তারিত)। এখানে $১ ভাগ হবে; offer accept হলে প্রস্তাবিত ভাগ কার্যকর, আর reject করলে দুজনেই শূন্য পায়। ১-সেন্ট grid-এ money-only player 2 যেকোনো positive offer accept করবে, তাই player 1 এক সেন্ট offer করে। "৫০ সেন্টের কম হলে reject করব"—শুধু এই ঘোষণা বা player 1-এর belief threat-টিকে credible করে না। Threshold-এর নিচে positive offer পেয়ে reject করাই যদি player 2-এর payoff অনুযায়ী optimal হয়—যেমন fairness preference, spite, repeated-game reputation, বা বাস্তব commitment-এর কারণে—তবেই threat credible। Schelling-এর madman strategy ও Nixon-এর "Madman theory"-র কৌশলগত ভাবনা হলো প্রতিপক্ষকে এমন payoff/commitment আছে বলে বিশ্বাস করানো; কিন্তু reputation নষ্ট হওয়া ও ভুল escalation-এর ঝুঁকি খুব বড়।

২.৪ Ultimatum game — চূড়ান্ত-প্রস্তাব খেলা

কলেজে একবার এক বিরক্তিকর লোক লেখকের কাছে game theory-র সাহায্য চায়। নিজের কাজ ব্যাহত হলেও লেখক রাজি হন (একই dorm-এ থাকা লোককে ফেরানো কঠিন)। তবে বিনিময়ে তিনি কিছু চাইলেন। লোকটি ছিল লেখকের বন্ধুদের এক non-credit ক্লাসের teaching assistant, আর সে ব্যক্তিগত আক্রোশ মেটাতে ক্ষমতার অপব্যবহার করে বন্ধুদের সঙ্গে অন্যায় করছিল। লেখক শর্ত দিলেন — লোকটি যেন বন্ধুদের সঙ্গে ভালো ও পেশাদার আচরণ করে। এতে লোকটি রেগে গেল (তার মনে হলো এটা তার কর্তৃত্বে আঘাত)। লেখক বললেন তাহলে তিনি সাহায্য করবেন না; তাঁর নিজের কাজ আছে, সময়ের বিনিময়ে কিছু না দিলে তিনি পড়াশোনায় ফিরবেন।

লোকটি রেগে বলল, তার আসলে সাহায্য লাগবেই না; সে নাকি সমস্যাটা সমাধান করতে জানে, কেবল লেখকের দৃষ্টিভঙ্গি চাইছিল, আর পরদিন professor-এর office hours আছে, সেখানে আরও চালাক কাউকে জিজ্ঞেস করবে। তারপর সে চলে গেল — মোটামুটি। লেখক পড়ায় ফিরলে লোকটি পাশের টেবিলে দৃশ্যতভাবে বসে কাজ করার ভান করল, আর প্রতি কয়েক মিনিট অন্তর বই থেকে উঁকি দিয়ে দেখল লেখক নরম হন কিনা। লেখক নড়েননি। আধ ঘণ্টা পর পুরোটা দেখা একজন এসে বলল — "Presh, বিশ্বাস হয় না তুমি ওকে game theory-তে সাহায্য করছ না! জানি তুমি ওকে পছন্দ করো না, তবু — ওর সাহায্য দরকার।" লেখক জবাব দিলেন — "আমি তো ওকে সাহায্যই করছি। game theory-র কিছু জানলে ও বুঝত, আমার শর্ত না মানা পর্যন্ত আমি ওকে পড়াব না।" এই কথা শুনে বিরক্তিকর লোকটি ঘর ছেড়ে চলে গেল, আর কখনো সাহায্য চায়নি। লেখক এভাবে আচরণ করেছিলেন কারণ তাঁর ছিল total negotiating power — ultimatum game-এর মূল ধারণা।

আনুষ্ঠানিক খেলা। ভাবো তুমি একটা কলেজ-পরীক্ষায় অংশ নিচ্ছ। গবেষক তোমাকে $১০ দেন। তোমাকে বলা হয়, অন্য একজনকে এই টাকার একটা ভাগ প্রস্তাব করতে — যেমন তুমি $৭ রাখবে, অন্যজন পাবে $৩। অন্যজন ভাগটা মেনে নিলে টাকা সেভাবেই ভাগ হয়; reject করলে কেউ কিছু পায় না। কীভাবে ভাগ ঠিক করবে? প্রথম কাজ — খেলার গতিপথ একটা diagram-এ আঁকা।

Game tree of the ultimatum game: player 1 offers, player 2 accepts or rejects

চিত্র ১: ultimatum game-এর game tree। তুমি player 1, player 2-কে $0.01 থেকে $10-এর মধ্যে একটা offer দাও; player 2 তা accept করে (ভাগ কার্যকর) বা reject করে (দুজনেই শূন্য)। diagram পড়া হয় উপর থেকে নিচে — উপরের খেলোয়াড় আগে চাল দেয়। কিন্তু সমাধান করতে হয় ঠিক উল্টো দিকে, নিচ থেকে উপরে — শেষ থেকে শুরু বলেই একে বলে backward induction (পশ্চাৎ-অনুমান)।

player 2 কোন offer accept করবে? reject করলে সে শূন্য হাতে ফেরে। player 2 কেবল নিজের monetary payoff নিয়ে ভাবলে তার কৌশল হবে—সব positive offer accept করা, কারণ এক সেন্টও শূন্যের চেয়ে ভালো। player 1 এটা জানলে সবচেয়ে ছোট allowed offer—এক সেন্ট—দেয়, নিজে $9.99 রাখে। অর্থাৎ player 1 সব নয়, প্রায় পুরো pot পায়; player 2 এক সেন্ট পায়।

player 2 কি শাস্তি দিতে পারে না? ধরো player 2 আগে বলে—"৫০-৫০ না হলে reject করব।" money-only one-shot model-এ positive কিন্তু ছোট offer আসার পরে accept করাই তার strict best response; তাই ওই rejection threat non-credible। প্রতিটি possible offer-এর পরের decision node একটি subgame। প্রতিটি subgame-এ best response রাখে এমন strategy হলো সব positive offer accept করা; player 1 তাই এক সেন্ট offer করে। ১-সেন্ট grid এবং positive offer-এর এই model-এ এটিই একমাত্র subgame-perfect equilibrium (উপ-খেলা নিখুঁত ভারসাম্য): outcome $(9.99,0.01)$।

কিন্তু বাস্তবে offer বড় হয় এবং unfair offer reject-ও হয়। Player 1 যদি জানে player 2 fairness-কে utility-র অংশ মনে করে, তবে ছোট offer reject হওয়ার সম্ভাবনা ধরে offer adjust করাই rational। Experimental result money-only model-এর prediction থেকে প্রায়ই আলাদা; এতে game theory ভুল প্রমাণ হয় না, বরং payoff model-এ social preference যোগ করার দরকার বোঝায়।

না। Experiment-এর rejection দেখায় money-only payoff model মানুষের fairness, spite, social norm ও reputation preference পুরো capture করছে না। Belief গুরুত্বপূর্ণ, কিন্তু belief একা payoff বা best response বদলায় না। ১-সেন্ট finite grid-এর money-only game-এ বহু Nash equilibrium থাকতে পারে: off-path ছোট offer reject করার non-credible strategy দিয়ে, যেমন $5 offer/threshold, Nash equilibrium support করা যায়। এগুলো subgame-perfect নয়, কারণ threshold-এর নিচে positive offer সত্যিই এলে accept করা player 2-এর জন্য ভালো। Continuous-offer version-এ equilibrium-এর সংখ্যা অসীম হতে পারে; finite cent-grid-এ সংখ্যা finite। আর player 2 যদি fairness-সহ utility পায় বা commitment/repetition-এর কারণে reject করা optimal হয়, তবে সেটি আর শুধু belief বদল নয়—modeled payoff বা game বদল।

বাস্তব জীবনে কখন ঘটে? ঘরে-ঘরে সবসময়। লেখক ও তাঁর ভাই কোন video game খেলবে তা নিয়ে ঝগড়া করত; শেষে বাবা-মা বলতেন — একটা game-এ রাজি হও, নাহলে কেউই খেলতে পারবে না। বড় ভাই প্রায়ই আগে বলে এমন game বেছে নিত যা কেবল সে-ই পছন্দ করত, আর লেখক সেটাই মেনে নিতেন — কারণ তা "কিছু-না"-এর চেয়ে ভালো। labor strike-এও একই: boss শ্রমিকদের শর্ত দেয়; মানলে দুজনেই লাভবান, reject করে ধর্মঘটে গেলে অপেক্ষায় দুই পক্ষই টাকা হারায়। উদাহরণ: ২০০৭–২০০৮-এর Hollywood-এর Writers Guild of America strike। ধর্মঘটে লেখক ও studio দুজনেই বহু টাকা হারায়; ওই বছরের বাতিল হওয়া Golden Globes-কে ধরা হয় L.A. অর্থনীতিতে $৭৫ মিলিয়ন থেকে $১০০ মিলিয়নের ক্ষতি হিসেবে। আর ঠিক ultimatum game-এর মতো, ধর্মঘট চলাকালে প্রতি পক্ষ অন্যকে নিজের প্রকৃত বিশ্বাস নিয়ে ধোঁকা দিয়ে দরকষাকষির ক্ষমতা জোগাড়ের চেষ্টা করেছিল — দেখাতে চেয়েছিল যে তারা "অন্যায্য" সমাধান reject করবে, তা পাগলামি মনে হলেও। (James D. Miller-এর ব্লগ অনুযায়ী, producer-রা দেখাচ্ছিল তারা দীর্ঘ ধর্মঘটে প্রতিশ্রুতিবদ্ধ, এবং তাদের এক অস্ত্র ছিল কঠোর negotiator হিসেবে পরিচিত Rupert Murdoch-এর পক্ষ নেওয়া; পাল্টা, লেখকরা "শ্রমের বিরুদ্ধে যুদ্ধ" জাতীয় socialist যুক্তি তুলে নিজেদের অনড় দেখাতে চেয়েছিল, যদিও তারা আসলে পুঁজিবাদী নিয়মেই দিব্যি কাজ করে।) New York Times-এ David Carr-এর লেখা অনুযায়ী, শেষমেশ দুই পক্ষই কঠোর খেলেছিল ও দুজনকেই আপস করতে হয়েছিল — লেখকরা দীর্ঘমেয়াদে digital বিক্রির বেশি অংশ জিতলেও স্বল্পমেয়াদে প্রথাগত distribution-এ টাকা হারিয়েছিল। ultimatum game কখনো কখনো সত্যিই কুৎসিত হতে পারে।

২.৫ Gossip war ও MAD — পারস্পরিক নিশ্চিত ধ্বংস

হুমকি credible করার একটা বিশেষ পদ্ধতি আলাদা মনোযোগ দাবি করে: mutually assured destruction / MAD (পারস্পরিক নিশ্চিত ধ্বংস)। ছোটবেলায় লেখক Michael Jordan হতে চাইতেন — প্রায় সব বাচ্চাই চাইত। তারা Jordan-এর জুতো চাইত, Gatorade খেত, McDonald's খেত, কোর্টে জিভ বের করত। কিছুই কাজ করেনি; কিন্তু Jordan হতে চাওয়াটা ভুল ছিল না — তারা কেবল ভুল খুঁটিনাটিতে মন দিয়েছিল। শেখা উচিত ছিল Jordan-এর কোর্টের-বাইরের media সম্পর্ক সামলানো। অনেকে বলবে, Jordan-এর প্রতিভা basketball-এর যতটা, public relations-এরও ততটাই। তিনি খারাপ প্রচার ও gossip war সবার চেয়ে ভালো সামলাতেন। তাঁর এক গোপন কৌশল — যা আজকাল বেশির ভাগ খেলোয়াড় করেন না — চুপ থাকা ও gossip war এড়ানো। media খারাপ খবর ছাপলে তিনি সাধারণত পিছিয়ে যেতেন, কিছু বলতেন না। বলা সহজ, মানা ভীষণ কঠিন; বেশির ভাগ মানুষ সামান্য সমালোচনাতেই আত্মরক্ষায় নামে। কেন কৌশলটা কাজ করে, তা বুঝতে একটা সামরিক deterrence-এর ধারণা দিয়ে শুরু করি — MAD, তারপর তার রোজকার সংস্করণ gossip war।

MAD (পারস্পরিক নিশ্চিত ধ্বংস)। পারমাণবিক ধ্বংসের হুমকির মুখে শান্তি অর্জনের একটা উপায় MAD; Cold War-এ America ও Soviet Union-এর শান্তি বোঝাতে এটা প্রায়ই ব্যবহৃত হয়। খেলা: দুই দেশ পারমাণবিক অস্ত্র প্রতিযোগিতায়। প্রতি মুহূর্তে প্রত্যেকে বাছে — শান্তি রাখা ("back off") নাকি মিসাইল ছোড়া ("strike")। দুজনেই back off করলে status quo বজায় থাকে — এটাই একমাত্র শান্তিপূর্ণ ফল। যেকোনো একজন strike করলে দুজনেই all-out পারমাণবিক যুদ্ধে জড়িয়ে পারস্পরিক মৃত্যু পর্যন্ত যায়; তত্ত্ব বলে, একতরফা strike ভবিষ্যতের যেকোনো মীমাংসার আশা শেষ করে দেয়। যেহেতু যেকোনো strike পারস্পরিক মৃত্যু ডেকে আনে, খেলার নাম "mutually assured destruction"।

Game tree of the MAD game between the United States and the Soviet Union

চিত্র ২: MAD খেলার game tree। United States "back off" বা "strike" বাছে; অন্য খেলোয়াড় Soviet Union-ও তাই বাছে। Soviet Union-এর node-গুলো বৃত্তে ঘেরা — এটা বোঝায় খেলাটা simultaneous (Soviet Union America-র সঙ্গে একই সময়ে চাল দেয়), sequential নয়। বৃত্ত না থাকলে ব্যাখ্যা হতো — Soviet Union America-র চাল দেখে তারপর বাছছে। এই খেলায় action-কে simultaneous ধরা জরুরি, কারণ sequential খেলার ফল প্রায়ই আলাদা হয়। payoff \(-N\) = দুই পক্ষেরই ভয়ংকর ধ্বংস (ভাবো \(N\) যেন দশ লক্ষের মতো বিশাল); \(-1\) = টানটান শান্তি। সংখ্যাগুলো নির্বিচার — মূল ভাব: শান্তি ভালো, পারমাণবিক strike খুবই খারাপ।

খেলাটা payoff matrix-এও লেখা যায় (প্রথম সংখ্যা US, দ্বিতীয় Soviet):

Soviet: back off Soviet: strike
US: back off \((-1,\ -1)\) \((-N,\ -N)\)
US: strike \((-N,\ -N)\) \((-N,\ -N)\)

Nash equilibria বিশ্লেষণ। অন্য দেশ "back off" করলে আমার পছন্দ — back off (শান্তি \(-1\)) নাকি strike (ধ্বংস \(-N\)); যৌক্তিক পছন্দ back off। অন্য দেশ "strike" করলে দুনিয়া তো শেষই — back off বা strike দুটোই সমান খারাপ, দুটোই যুক্তিসংগত। সংক্ষেপে: "back off"-এর best response "back off"; "strike"-এর best response "back off" বা "strike" — দুটোই। equilibrium হয় যখন দুই দেশ best response দেয়; দুটো ক্ষেত্র স্পষ্ট equilibrium — দুজনেই back off (শান্তি) বা দুজনেই strike (পারস্পরিক মৃত্যু)। বাকি একটা ক্ষেত্র: একজন back off, একজন strike — এটা কি equilibrium? না। "back off"-এর best response "back off"; তাই যে দেশ strike করছে সে best response দিচ্ছে না।

The two Nash equilibria of the MAD game shown with solid lines

চিত্র ৩: MAD-এর দুই Nash equilibrium মোটা রেখায় — both back off (শান্তি) ও both strike (ধ্বংস); ভাঙা রেখা equilibrium-এর বাইরের পথ।

Highlighting equilibrium paths versus off-equilibrium paths in the MAD game

চিত্র ৪: একই stylized simultaneous game-এর আরেকটি উপস্থাপন—কঠিন রেখা equilibrium path, ভাঙা রেখা off-equilibrium path। এটি deterrence-এর একটি সরল model; বাস্তব sequential retaliation-এর credibility আলাদাভাবে verify করতে হয়।

ব্যাখ্যা। এই stylized simultaneous matrix-এ দুই Nash equilibrium আছে—দুজনেই back off এবং দুজনেই strike। কিন্তু "both strike একটি equilibrium" থেকে একাই প্রমাণ হয় না যে বাস্তব sequential game-এ retaliation credible বা সেটিই শান্তির কারণ। MAD deterrence-এর জন্য দরকার assured second-strike capability এবং এমন command/commitment structure, যাতে first strike-এর পর পাল্টা আক্রমণের threat বাস্তবে কার্যকর হবে। Retaliation-এর সময় back off যদি strictly better হয়, commitment ছাড়া threat non-credible। তাই timing, information ও payoff specify না করে equilibrium-কে বাস্তব causal explanation ধরা যাবে না। ভুল-বোঝাবুঝি, accidental launch ও escalation-এর ঝুঁকিও model-এর বাইরে নয়।

gossip war। রোজকার জীবনে আমরা উঁচু-বাজির খেলা খেলি না; বরং ছোট escalation ও retaliation চলে যতক্ষণ না একটা ফুটন্ত বিন্দুতে পৌঁছাই — সেটাই আসলে MAD-এর একটা খেলা। উদাহরণ: দুই মানুষের মধ্যে "gossip war" — দুই বন্ধু, সন্তান ও বাবা-মা, স্বামী ও স্ত্রী, বা media ও এক celebrity। শেষটাকে কাঠামো ধরে দেখি (বিশ্লেষণ বাকিগুলোতেও খাটে)। "শান্তির সময়" celebrity ও media একসঙ্গে কাজ করে — লাভজনক, শান্তিপূর্ণ খবরে দুজনেই খুশি, exclusive access আর publicity অবাধে বিনিময় হয়। কিন্তু মাঝেমধ্যে celebrity বিতর্কিত গুজবে জড়ায় (সত্যি হোক বা না) — খবরটা ছড়ালে celebrity-র ভাবমূর্তি নষ্ট হয়, media সামান্য বেশি মুনাফা পায়। খেলা শুরু করতে media-র দুই পথ: গল্পটা "back off" করে শান্তি রাখা, নাকি গুজব ছাপিয়ে সম্পর্ক "escalate" করা। খবর ছাপলে celebrity-রও দুই পথ: "back off" করে সামান্য সুনাম-ক্ষতি মেনে নেওয়া, নাকি প্রকাশ্যে অস্বীকার করে আবার "escalate" করা। দুজনেই escalate করলে full-blown media তামাশা — কাদা-ছোড়াছুড়ি, বন্য অভিযোগ, অসংশ্লিষ্ট রসাল গল্প — মানে একটা gossip war

Game tree of the gossip war between the media and a celebrity

চিত্র ৫: gossip war-এর game tree। gossip war পারমাণবিক যুদ্ধের অনুরূপ — দুজনেই back off করলে সামান্য খরচে শান্তিতে মীমাংসা; যেকোনো একজন ধ্বংসাত্মক প্রমাণ নিয়ে "strike" করলে দুই সুনামই বড় ক্ষতিগ্রস্ত (celebrity ধুয়ে যায়, media ভবিষ্যৎ খবর হারায়)। payoff-এর যুক্তি: media শুরুতেই back off = দুজনেরই \(0\); media escalate + celebrity back off = media \(+2\), celebrity \(-2\); gossip war-এর শান্তির ফল celebrity-র জন্য (\(-1\)) আগেভাগে back off (\(-2\))-এর চেয়ে ভালো, আর media-র জন্য (\(-1\)) celebrity back off না করার (\(2\))-এর চেয়ে খারাপ।

Nash equilibrium — backward induction দিয়ে। নিচের gossip war-এর দুই equilibrium MAD-এর মতোই — দুজনেই "back off" বা দুজনেই "strike"; দুই ক্ষেত্র আলাদা করে দেখা যাক।

Gossip war solved by backward induction toward the peace equilibrium

চিত্র ৬: প্রথম ক্ষেত্র (শান্তির equilibrium)। গাছের উপরে উঠি: media escalate করলে celebrity কী করবে? gossip war শান্তিতে শেষ হবে জেনে celebrity escalate করাই পছন্দ করবে (শেষে \(-1\)), back off (\(-2\))-এর বদলে। এক ধাপ উপরে উঠে media celebrity-র পাল্টা-আঘাত আঁচ করে খেলার শুরুতেই ঠিক করে — গুজবে back off (\(0\)) করা escalate (\(-1\))-এর চেয়ে ভালো। তাই media শুরুতেই back off করে।

Gossip war solved by backward induction toward the mutual-destruction equilibrium

চিত্র ৭: দ্বিতীয় ক্ষেত্র (ধ্বংসের equilibrium)। media escalate করলে celebrity জানে gossip war ধ্বংসে (\(-\infty\)) শেষ হবে, তাই সে back off করে (\(-2\)), escalate (\(-\infty\))-এর বদলে। তা আঁচ করে media escalate করে (\(+2\) > back off-এর \(0\))। বাস্তবে বেশির ভাগ celebrity ও media প্রতিহিংসাপরায়ণ, তাই এই দ্বিতীয় ক্ষেত্রই বেশি ঘটে — media সব খবর escalate করে, আর celebrity-র সেরা কৌশল হয় অভিযোগ নিয়ে চুপ থাকা (ছোট সুনাম-ক্ষতি মেনে নিয়ে হলেও ধ্বংসাত্মক gossip war এড়ানো)। Skip Bayless (ESPN, 2004)-এর মতে, Michael Jordan media-র কোনো প্রশ্নের জবাব না দিয়ে ঠিক এটাই করতেন — প্রতিবার back off করে Jordan ও media দুজনেই তাঁর ভাবমূর্তি থেকে লাভবান হতেন।

উপসংহার। এই বিশ্লেষণ কেবল Jordan বা সামরিক খেলার নয় — যেকোনো দুই-ব্যক্তির দ্বন্দ্বে খাটে (দুই বন্ধু, সন্তান-বাবা-মা, স্বামী-স্ত্রী)। লেখক সততার সঙ্গে বলেন, এই বিশ্লেষণ তাঁর জীবন ভালো করেছে — তিনি প্রায়ই escalation-এর মুখে পড়েন, কিন্তু বেশির ভাগ সময় যথেষ্ট সংযমে পিছিয়ে যান। এই খেলার উঁচু-বাজি বোঝার আগে তিনি gossip war-এ সেতু পুড়িয়েছেন, বন্ধু হারিয়েছেন — যা স্বীকার করতে চান তার চেয়ে বেশি; অথচ কেবল চুপ থাকলেই পরিস্থিতিগুলো বাঁচানো যেত। তাঁর আবেদন: বন্ধু, পরিবার, বা media-র ছোট গুজবে আঘাত পেলে দেখো পিছিয়ে গিয়ে ক্ষতিটা মেনে নেওয়া যায় কিনা; আগুনে ঘি না ঢেলে gossip war এড়াও। যত আঘাতই লাগুক, Jordan-এর কথা ভেবে ক্ষতি ন্যূনতম রাখো — একটা বিস্ফোরণের ঝুঁকি এর যোগ্য নয়।

২.৬ Honesty isn't the best policy — মিথ্যা কীভাবে হুমকি বিশ্বাসযোগ্য করে

"সততাই শ্রেষ্ঠ নীতি" — যে এটা বলেছিল সে নিশ্চয়ই মিথ্যা বলছিল, আর credible threat-এর game theory শেখেনি। মিথ্যা বহু বার্তাবাহককে গুলি খাওয়া থেকে বাঁচিয়েছে, বহু যুগলকে শরীর নিয়ে বিস্ফোরক ঝগড়া থেকে রক্ষা করেছে। নৈতিক নীতি হিসেবে সততা নিয়ে বলার অনেক কিছু আছে, আর যতটা স্বচ্ছন্দ ততটা সৎ থাকাই উচিত। সমস্যা হলো, আমরা তত্ত্বে বাস করি না — বিষয়গুলো ব্যবহারিকভাবে বিচার করতে হয়। আর এই আলোয় game theory বলে — মিথ্যা সব পক্ষের জন্যই লাভজনক হতে পারে; অনেক ক্ষেত্রে মাঝেমধ্যে মিথ্যা বলার নীতি কঠোর সততার চেয়ে কার্যকর। কারণ মিথ্যা প্যারাডক্সিক্যালি হুমকিকে বেশি credible করে তোলে। দুটো কার্যকর মিথ্যার উদাহরণ:

কার্যকর মিথ্যা ১ — "rate কমাও, নাহলে cancel করছি!" কিছু খুঁতখুঁতে গ্রাহক আছে যারা নিখুঁত দাম খোঁজে ("rate-chaser")। আমাদের বেশির ভাগই ভালো service-এর জন্য যুক্তিসংগত দাম দিতে রাজি — অর্থাৎ ত্রুটিপূর্ণ প্রতিযোগীর কাছে switch করার ঝামেলা এড়াতে সামান্য বেশি দিতেও আপত্তি নেই। বেশির ভাগ গ্রাহক "cancel করব" বললে মিথ্যা বলে; আসলে তারা কম rate চায়, কিন্তু সেটা আদায় করবে কীভাবে? গ্রাহক কম rate-এর সব যুক্তি সাজাতে পারে — কোম্পানির customer acquisition cost বাঁচে, গ্রাহককে service বদলাতে হয় না। কিন্তু এই সত্য যুক্তিগুলো কোম্পানিকে রাজি করাতে যথেষ্ট নয়; তাই সৎ কারণগুলোর ওপর জোর দিতে চলে-যাওয়ার অসৎ হুমকি জুড়ে দিতে হয়। লেখক বহুবার cancel-এর হুমকি দিয়ে ফোন করেছেন, agent জানত হুমকিটা ফাঁপা, তবু মিথ্যাটা যথেষ্ট ভালো হুমকি ছিল বলে ভালো discount মিলেছে।

কার্যকর মিথ্যা ২ — "আমি কখনো তোমার সঙ্গে থাকব না — কখনো না!" কলেজে লেখকের এক বন্ধু ভেঙে পড়েছিল। যে মেয়েটির প্রতি সে আগ্রহী ছিল, তার সঙ্গে সব ভালোই চলছিল, কিন্তু সম্পর্ক আরও গভীর করতে চাইলে সব ভেস্তে গেল — মেয়েটি সত্যিই আগ্রহী ছিল না। তারা "the talk" করে, মেয়েটি জানায় তার আগ্রহ বন্ধুত্বের, প্রেমের নয়। আরও এক ধাপ এগিয়ে সে বলে — সে কখনো তার সঙ্গে থাকবে না, কখনোই না। এই শেষ কথাটাই বন্ধুকে সবচেয়ে কষ্ট দেয়, কারণ তা কোনো আশা রাখেনি। বন্ধু লেখকের কাছে মনের কথা উজাড় করে দিলে লেখক তাকে চাঙা করার উপায় ভাবেন — দুটো যুক্তি দেন। প্রথমত, তারা সত্যিই মানানসই হলে সময়ের সঙ্গে হয়তো ঠিক হয়ে যেতে পারত: কেউ ভবিষ্যৎ জানে না, মানুষ বদলায় (বহু গল্প-সিনেমায় নারীরা পুরুষদের নিয়ে অনুভূতি বদলায়); মেয়েটি কয়েক বছর পরের নিজেকেই তো ঠিক বলতে পারে না, তবে "কখনো আগ্রহী হবে না" দাবি করে কীভাবে? দ্বিতীয়ত, বন্ধুকে কৌশলগতভাবে ভাবতে হবে — "কখনো না" সম্ভবত খেলার শেষ নয়। মেয়েটি "never" বলেছিল কারণ সামান্য অতিরঞ্জন সত্যকে বেশি বিশ্বাসযোগ্য করে: সে আগেই "আগ্রহী নই" বলেছিল, দরকার ছিল আরও শক্তিশালী সংকেত। তার বিকল্পই বা কী ছিল? "ভবিষ্যতে হয়তো হতে পারি" বললে বেশি আশাবাদী বার্তা যেত; বর্তমানে বন্ধুকে থামাতে তাকে ভবিষ্যৎ নিয়েই কথা বলতে হয়েছিল। সারমর্ম: প্রত্যাখ্যাত হলে মন খারাপ কোরো না, তবে তোমার best response হয়তো স্বল্পমেয়াদে এগিয়ে যাওয়া।

২.৭ একসাথে অনেককে হুমকি — principle of embarrassment

game of chicken ও জীবনের অনেক পরিস্থিতিতে হুমকি credible প্রমাণ করতে হয় কেবল এক বা কয়েকজনের কাছে। কিন্তু কিছু খেলায় প্রতিপক্ষ অনেক — তখন হুমকি দেওয়ার লোকও বেশি, আর তোমার হুমকি "ফাঁপা" প্রমাণ করতে চাওয়া লোকও বেশি। এই খেলা জিতবে কীভাবে?

একটা বাস্তব উদাহরণ ২০০৭-এ ঘটে: RIAA (Recording Industry Association of America) music piracy নিয়ে একটা আইনি লড়াই জেতে। Minnesota-র এক নারী file sharing-এর জন্য copyright লঙ্ঘনে দোষী সাব্যস্ত হন, ক্ষতিপূরণ ধার্য হয় $২২০,০০০। দাবিকৃত $৩.৯ মিলিয়ন (+ আইনি খরচ)-এর চেয়ে অঙ্কটা অনেক ছোট হলেও RIAA একে বিজয় ধরল। কিন্তু এটা কি সত্যিই বিজয়, আর এটা কি অবৈধ file sharing ঠেকাবে?

game theory-র চোখে সমস্যাটা মজার — অনেকটা guessing game। RIAA চায় প্রতিটা অবৈধ downloader-কে ধরতে, কিন্তু তাতে monitoring ও আইনি খরচ আকাশছোঁয়া হবে। মানুষও বিনা পয়সায় গান নামাতে চায়, তবে কেবল যদি ধরা পড়ার ঝুঁকি কম থাকে। enforcement ছাড়া অবৈধ download বাড়ে, তাই RIAA বেশি নজরদারি করতে চায়; তাতে download কমে, ফলে RIAA কম enforcement-এ খরচ বাঁচাতে পারে, আবার download বাড়ে — চক্রটা চলতেই থাকে। এটা অনেকটা পুলিশের গতিসীমা-প্রয়োগের মতো: পুলিশ এমন মাত্রায় নজর রাখে যাতে বেপরোয়া গতি নিরুৎসাহিত হয়, কিন্তু খরচ ন্যূনতম থাকে। উঁচু enforcement খরচ মানে আমাদের মেনে নিতে হয় কিছু লোক গতিসীমা ভাঙবেই। কিন্তু RIAA যদি এই "optimal" মাত্রার download-এ খুশি না হয়, আরও লোককে থামাতে চায়, তবে কী কৌশল নেবে?

শুরুতে RIAA-কে একসাথে অনেককে হুমকি দিতে হবে, আর তার একটা উপায় লেখক বলেন principle of embarrassment (লজ্জা দেওয়ার নীতি)। এটা লেখক প্রথম শেখেন high school-এ এক motivational speaker-এর কাছ থেকে। assembly-র শুরুতে speaker ভদ্রভাবে চুপ থাকতে বললেন — কেউ শুনল না; সবাই ভাবছিল "সংখ্যায় নিরাপত্তা", ১,০০০ জন দর্শকের একজন হিসেবে প্রত্যেকে নিজেকে ধরা-ছোঁয়ার বাইরে ভাবছিল। তখন speaker এমন কিছু করলেন যাতে সবাই একদম চুপ হয়ে গেল: কড়া ও কিছুটা রাগী গলায় তিনি এক জনপ্রিয় ছাত্রকে আঙুল তুলে মঞ্চে ডাকলেন, আর তার কথা-বলা নিয়ে এমন ঠাট্টা করলেন যে সবাই হেসে উঠল। ছাত্রটির লজ্জার মুখ লেখকের এখনো মনে আছে। এটা এত কার্যকর ছিল যে বাকিরা একটা শব্দও করতে সাহস পেল না — ভয়, "পরের জন আমিই হতে পারি।"

একজন ছাত্রকে লজ্জা দিয়ে speaker আমাদের সবাইকে হুমকি দিতে পেরেছিলেন। তত্ত্বে এই কৌশল RIAA-র জন্যও কাজ করতে পারত, আর ব্যক্তিদের প্রকাশ্যে মামলা করে RIAA যেন ঠিক তা-ই করছিল। কিন্তু তারা সম্ভবত তত্ত্বটা ভুল প্রয়োগ করেছিল, কারণ তাদের পরিস্থিতিতে তিনটি জরুরি উপাদান ছিল না। principle of embarrassment আসলে একটা কৌশলগত চাল যা একটা simultaneous game (একসাথে সব ছাত্রকে চুপ করানো)-কে sequential game (একজনকে চুপ করিয়ে বাকি সবাইকে জানানো তুমিই "next in line") বদলে দেয়। কাজ করতে যা লাগে —

১. শাস্তি দ্রুত প্রয়োগ হতে হবে। assembly-তে speaker সঙ্গে সঙ্গে জনপ্রিয় ছাত্রকে শাস্তি দিয়ে বার্তা পৌঁছে দিয়েছিলেন। RIAA-র সেই গতির সুবিধা ছিল না — ২০০৭-এর জয় আসলে ২০০৫-এ শুরু হওয়া মামলার ফল। RIAA যা করল তা যেন speaker ছাত্রকে আলাদা ডেকে, দুই বছর school board মিটিং চালিয়ে, তারপর detention দিলেন — যখন আমরা বেশির ভাগই কলেজে চলে গেছি। এতে না চলমান দর্শক থামত, না নতুন ছাত্রদের শিক্ষা হতো।

২. লক্ষ্য-দর্শককে শাস্তিটা দেখতে হবে। speaker আমাদের বার্তা দিতে পেরেছিলেন কারণ আমরা সহপাঠীর অপমান নিজের চোখে দেখছিলাম। RIAA উল্টো ধরল এক ৩০ বছরের single parent-কে — যা মূল downloader-দের (যেমন কলেজ-ছাত্র) কাছে বার্তা পৌঁছায় না।

৩. শাস্তি আবার দেওয়ার হুমকি credible হতে হবে। এটা খুব গুরুত্বপূর্ণ ধাপ। assembly-তে আমরা ভয় পেয়েছিলাম কারণ speaker দ্বিধাহীনভাবে ছাত্র মঞ্চে ডাকছিলেন — তাঁর জন্য তা সহজ, বিনা-খরচ, আর তিনি উপভোগও করছিলেন। RIAA-র হুমকি কি credible ছিল? প্রতিটা offender-এর জন্য RIAA-কে আইনি খরচ ও আদালতের সময় দিতে হয়; তাদের পক্ষে সত্যিই প্রতিটা offender-কে ধরা যুক্তিসংগত নয়।

শেষ একটা কথা। এমনকি RIAA যদি principle of embarrassment সঠিকভাবে প্রয়োগও করত, তবু ব্যক্তিকে "bully" করার সুনাম থেকে ক্ষতি হতে পারত। এই মামলায় ২৪টা গান শেয়ার করার জন্য নারীটিকে $২২০,০০০ জরিমানা করা হয়, যা ব্যাপকভাবে অতিরিক্ত মনে করা হয়েছিল। একসাথে অনেককে হুমকি দেওয়া সহজ নয়।

২.৮ Limiting options — বিকল্প কমানোর শক্তি

হুমকি credible করার মূল ভাবনা — প্রমাণ করা তুমি পিছু হটবে না। এর একটা উপায়: ইচ্ছাকৃতভাবে নিজের বিকল্প কমিয়ে দরকষাকষির অবস্থান শক্ত করা। একটা গল্প। John আর Tim দুজনেই এক consulting কোম্পানিতে project শেষ করে নতুন কাজে যাওয়ার জন্য তৈরি। তাদের দক্ষতা ও কাজের নিষ্ঠা এক, দুজনেই team-player হিসেবে গণ্য। তবু গত এক বছর Tim আটকে থেকেছে একঘেয়ে, পুনরাবৃত্তিমূলক কাজে (যেমন data জোগাড়), আর John পেয়েছে রোমাঞ্চকর project — এমনকি Hawaii ভ্রমণ! Tim-এর এই দুর্ভাগ্য খুবই সাধারণ; সম্ভবত তোমারও অভিজ্ঞতা আছে যেখানে সমান-প্রতিভাবান কোনো সহকর্মী তোমার চেয়ে ভালো কাজ পায়।

কেন কেউ কেউ ভালো project পায়? প্রায়ই ভালো project প্রতিভাবান ও পছন্দের কর্মীর কাছেই যায় — এই স্পষ্ট ব্যাখ্যাই হয়তো বেশির ভাগ staffing ব্যাখ্যা করে। কিন্তু এটা গল্পের অংশমাত্র। John আর Tim-এর মতো সমান-দক্ষ কর্মীদের কোম্পানি কীভাবে staff করে? ভাগ্য কিছুটা কাজ করে, কিন্তু কোম্পানি নিশ্চয়ই কয়েন ছুড়ে randomly staff করে না। শেষ পর্যন্ত manager ও coordinator-রা সিদ্ধান্ত নেয়, আর তারা ভাবে কর্মী কীভাবে প্রতিক্রিয়া দেখাবে। John কি এই সিদ্ধান্তকে প্রভাবিত করে ভালো project পেতে পারে? উত্তরটা লুকিয়ে দুটো প্রশ্নে — কেন কিছু airline যাত্রী বিশেষ খাদ্যচাহিদার ভান করে, আর কেন Stanford-এর economics অধ্যাপকরা নিজেদের কোর্স পড়ানোর কর্তৃত্ব ছেড়ে দিতে রাজি হয়েছিলেন।

Airline food। বিমানের খাবার নিয়ে ঠাট্টা অসংখ্য। খাবার কেন এত বাজে? সম্ভবত দুটো কারণে — এক, airline সবচেয়ে সস্তা খাবার দিয়ে টাকা বাঁচায়; দুই, খাবারটা সবার জন্য বানানো, আর কথায় বলে "সবাইকে খুশি করতে গেলে কাউকেই খুশি করা যায় না।" যাত্রী হিসেবে ভালো খাবার পেতে কী করবে? তুমি special meal (যেমন vegetarian বা kosher) চেয়ে দেখাতে পারো তুমি গড় গ্রাহক নও — এসব খাবার প্রায়ই সাধারণ খাবারের চেয়ে ভালো হয়। কেন ভালো? কারণ তুমি সংকেত দাও তোমার রুচি একটা বিশেষ গোষ্ঠীর, তাই খাবারটা "সাদামাটা" নয়। যেমন vegetarian খাবারে সম্ভবত তাজা ফল থাকবে (যা সব যাত্রী পছন্দ না-ও করতে পারে)। সারমর্ম — তুমি "কী খেতে পারো" তার বিকল্প কমিয়ে বিমানের খাবার উন্নত করো।

Stanford-এর economics অধ্যাপকরা। বিকল্প কমিয়ে সত্যিই ভালো ফল পাওয়া যায়? দেখো Stanford-এর অধ্যাপকরা কীভাবে নিজেদের কর্তৃত্ব সীমিত করে সুখী হলেন। বিশ্ববিদ্যালয়ের অধ্যাপকরা গর্বিত মানুষ, বৌদ্ধিক ও সামাজিক স্বাধীনতা নিয়ে গর্ব করেন। লেখকের এক অধ্যাপক স্বীকার করেছিলেন — তিনি corporate কাজ চান না, কারণ সরাসরি boss-এর নিয়ন্ত্রণে টিকতে পারবেন না; এই স্বাধীনতাই tenured অধ্যাপকদের ঝুঁকি নিতে দেয় (যেমন বিতর্কিত রাজনৈতিক ইস্যুতে নতুন দৃষ্টিভঙ্গি আলোচনা)। স্বাভাবিকভাবে ভাববে অধ্যাপকরা নিজের মতো করে ক্লাস পড়ানোর স্বাধীনতা চাইবেন। তাহলে Stanford-এর economics অধ্যাপকরা স্বেচ্ছায় কেন তিন-পৃষ্ঠার এক নিয়মপত্রে রাজি হলেন, যা exam-এ উপস্থিতি বা grading-এর ভুল সংশোধনের মতো কোর্স-নীতি ঠিক করে দেয়? সত্যিটা হলো, অধ্যাপকরা exam মিস করা বা grading-ভুল সামলানোর মতো ঝামেলা পছন্দ করেন না। নিয়মের আগে প্রতিটা special request-এর ন্যায্য সমাধান তাঁদের ভাবতে হতো — যা তাঁরা ভাবতেই চাইতেন না। কর্তৃত্ব-সীমিত করা এই তিন-পৃষ্ঠার নিয়মে রাজি হয়ে তাঁরা এখন ছাত্রদের বলতে পারেন — "এ বিষয়ে আমার হাত নেই।" আশ্চর্যজনকভাবে, স্বাধীনতাপ্রিয় অধ্যাপকরা নিয়ন্ত্রণ ছেড়ে, স্বাধীনতা সীমিত করে বেশি সুখী।

ভালো project পাওয়া। এখন ফিরি তোমার নিয়োগকর্তায়। ভালো project পেতে চাইলে কম নমনীয় হয়ে বিকল্প কমানোর উপায় খোঁজো — অনেক পথ আছে। হয়তো খারাপ project-এ কতটা অসুখী তা সূক্ষ্মভাবে জানিয়ে "খারাপ project-এ ভালো করে না" সুনাম গড়তে পারো; ভালো project-এ যথেষ্ট মূল্যবান হলে, খারাপ project নিয়ে কম-সরব সমান-প্রতিভাবান সহকর্মীর বদলে তোমাকেই ভালো project-এ দেওয়া হবে। আবার "খারাপ project" যদি দীর্ঘ-ঘণ্টার কাজ হয়, তবে ব্যক্তিগত schedule-এ এমন appointment ভরে সেগুলো এড়াতে পারো যা মিস করা যায় না — তাতে তোমার নমনীয়তা কমে, দীর্ঘ-ঘণ্টায় staff করার সম্ভাবনাও কমে। তবে সূক্ষ্ম রেখায় হাঁটতে হবে, নিশ্চিত করতে হবে লোকে বোঝে appointment-গুলো সত্যিই তোমার নিয়ন্ত্রণের বাইরে (যেমন কোনো professional কোর্সের পরীক্ষার তারিখ, বা যে concert-এ তুমি বাজাবে) — অন্য সময়ে করা যায় এমন কিছু (weekend ছুটি বা জরুরি-নয় ডাক্তার-অ্যাপয়েন্টমেন্ট) নয়।

২.৯ Salary negotiation ও withholding supply — জোগান আটকে রাখা

লেখকের এক underpaid বন্ধু salary negotiation-এ সব কৌশল খাটিয়েও ব্যর্থ হন। এক বছর অবশেষে প্রাপ্য raise মেলে — আর যে কৌশলে কাজ হলো তা হলো অসুস্থ হয়ে পড়া! বন্ধুটি ঠাট্টা করে বলতেন, কোম্পানি তাঁর মূল্য বুঝবে তিনি চলে গেলে তবেই; ঘটনাচক্রে সেটা আরও তাড়াতাড়ি ঘটল। তিনি এক সপ্তাহ ভীষণ অসুস্থ থাকায় তাঁর project ভেঙে পড়ে; ফিরে এসে দ্রুত সব ঠিক করেন — এই ঘটনাই review-এর সময় manager-দের মুগ্ধ করে। গল্পের অদ্ভুত দিক: তিনি আসলে নিজেকে বদলাননি — কোনো ক্লাস করেননি, নতুন দক্ষতা শেখেননি, এমনকি লুকানো প্রতিভা দেখাননি (এর আগেও অফিসে গোলমাল সামলেছেন)। অনুপস্থিত থেকে তিনি অজান্তেই দেখিয়ে দিলেন সহকর্মীদের অক্ষমতা। দরকষাকষি সবসময় "তুমি কী পারো" নয়, বরং প্রায়ই "অন্যরা কী পারে না" — তার খেলা।

অন্যরা কী পারে না তা দেখানোর কয়েকটা credible উপায়ের একটা হলো withholding supply (জোগান আটকে রাখা) — অর্থাৎ, তুমি সত্যিই ক্ষমতাধর হলে কৌশলে কম কাজ বা কম উৎপাদন করা। প্রচলিত ধারণার বিপরীতে, বেশি ও কঠোর খাটাই সবসময় সেরা দরকষাকষির কৌশল নয়। withholding supply শক্তিশালী কৌশল, আর Microsoft, Nintendo, Oakland Athletics, ও Zara-র মতো বড় খেলোয়াড়রা এটা ব্যবহার করেছে। উদাহরণে যাওয়ার আগে একটা সরল card game দিয়ে তত্ত্বটা বুঝি।

Card game (added value)। খেলাটা Co-Opetition বইয়ে বর্ণিত। ২৬ জন MBA ছাত্রের প্রত্যেকের হাতে একটা করে লাল কার্ড; অধ্যাপক Adam Brandenburger-এর হাতে ২৬টা কালো কার্ড। dean ঘোষণা দেন — যে-ই (Adam বা কোনো ছাত্র) এক জোড়া লাল-কালো কার্ড ফেরত দিতে পারবে, তাকে $১০০ পুরস্কার। এটাই খেলা: Adam ও ছাত্রদের মধ্যে অবাধ দরকষাকষি, দুই পক্ষই মিলিয়ে জোড়া বানাতে চায়। একমাত্র শর্ত — ছাত্ররা দল বেঁধে Adam-এর সঙ্গে দর করতে পারবে না, প্রত্যেককে এককভাবে দর করতে হবে। দর কোথায় গিয়ে থামবে?

শুরুতে মনে হবে Adam-এর বিরাট সুবিধা — সব কালো কার্ড তার, তাই প্রতিটা জোড়া তার সঙ্গে বিনিময়েই বানাতে হবে; সে তাই প্রিমিয়ামে কালো কার্ড বেচে বা ছাড়ে লাল কার্ড কিনে ক্ষমতা খাটাতে পারে। কিন্তু আসলে কী দামে বিনিময় হবে? game theory দিয়ে অনুমান করি প্রতিটা খেলোয়াড় খেলায় কতটা গুরুত্বপূর্ণ, তা মেপে — এই মাপকাঠির নাম added value (যোগকৃত মূল্য): একজন খেলোয়াড় থাকায় খেলায় কত টাকা যোগ হয়।

  • Adam-এর added value। Adam থাকলে ২৬ জোড়া সম্ভব, মোট $২,৬০০; Adam না থাকলে কোনো কালো কার্ড নেই, কোনো পুরস্কার নেই। পার্থক্য = Adam-এর added value = $২,৬০০।
  • প্রতি ছাত্রের added value। প্রতিটা ছাত্রের হাতে ঠিক একটা লাল কার্ড; সে থাকলে একটা জোড়া বাড়ে = $১০০, না থাকলে ঠিক একটা জোড়া কম। তাই প্রতি ছাত্রের added value = $১০০, ২৬ জনে মিলে $২,৬০০।

দুই পক্ষের marginal contribution symmetric—এটি সমান bargaining power-এর ইঙ্গিত দেয়, কিন্তু added value একা payoff division uniquely determine করে না। Bargaining protocol, outside option, patience ও bargaining solution specify করতে হয়। Symmetric Nash bargaining-এর মতো benchmark নিলে প্রতিটি $100 pair-এর surplus $50–$50 ভাগ হয় এবং Adam মোট $1300 পায়। অন্য bargaining rule-এ অন্য division-ও সম্ভব।

Adam কি ভালো করতে পারে? হ্যাঁ — জোগান আটকে। কৌশলটা কালো কার্ডের কৃত্রিম দুর্লভতা তৈরি করা। ধরো Adam ছাত্রদের সামনে একটা কালো কার্ড পুড়িয়ে ফেলে। এখন ২৫ কালো, ২৬ লাল। কার্ড পোড়ানোয় মোট পুরস্কার $১০০ কমে $২,৫০০ হলেও, Adam-এর দরকষাকষির ক্ষমতা অবিশ্বাস্য বেড়ে যায়। added value দিয়ে দেখি:

  • Adam-এর added value এখনও গোটা pot, এখন $২,৫০০ (Adam প্রতিটা জোড়ার জন্য এখনও অপরিহার্য)।
  • প্রতি ছাত্রের added value নাটকীয়ভাবে বদলায়: ২৬ লাল কিন্তু মাত্র ২৫ কালো — একটা লাল কার্ড উদ্বৃত্ত, যা শেষে জোড়া পাবে না। যেকোনো একজন ছাত্রকে সরিয়ে দিলেও মোট পুরস্কার একই ($২,৫০০) থাকে। তাই প্রতি ছাত্রের added value = $০। হঠাৎ, কোনো একক ছাত্রই আর অপরিহার্য নয়!

এখন কোনো একক student-এর marginal contribution শূন্য, কারণ একটি red card excess supply-তে আছে। যদি students price compete করে এবং Adam lowest offer নিতে পারে—Bertrand-style bargaining protocol—তবে undercutting red-card price-কে শূন্যের দিকে ঠেলে দেয় এবং Adam প্রায় $2500 capture করতে পারে। কিন্তু protocol না দিলে এটিও automatic theorem নয়; added value শুধু scarcity ও bargaining leverage কীভাবে বদলেছে তা দেখায়।

বাস্তব উদাহরণ — Microsoft, Nintendo, Oakland A's, Zara। ঠিকভাবে করলে বড় কোম্পানিও এভাবে জোগান আটকে ব্যক্তিগত লাভ করে। কাজটা সবসময় বিতর্কিত, কারণ withholding supply সমাজের ক্ষতি করে (লক্ষ করো, একটা কার্ড পুড়িয়ে Adam $১০০ মূল্য নষ্ট করেছিল)।

  1. Microsoft। বহুদিন Microsoft-কে জোগান আটকানোর অভিযোগে অভিযুক্ত করা হয়। University of Chicago Law School-এর Randal Picker এই একই card-game উপমা দিয়ে Microsoft-এর কৌশল ব্যাখ্যা করেন। উদাহরণ — AOL তার online connection service প্রচারে Microsoft-এর সঙ্গে চুক্তি চাইছিল; তত্ত্বে Microsoft যেকোনো internet service provider-এর icon সহজে যোগ করতে পারত, কিন্তু ইচ্ছাকৃতভাবে icon সীমিত রাখল। এখন AOL সীমিত জায়গার জন্য প্রতিযোগিতায়, আর Microsoft আদায় করে নিল যে AOL তার Internet Explorer browser প্রচার করবে।
  2. Nintendo। Wii আনার সময় দোকানে ঘাটতি হলে Nintendo-কেও কৃত্রিম দুর্লভতা তৈরির অভিযোগে অভিযুক্ত করা হয়। কারণটা কী হতে পারত? সম্ভবত বড় retailer-দের ক্রয়ক্ষমতার মোকাবিলা: দোকানগুলো ইচ্ছেমতো Wii অর্ডার করতে পারত না, একটা সীমিত quota-র জন্য অপেক্ষা করতে হতো — retailer-রা যেন "বাদ না-পড়ার আশায় থাকা ছাত্র"। এতে ক্ষমতা Nintendo-র দিকে সরে যায়। (এই অভিযোগ নতুন নয় — ১৯৯৭ থেকে কিছু অর্থনীতিবিদ Nintendo নিয়ে এমন সন্দেহ করেছেন।)
  3. Oakland Athletics। টিকিট বিক্রিকে একধরনের matching game ভাবা যায় — প্রতিটা ভরা আসন একটা physical আসন ও এক টিকিট-কেনা ভক্তের জোড়া; আসনের মূল্য কোনোভাবে ভক্ত ও মালিকের মধ্যে ভাগ হয়। মালিকের হাতে সব আসন (Adam-এর কালো কার্ডের মতো), কিন্তু টাকা ভক্তের হাতে। চাহিদা বেশি হলে সব ম্যাচ sold out, দাম বাড়ে; চাহিদা কম হলে মানুষ কেবল সস্তা আসন কেনে। এই পরিস্থিতিতে মালিক available আসনের সংখ্যা সমন্বয় করে পাল্টা চাল দিতে পারে। ২০০৬-এ Oakland A's ঠিক তা-ই করল — ইচ্ছাকৃতভাবে কিছু সস্তা আসন বন্ধ করে আসন-ক্ষমতা ২২% কমাল। গড় উপস্থিতি ১০% কমলেও গড় টিকিট-দাম বেড়ে তা পুষিয়ে গেল।
  4. Zara। Zara একটা স্প্যানিশ পোশাক-খুচরা বিক্রেতা। সাধারণত পোশাক-দোকান মৌসুমের পোশাক প্রিমিয়ামে বেচে, মৌসুম-শেষে ভারী ছাড়ে inventory খালি করে। ক্রেতার তাই দুই পথ — পুরো দামে এখন কেনা, বা মৌসুম-শেষে সস্তায় কেনা। Zara এই খেলা পছন্দ করত না, কারণ তা ক্রেতাকে অপেক্ষা করতে উৎসাহ দিত। Zara খেলা বদলাল ক্রেতার বিকল্প কমিয়েUS News & World Report-এর মতে, প্রতি ৩–৪ সপ্তাহে inventory পুরো বদলে দিয়ে। উদ্দেশ্য: ক্রেতাকে এখনই, পুরো দামে কিনতে "অভ্যস্ত" করা — এই ঝুঁকি যোগ করে যে জিনিসটা পরের বার আর না-ও থাকতে পারে। জোগান আটকাও, ক্ষমতা ধরে রাখো।

২.১০ Braess paradox — রাস্তা বাড়ালে সবার দেরি

বিকল্প কমানো কখনো সামাজিকভাবেও অপ্রত্যাশিত ভালো ফল আনে। এক ছুটির মৌসুমে বন্যায় লেখকের শহরের কিছু রাস্তা সাময়িক বন্ধ হয়। তিনি ভাবছিলেন যানজট বাড়বে, কিন্তু উল্টো ঘটল — যাতায়াত মোটামুটি অপ্রভাবিত থাকল, এমনকি প্রায়ই তাঁর ভ্রমণ-সময় কমে গেল! এটা অর্থহীন মনে হয়েছিল — যানজট যদি বেশি গাড়ির সমস্যা হয়, তবে রাস্তা বন্ধ করলে যাতায়াত দ্রুত হয় কীভাবে? বা উল্টো, রাস্তা যোগ করলে ধীর হয় কেন? এর একটা মজার game-theoretic ব্যাখ্যা আছে — Braess paradox (ব্রেস প্যারাডক্স) — যা বলে, রাস্তা যোগ করা সব চালকের ভ্রমণ ধীর করে দিতে পারে। উদাহরণে দেখি।

ট্রাফিক প্রশ্ন। একটা নেটওয়ার্কে ১,০০০ চালক start থেকে end যেতে চায়। দুই প্রধান পথ: start-A-end বা start-B-end। জটিলতা যানজটে: কিছু রাস্তা সরু, ভিড়ে জ্যাম হয় — এতে প্রত্যেক চালকের সময় নির্ভর করে কতজন (\(T\)) সেই পথ নেয় তার ওপর, গড়ে \(T/25\) মিনিট (যত বেশি চালক, তত ধীর)। কিন্তু সব রাস্তা সরু নয় — কিছু এত চওড়া যে কখনো জ্যাম হয় না, সময় ধ্রুবক। এই নেটওয়ার্কে start-A ও B-end সরু (\(T/25\) মিনিট), আর A-end ও start-B চওড়া (\(50\) মিনিট, ধ্রুবক)। সবাই সময় optimize করলে start থেকে end যেতে কত লাগবে?

Traffic network for the Braess paradox with two routes from start to end

চিত্র ৮: Braess-এর ট্রাফিক নেটওয়ার্ক। start-A ও B-end সরু (\(T/25\) মিনিট, ভিড়ে ধীর); A-end ও start-B চওড়া (\(50\) মিনিট, ধ্রুবক)। দুই পথ: start-A-end আর start-B-end।

Nash equilibrium। খেলাটা গতিশীল — প্রত্যেক চালক অন্যরা কী করবে আন্দাজ করে পথ বাছে। \(A\) জন start-A-end নিলে সেই পথে সময় \(A/25 + 50\); \(B\) জন start-B-end নিলে \(50 + B/25\)। বাস্তবে অনেক ফল সম্ভব — যেমন ৬০০ জন start-A-end নিলে সময় \(600/25 + 50 = 74\) মিনিট, বাকি ৪০০ জন start-B-end নিলে \(50 + 400/25 = 66\) মিনিট। কিন্তু চালকেরা চালাক, traffic report দেখে পরদিন পথ বদলায়; start-A-end-এর কেউ কেউ start-B-end-এ সরবে। এই অদলবদল চলতে থাকে যতক্ষণ না দুই পথের সময় সমান — তখনই কেউ পথ বদলে লাভ করতে পারে না, সেটাই equilibrium। সমীকরণ (বা graph) থেকে দেখা যায় এটা ঘটে \(A = B = 500\)-এ, দুই পথেই সময় \(500/25 + 50 = 20 + 50 = 70\) মিনিট। এখন প্রত্যেক চালক দুই পথের মধ্যে উদাসীন; কেউ একা লাভ করতে পারে না, তাই এটাই Nash equilibrium।

Graph of travel times for the two routes as a function of the number of drivers

চিত্র ৯: দুই পথের ভ্রমণ-সময় বনাম চালক-সংখ্যা। equilibrium সেখানে যেখানে দুই পথের সময় সমান — \(A = B = 500\), প্রতিটা পথ \(500/25 + 50 = 70\) মিনিট।

নতুন রাস্তা যোগ করলে কী হয়? ধরো A ও B বিন্দুর মধ্যে একটা নতুন রাস্তা যোগ হলো — এত চওড়া ও ছোট যে পার হতে প্রায় কোনো সময় লাগে না (একটা "free" রাস্তা)।

The same network after adding a fast free road between A and B

চিত্র ১০: A ও B-এর মধ্যে একটা "free" (প্রায় \(0\) মিনিট) রাস্তা যোগ করা হলো।

নতুন খেলার সমাধান (Braess paradox)। নতুন রাস্তা চালকদের বেশি বিকল্প দেয় — এখন তারা "free" রাস্তা দিয়ে পথ বদলাতে পারে। খেলাটা আশ্চর্যরকম সহজে সমাধান হয়, কারণ প্রত্যেক চালকের একটা dominant strategy আছে। প্রথম পছন্দ — start-A নাকি start-B? সবাই start-A নেবে: এমনকি সব ১,০০০ জন নিলেও start-A লাগে সর্বোচ্চ \(1000/25 = 40\) মিনিট, যেখানে start-B নিশ্চিতভাবে \(50\) মিনিট। তাই সবাই start-A নেয় (৪০ মিনিট)। এরপর, A-তে পৌঁছে দুই পছন্দ — A-end (নিশ্চিত \(50\) মিনিট) নাকি free road A-B (\(0\) মিনিট) হয়ে B-end (\(T/25\), সর্বোচ্চ \(40\) মিনিট)। স্বভাবতই সবাই free road ও B-end নেয়। ফল — সব ১,০০০ চালক start-A-B-end নেয়, মোট সময় \(1000/25 + 0 + 1000/25 = 40 + 0 + 40 = 80\) মিনিট। উপরন্তু, কেউ পথ বদলাতে চাইবে না, কারণ বিকল্প start-A-end বা start-B-end এখন প্রতিটা \(40 + 50 = 90\) মিনিট! এই equilibrium-এ চালকদের নেওয়া রাস্তাগুলো সম্পূর্ণ জ্যাম, আর ফল আগের চেয়ে ১০ মিনিট খারাপ — রাস্তা A-B না থাকলে যা ছিল (\(70\))।

Kid figure: Braess network before and after adding the free road

চিত্র ১১: (নিজের আঁকা) বাঁয়ে A-B রাস্তা ছাড়া equilibrium — ৫০০+৫০০ চালক, প্রতি পথ ৭০ মিনিট। ডানে "free" A-B রাস্তা যোগের পর সবাই S-A-B-E নেয়, ৮০ মিনিট — সবার দেরি বেড়ে গেল।

আসলে কী ঘটছে? প্যারাডক্সটা ব্যক্তিগত incentive ও সামাজিক optimum-এর সংঘর্ষের ফল। সব চালক যদি "free" রাস্তা A-B না নিতে রাজি হতো, তবে সবাই ১০ মিনিট বাঁচাতে পারত। কিন্তু এই প্রস্তাব টেকসই নয় — প্রতিটা চালকের একা cheat করে (free road নিয়ে সময় বাঁচিয়ে) লাভের incentive আছে। শেষে সবাই cheat করে, সব রাস্তা জ্যাম, ব্যবস্থা ভেঙে পড়ে। শিক্ষা: optimum-এর জন্য চালকদের সমন্বয় করাতে social planning দরকার, আর তার মানে কখনো বিকল্প সীমিত করাই ভালো।

২.১১ Burning bridges — সেতু পোড়ানো

একটা প্রবাদ আছে — "কখনো সেতু পোড়াবে না" (never burn bridges), মানে সম্পর্ক কখনো এমনভাবে নষ্ট কোরো না যে আর ফেরা যায় না। দুনিয়া ছোট, কখন কার সঙ্গে আবার দেখা হবে বলা যায় না — তাই এটা মূলত ভালো উপদেশ। কিন্তু পুরোপুরি সঠিক নয়। আসলে বহু সময় সেতু পোড়ানো কেবল লাভজনকই নয়, লক্ষ্য অর্জনে একেবারে জরুরি। এটা limiting options-এর একটা সম্প্রসারণ।

কেন সেতু পোড়ানো = নিজের বিকল্প কমানো (commitment)। সেতু পোড়ানোর ধ্রুপদী উদাহরণ ইতিহাসের সেনাপতিরা। ১৫১৯ সালে Hernán Cortés Mexico-য় নেমে নিজের জাহাজগুলোই ধ্বংস (scuttle) করে দেন — সৈন্যদের পিছু হটে দেশে ফেরার পথ বন্ধ করতে; এখন লড়াই ছাড়া উপায় নেই, তাই তারা প্রাণপণে লড়ে। প্রাচীন চীনা সেনাপতি Xiang Yu একই কাজ করেন — নদী পার হয়ে সৈন্যদের রান্নার হাঁড়ি ভেঙে ও নৌকা ডুবিয়ে দেন ("破釜沉舟", হাঁড়ি ভাঙা ও নৌকা ডোবানো), যাতে ফেরার আশা না থাকে। এটাই সেতু পোড়ানোর আসল কৌশলগত সার — নিজের পিছু-হটার বিকল্প ইচ্ছাকৃতভাবে ধ্বংস করে হুমকিকে (এখানে "আমরা মরিয়া হয়ে লড়ব") credible করে তোলা। ২.১-এর lighthouse আর steering wheel ফেলে দেওয়া চালকের মতোই — কম বিকল্প মানে বেশি শক্তি। তাই burning bridges-কে ভাবো একটা হাতিয়ার হিসেবে, অনেকটা ছুতোরের হাতুড়ির মতো — বেপরোয়া ব্যবহারে অপরিবর্তনীয় ক্ষতি, কিন্তু সতর্ক ব্যবহারে নতুন নির্মাণের জন্য দরকারি। হাতিয়ারটা নিয়ন্ত্রণে রাখো, নিচের উদাহরণগুলোর মতো, তাহলে সুফল পাবে।

যে সেতু কখনো ছিলই না, তা পোড়াও। The Daily Show (একটা ব্যঙ্গাত্মক comedy সংবাদ-শো)-তে লেখক এই কৌশল বহুবার দেখেছেন। একবার এক সরকারি কর্মকর্তা অতিথি host Jon Stewart-এর ওপর ক্ষুব্ধ — কয়েক সপ্তাহ ধরে Stewart তাঁর সংবাদ-সম্মেলনে তথ্য-অসংগতি নিয়ে ঠাট্টা করছিলেন। প্রতিশোধের সুযোগ পেয়ে অতিথি The Daily Show-এর কয়েকটা তথ্য-অসংগতির উদাহরণ দিয়ে Stewart-এর কাছে তাঁর "ভণ্ডামির" ব্যাখ্যা দাবি করেন। Stewart-এর জবাব সতর্ক হতে হতো — জবাব ঠিক করত এই অতিথি ও তাঁর মতো আরও কেউ আর কখনো শো-তে আসবেন কিনা; নরম জবাব অপেশাদার শোনাত, বড় কঠোর হলে একটা সেতু পুড়ত। Stewart কী বললেন? এক মুহূর্ত না থেমে ব্যঙ্গের সুরে — "Here at the Daily Show, we... well... we don't check our facts." (আমরা তো... আসলে... আমরা আমাদের তথ্য যাচাই করি না।) দর্শক হেসে উঠল, অতিথি ভীষণ রাগলেন — মুখে ভাব যেন "এই শো-তে রাজি হয়ে ভুল করেছি, আমার চেনা কেউ আর এই শো-তে আসবে না।" Stewart নিশ্চয়ই একটা সেতু পোড়ালেন, কিন্তু তাতে ক্ষতি হয়নি — কারণ সেতুটা আসলে কখনো ছিলই না: The Daily Show সব তথ্য নিখুঁত রাখার শো নয়, বরং রাজনীতির কমেডির শো। ফল স্পষ্ট — ওই অতিথি হয়তো আর ফিরবেন না, কিন্তু পরবর্তী অতিথিরা আর কখনো অত মুখোমুখি লড়তে আসেননি। নিজের brand-এ commit করে Stewart ভবিষ্যৎ অতিথিদের মান বাড়ালেন।

কোণঠাসা হলে সব সেতু সমানভাবে পোড়াও। সফল ও অসফল মানুষের মাপকাঠি আলাদা — সফলদের সমালোচনা হয় তাদের ব্যর্থতার জন্য, অসফলদের প্রশংসা হয় তাদের সাফল্যের জন্য। বেশির ভাগ অভিনেতা A-lister (সবচেয়ে বাণিজ্যসফল তারকা) হতে চান; কিন্তু Kathy Griffin নিজেকে বলেন "D-lister"। এত নিচু মান কেন? সম্ভবত তাঁর আর উপায় নেই — তিনি অজান্তেই বিতর্কের সুনাম গড়ে ফেলেছেন। বহু talk show থেকে তিনি নিষিদ্ধ (David Letterman-এর শো সহ), আর ২০০৫-এ এক award show-তে Dakota Fanning নিয়ে মন্তব্যের পর E! Entertainment channel থেকে বরখাস্ত। কোণঠাসা হয়ে Griffin তাঁর শো "Kathy Griffin: My Life on the D-List"-এ সব রকম সেতু পোড়াতে শুরু করেন — কেউ তাঁর সমালোচনা থেকে রেহাই পায় না। New York Times অনুযায়ী তিনি Oprah Winfrey, Conan O'Brien, Ryan Seacrest, Miley Cyrus, Russell Crowe, Hugh Hefner, Nicole Kidman, এমনকি "Live With Regis and Kelly"-র executive producer Michael Gelman-কেও ব্যঙ্গ করেছেন। Griffin আসলে Stewart-এর কৌশলের আরও চরম সংস্করণ ব্যবহার করছেন — বিকল্প কম বলে তিনি বেশি "কখনো-না-থাকা সেতু" পোড়াতে পারেন, আর তা কার্যকরভাবেই — তাঁর শো "outstanding noncompetitive reality show" বিভাগে Emmy জিতেছে।

তুমি কীভাবে এই উপদেশ কাজে লাগাবে। burning bridges কেবল talk show host বা celebrity-র জন্য নয়। লেখক নিজেও কোণঠাসা হলে সব সেতু সমানে পোড়ান। একবার তিনি এমন এক কমিটিতে ছিলেন যেখানে সব সদস্য অজানা কারণে তাঁকে অপছন্দ করত। পরিস্থিতি ঠিক করার সব চেষ্টা ব্যর্থ হয়ে যখন তিনি প্রায় একঘরে, তখন Griffin-এর মতো তিনি বাজি বাড়িয়ে সব সেতু পোড়ানোর পথ নিলেন — এবং আশ্চর্যজনকভাবে কাজ হলো। যখন তিনি একজনের নীতির অন্যায্য সমালোচনা করলেন, তখন সেই ব্যক্তির শত্রুদের সাময়িক মিত্র বানিয়ে ফেললেন; আর মানুষ তাঁর ভুলের বদলে ঠিক কাজগুলো নিয়ে বিচার করতে শুরু করল। এতে দীর্ঘস্থায়ী কোনো বন্ধু হয়নি, কিন্তু কোণঠাসা অবস্থায় তিনি যা পেরেছেন করেছেন — burning bridges তাঁকে কার্যকর পরিবর্তন আনতে সাহায্য করেছিল, যখন তাঁর ক্ষমতা ছিল।

২.১২ Leader's dilemma — sequential থেকে simultaneous

marriage বা পছন্দের চাকরির মতো ধরে রাখতে-চাওয়া সম্পর্কে সেতু পোড়ানোর উপায় নেই; আইনি বাধাও থাকতে পারে (boss-কে কর্মস্থল-আইন ভাঙা এড়াতে হয়)। তবু খেলার কাঠামো ভেবে কৌশলগত সুবিধা মেলে। নেতাকে প্রায়ই বাছতে হয় — ঝুঁকিপূর্ণ কিন্তু দারুণ ফল, নাকি নিশ্চিত কিন্তু মাঝারি ফল; একেই লেখক বলেন leader's dilemma (নেতার উভয়সংকট)। সমস্যার মূল অনেকটাই খেলার নির্দিষ্ট ক্রম (fixed order)-এ: নেতা আগে চাল দেয় বলে অনুসারীরা ত্রুটি দেখে সমালোচনার সময় পায়। ভালো ফলগুলোর প্রায়ই সহযোগিতা লাগে বলে সেগুলো ঝুঁকিপূর্ণ ও কম সম্ভাব্য, তাই নিরাপদ-কিন্তু-মাঝারি ফল উঠে আসে। সবাই মিলেমিশে চলতে পারি না কেন? আসলে অনেকটাই পারি — একটা বুদ্ধি: sequential খেলা যদি সমস্যার মূল হয়, তবে সেই বৈশিষ্ট্যটাই বদলে simultaneous play-এ নিলে কেমন হয়, যেখানে খেলোয়াড়দের আন্দাজ করে action-এ commit করতে হয়? সবাই পূর্ণ জ্ঞান ছাড়া চাল দিলে হয়তো গড়ে সবাই ভালো থাকবে।

খেলা — sequential play (action-এর পূর্ণ জ্ঞান)। দুই retailer পোশাক নিয়ে প্রতিযোগিতায়। "leader" কোম্পানি (ধরো একটা brand-name পোশাক-বিক্রেতা) আগে চাল দেয় — ঘোষণা করে সে low-margin পণ্য (\(L\)) নাকি high-margin পণ্য (\(H\)) বানাচ্ছে। ঘোষণা দেখে "follower" কোম্পানি (ধরো Wal-Mart-এর মতো discount retailer)-এর দুই জবাব: নিজের brand-এ একটা নকল (imitation, \(I\)) বানানো, নাকি একই পণ্য রাখা (match, \(M\))। ধরো high-margin পণ্যের বাজার-payoff $৪ মিলিয়ন (দুই দোকানে ভাগ), low-margin-এর $২ মিলিয়ন। follower match করলে লাভ সমান ভাগ। মজার অংশ follower imitate করলে: high-margin নকল যথেষ্ট ভালো হবে, তাই follower সব অর্ডার নিয়ে গোটা বাজার দখল করবে; কিন্তু low-margin নকল এত নিম্নমানের হবে যে কেউ কিনবে না, ফলে leader গোটা বাজার পাবে।

Sequential game tree of the leader's dilemma between two retailers

চিত্র ১২: leader's dilemma-র sequential game tree। payoff (leader, follower): \(L,M \to (1,1)\); \(L,I \to (2,0)\); \(H,M \to (2,2)\); \(H,I \to (0,4)\)

ফল — backward induction। follower low- ও high-margin দুই ক্ষেত্রে কী করবে তা কল্পনা করে leader-এর সেরা পছন্দ বের করি। leader \(L\) বাছলে follower match (\(1\)) vs imitate (\(0\)) → match, leader পায় \(1\)। leader \(H\) বাছলে follower match (\(2\)) vs imitate (\(4\)) → imitate, leader পায় \(0\)

The leader's dilemma solved by backward induction on the game tree

চিত্র ১৩: backward induction-এ সমাধান। leader জানে \(L \to\) (follower match) \(\to\) leader পায় \(1\); \(H \to\) (follower imitate) \(\to\) leader পায় \(0\)। তাই leader \(L\) বাছে, ফল \((1,1)\) — মাঝারি।

ব্যাখ্যা। ফলটা মাঝারি — দুই দোকানই $১ মিলিয়ন পায়। তারা যদি high-margin পণ্য ভাগ করতে রাজি হতো, দুজনেই $২ মিলিয়ন পেত (\(H,M\)) — দুই পক্ষের জন্যই ভালো (Pareto-dominant)। কিন্তু সমস্যা: এই ফল enforce করার উপায় নেই। leader \(H\) বাছলে follower match করে ভাগ করবে না, বরং imitate করে গোটা বাজার নেবে। দুই কোম্পানি সমন্বয়ের চেষ্টা করতে পারে, কিন্তু বিশ্বাস ও চুক্তি-রক্ষা কঠিন; খেলা বারবার (শত শত পণ্যে) চললে দুজনেই সময়ের সঙ্গে হারবে।

কীভাবে ভালো ফল? একটা উপায় — sequential play-কে simultaneous play-এ বদলানো: একজন mediator strategy-commitment সংগ্রহ করুক, দ্বিতীয় কোম্পানি প্রথমটির সিদ্ধান্ত না জেনেই ঠিক করুক। কেউ জানে না অন্যজন কী করবে, তাই দুজনকেই strategy mix করতে হবে, আর তাতে গড় payoff বাড়ে — দুই কোম্পানিরই। খেলা বারবার বা বহু পণ্যে চললে এটা খুব কাজের। simultaneous সংস্করণ একটা matrix হিসেবে লেখা যায়।

The revised game as a simultaneous-play payoff matrix

চিত্র ১৪: simultaneous সংস্করণ payoff matrix হিসেবে। মূল বৈশিষ্ট্য — কোনো pure strategy Nash equilibrium নেই।

payoff matrix (leader = সারি, follower = কলাম; প্রথম সংখ্যা leader):

Follower: Imitate \((I)\) Follower: Match \((M)\)
Leader: Low \((L)\) \((2,\ 0)\) \((1,\ 1)\)
Leader: High \((H)\) \((0,\ 4)\) \((2,\ 2)\)

best response খুঁজতে গেলে একটা চক্র: "\(L\)"-এর সেরা জবাব "\(M\)", "\(M\)"-এর সেরা জবাব "\(H\)", "\(H\)"-এর সেরা জবাব "\(I\)", "\(I\)"-এর সেরা জবাব "\(L\)" — ঘুরতেই থাকে।

The best-response cycle, analogous to rock-paper-scissors

চিত্র ১৫: best-response চক্র — rock-paper-scissors-এর মতো, কোনো স্থির pure equilibrium নেই; প্রতিটা action-এর জবাব আরেকটা action, কেউ এক জায়গায় স্থির থাকতে খুশি নয়।

সমাধান — mixed strategy (মিশ্র কৌশল)। rock-paper-scissors-এর মতোই দুজনকে কৌশল randomize করতে হয় — এমনভাবে যেন প্রতিপক্ষ তার pure পছন্দগুলোর মধ্যে উদাসীন (indifferent) হয়ে যায়। হিসাব করলে player 1 নেয় \(L\) probability \(2/3\) (আর \(H\) probability \(1/3\)), player 2 নেয় \(I\) probability \(1/3\) (আর \(M\) probability \(2/3\))। ফলে কখনো কেউ গোটা বাজার নেয়, কখনো high ও low ভাগ হয় — খেলোয়াড়েরা কেবল low-margin ভাগেই আটকে থাকে না। ফলস্বরূপ প্রতিজনের payoff \(1\) মিলিয়ন থেকে \(4/3 \approx 1.33\) মিলিয়নে বাড়ে — ৩৩% বেশি, দুজনেই লাভবান। তথ্য গোপন করে (simultaneous play) leader গোটা দলের উদ্বৃত্ত বাড়ায়।

পরিশিষ্ট — mixed equilibrium-এর অঙ্ক। ধরি player 1 বাছে \(L\) probability \(p\), \(H\) probability \(1-p\); \(p\) এমন যেন player 2 এর \(I\)\(M\)-এ উদাসীন:

\[\text{payoff}(I) = \text{payoff}(M): \quad 0p + 4(1-p) = p + 2(1-p)\]
\[4 - 4p = 2 - p \;\Rightarrow\; p = \tfrac{2}{3},\]

আর \(I\) বা \(M\) খেলার payoff \(= 2 - p = 4/3\)। এবার player 2 বাছে \(I\) probability \(q\), \(M\) probability \(1-q\); \(q\) এমন যেন player 1 এর \(L\)\(H\)-এ উদাসীন:

\[\text{payoff}(L) = \text{payoff}(H): \quad 2q + (1-q) = 0q + 2(1-q)\]
\[q + 1 = 2 - 2q \;\Rightarrow\; q = \tfrac{1}{3},\]

আর \(L\) বা \(H\) খেলার payoff \(= q + 1 = 4/3\)

২.১৩ Market unraveling — lemons ও signaling

এই উদাহরণ George Akerlof-এর ১৯৬৬ সালের এক পেপারের ওপর ভিত্তি করে — বাজে ব্যবহৃত গাড়ি, চলতি কথায় "lemon", নিয়ে বাজার। ভাবো তুমি online listing দেখে একটা ব্যবহৃত গাড়ি কিনছ; দাম $১৭,০০০ থেকে $২৩,০০০-এর মধ্যে ছড়ানো। তুমি মালিকদের সঙ্গে email-এ যোগাযোগ করে সেরা দাম চাইছ, আর বাজারে তোমার মতো চতুর ক্রেতারাও আছে। কোন গাড়িটা কিনবে?

তুমি কৌশলে ভাবো। প্রথমে সবচেয়ে সস্তা listing কেনার কথা ভাবো, ভালো deal পেতে। কিন্তু শিগগিরই ভয় হয় — কম দাম হয়তো কম মানের ইঙ্গিত; বিক্রেতা তো গাড়িটা তোমার চেয়ে বেশি জানে, নিশ্চয়ই জানে এটা আরও কম দামের। তাই ভয় পেয়ে বেশি দামি listing দেখো, ভালো মানের আশায়। কিন্তু বোঝো, কিছু বিক্রেতা এই মনোভাবেরই সুযোগ নেয় — ঠকাতে ইচ্ছাকৃতভাবে বাজে গাড়ি বেশি দামে তোলে। যেহেতু নির্দিষ্ট গাড়ির মান বোঝা যায় না, তুমি বাজারের গড় মানের ভিত্তিতে সিদ্ধান্ত নাও। গাড়ি ভালো-খারাপ সমান সম্ভাব্য ধরলে, তুমি ঠিক করো listing-এর গড় দামের বেশি দেবে না। শুরুতে দাম $১৭,০০০–$২৩,০০০, তাই তুমি গড় $২০,০০০-এর বেশি দেবে না।

কিন্তু এই দাম-সীমার একটা নেতিবাচক ফল আছে। উঁচু-মানের গাড়ির বিক্রেতা এত কম দামে বেচবে না, তাই সে বাজার ছেড়ে যায়।

Diagram showing high-value sellers leaving the used-car market

চিত্র ১৬: $২০,০০০-এর ওপর দামি সব গাড়ির বিক্রেতা এত কম দামে বেচবে না, তাই তারা বাজার ছেড়ে যায়। এখন বাজার $১৭,০০০–$২০,০০০-এ সীমিত।

এই বিক্রেতারা চলে গেলে বাজার $১৭,০০০–$২০,০০০-এ সীমিত। কিন্তু এই পর্যায়ে তুমি আবার মানের একই সমস্যায় — মান আন্দাজ করতে না পেরে আবার ঠিক করো নতুন গড় $১৮,৫০০-এর বেশি দেবে না। এটা আবার উঁচু-মানের গাড়ির বিক্রেতাদের বাজার থেকে তাড়ায়।

Diagram showing the used-car market completely unraveling

চিত্র ১৭: প্রক্রিয়াটা বারবার চলে যতক্ষণ না কেবল $১৭,০০০-এর (সবচেয়ে বাজে, সবচেয়ে কম-রক্ষণাবেক্ষণের, সম্ভবত lemon) গাড়ি টিকে থাকে — যা বেশির ভাগ ক্রেতা চায় না, ফলে কেউ কেনে না, কেউ বেচে না। বাজার সম্পূর্ণ খুলে পড়ে (market unravels)

কিছু সমাধান। মডেলটা চমৎকার হলেও নিখুঁত ছবি নয় — বাস্তবে ব্যবহৃত গাড়ি বিকোয়, উঁচু-মানেরও। "market for lemons" একটা তাত্ত্বিক ধারণা, বাস্তব পর্যবেক্ষণ নয়। ব্যবহৃত-গাড়ির বাজার unravel ঠেকাতে সুরক্ষা গড়ে তুলেছে — মূল ভাবনা বিশ্বাস প্রতিষ্ঠা ও ক্রেতার মান-চেনার ক্ষমতা বাড়ানো। car history, warranty, ও জাতীয় সুনাম (যেমন CarMax) — সবই ক্রেতাকে মান বুঝতে সাহায্য করে। game theory-তে এমন কোনো action বা গুণ, যা belief প্রভাবিত করে, তাকে বলে signal (সংকেত)। আমরা সবসময় signal ব্যবহার করি: ভালো grade ও degree-প্রাপ্ত ছাত্র হয়তো চাকরির দক্ষতা অর্জন করছে না, বরং employer-কে সংকেত দিচ্ছে যে সে পরিশ্রমী ও বুদ্ধিমান; দামি designer পোশাক বা ঘড়ি কেনা মানুষ কেবল সুন্দর জিনিস পরতে চায় না, তা সম্পদের সংকেতও। একইভাবে মানুষ signaling-এর তত্ত্বের অপব্যবহারও করে — ভুয়া academic record বানিয়ে বা সাধ্যের বাইরে পোশাক কিনে। বাজার সবসময় unravel হওয়ার ঝুঁকিতে থাকে; বাজার টেকে কারণ কিছু signal সত্যি এবং জাল করা যায় না।

২.১৪ Smart pill — বুদ্ধির বড়ি

ভাবো একটা জাদুকরি বড়ি তোমার বুদ্ধি ২৫% বাড়ায়, কোনো side effect ছাড়াই। খাবে? বেশির ভাগ মানুষ লাফিয়ে রাজি হবে — আর সত্যিই, বুদ্ধিমান সমাজের সুবিধা আছে। কিন্তু বাজি ধরে বলা যায়, বেশির ভাগ মানুষ ভুল কারণে বড়িটা খাবে, কারণ তারা সিদ্ধান্তের কৌশলগত পরিণতি ভাবেনি।

ওষুধের খেলা। ধরো তুমি আর আমি মজা করে chess খেলি; বর্তমানে আমরা সমান দক্ষ, তাই আমাদের খেলা গড়ে draw হয়, বা আমরা পালা করে জিতি। এক ওষুধ কোম্পানি বুদ্ধি বাড়ানোর বড়ি ছাড়ল, আর trial-এ দেখা গেল এটা chess-এর পারফরম্যান্স বাড়ায়। এখন আমাদের প্রত্যেকের সামনে বড়ি খাওয়ার পছন্দ। একজন খেলে সে বেশির ভাগ খেলা জিতবে; দুজনেই খেলে দুজনেই সমান উন্নত হয়ে আবার সমান-প্রতিদ্বন্দ্বী।

Payoff matrix of the smart-pill game

চিত্র ১৮: smart pill খেলার payoff। কাঠামোটা Prisoner's Dilemma-র মতো — বড়ি খাওয়া dominant strategy।

একটা প্রতিনিধিত্বমূলক payoff (প্রথম সংখ্যা আমার):

You: no pill You: pill
Me: no pill \((3,\ 3)\) \((1,\ 4)\)
Me: pill \((4,\ 1)\) \((2,\ 2)\)

কীভাবে খেলা গড়াবে? আমি রক্ষণশীল, সম্ভব হলে supplement বড়ি এড়াব, আর জানি তুমিও সম্ভবত তাই — তাই আমরা একটা "ভদ্রলোকের চুক্তি" করে বড়ি না খেতে পারি। কিন্তু এটা enforce করার উপায় নেই — প্রত্যেকে নিজের অধিকারে গোপনে বড়ি খেতে পারে। হঠাৎ আমার সন্দেহ হয় তুমি হয়তো বড়ি খাবে। তখন যুক্তি: আমি একা খেলে এগিয়ে থাকব; আমি ও তুমি দুজনেই খেলে সমান, তাতেও ঠিক আছে। তাই বড়ি খাওয়া একটা নিরাপদ কৌশলগত পছন্দ — এটা সেই সম্ভাবনা এড়ায় যেখানে তুমি একা খাও আর আমি খেলায় পিষ্ট হই। শেষমেশ দুজনেই বড়ি খাই, যদিও কেউই চাই না। matrix-এ যাচাই: তুমি no pill নিলে আমি pill (\(4\)) > no pill (\(3\)); তুমি pill নিলে আমি pill (\(2\)) > no pill (\(1\))। তাই pill খাওয়া dominant — যদিও দুজনে no pill নিলে (\(3,3\)) ভালো হতো, আমরা (\(2,2\))-তে আটকাই।

বাস্তব জীবনে। খেলাটা কি বড় সরল শোনাচ্ছে? আসলে ফলটা মানুষ যেভাবে ভাবে ঠিক তার প্রতিফলন। বুদ্ধি বাড়ানোর বড়ি ভালো শোনায় — কৌশলগত পরিণতি পুরো ভাবার আগে পর্যন্ত। একই সমস্যা পেশাদার খেলোয়াড়দের ভুগিয়েছে, যারা অবৈধভাবে steroid বা অন্য drug নেয়। সমাজ হিসেবে performance-enhancing drug নিয়ে সতর্ক থাকা জরুরি — এমনকি যারা drug নিতে চায় না, তারাও প্রতিযোগিতার সঙ্গে তাল মেলাতে প্রলুব্ধ হয়।

২.১৫ Voting paradox — Condorcet ও Arrow

আমাদের পছন্দ অন্যদের পছন্দে প্রভাবিত হয় — এটা game theory-র কেন্দ্রীয় উপাদান, আর যেকোনো গণতন্ত্রেরও মূল কথা: তোমার মানতে-হওয়া আইন আসলে সবার (অন্তত যারা ভোট দিয়েছে তাদের) পছন্দের ফল। এটাই স্বাভাবিকভাবে নিয়ে আসে voting theory ও ব্যক্তির পছন্দকে দলগত পছন্দে মেলানোর সমস্যা। ছোটবেলার একটা গল্প দিয়ে শুরু: লেখক ঝাল খেতে পারতেন না, তাঁর ভাই ঝাল ভালোবাসত — এ নিয়ে অবিরাম দ্বন্দ্ব। খাবার ঝাল হলে লেখক অভিযোগ করতেন, কম ঝাল হলে ভাই। তাই মা প্রায়ই আলাদা করে ঝাল ও কম-ঝাল রান্না করতেন, কিন্তু কিছু পদে তা অবাস্তব — তখন একজন অভিযোগ করত অন্যজনকে বেশি খাতির করা হচ্ছে, আর তারা পরিবারের অন্যদের "ভোট" জোগাড়ের চেষ্টা করত। হেরে যাওয়া ভালো লাগত না। এমন পরিস্থিতি অস্বাভাবিক নয় — মানুষ সবসময় অভিযোগ করে যে তারা অন্যায্য majority-র শিকার, বিশেষত যেখানে ভোট নেওয়া হয় (hiring সিদ্ধান্ত, presidential নির্বাচন, baseball hall of fame)। কিন্তু অবাক হওয়ার কিছু নেই — যেখানে ভোট নেওয়া হয় সেখানে পরস্পরবিরোধী পছন্দ ভরা, স্বভাবতই কেউ না কেউ বঞ্চিত বোধ করবে।

কত ঘন ঘন এটা ঘটে? choice theory বলে খুব ঘন ঘন। সর্বোত্তম সামাজিক সিদ্ধান্ত নিয়ে একটা বিখ্যাত theorem মূলত বলে — অনেক সিদ্ধান্তে (৩ বা বেশি বিকল্প, ২ বা বেশি মানুষ) ব্যক্তির পছন্দকে অর্থপূর্ণভাবে দলগত পছন্দে মেলানো অসম্ভব। এক graduate-স্তরের বই theorem-টা এভাবে সারসংক্ষেপ করে: "হয় আমাদের এই আশা ছাড়তে হবে যে সমাজের পছন্দ [অর্থনৈতিক অর্থে] যুক্তিসংগত হতে পারে... নয়তো dictatorship মেনে নিতে হবে।" (Microeconomic Theory — Mas-Colell, Whinston, Green)।

Arrow's impossibility theorem। Kenneth Arrow একজন অর্থনীতিবিদ, ৫১ বছর বয়সে Nobel Memorial Prize পান — সবচেয়ে কম বয়সী প্রাপক। তিনি general equilibrium, তথ্যের অর্থনীতি, growth theory, ও social choice theory-তে অবদান রাখেন। তিনি প্রমাণ করেন তাঁর "general impossibility theorem", যা এখন তাঁর সম্মানে "Arrow's impossibility theorem" নামে পরিচিত (এর জন্যই তিনি ২০০৪-এ National Medal of Science পান); মজার কথা, এটা ছিল তাঁর গবেষণার সবে শুরু — তাঁর Ph.D. thesis-এর বিষয়। theorem-এর পূর্ণ উপস্থাপন ও প্রমাণ এ বইয়ের সীমার বাইরে, কিন্তু সংক্ষেপে — যখনই কমপক্ষে ২ জন মানুষ ও কমপক্ষে ৩টা বিকল্প থাকে, তখন কিছু কাঙ্ক্ষিত শর্ত না ভেঙে ব্যক্তির পছন্দকে দলগত পছন্দে মেলানো অসম্ভব। হয় মেনে নাও সমাজ ব্যক্তির মতো যুক্তিবাদীভাবে আচরণ করবে না, নয়তো মেনে নাও সমাজের পছন্দ ঠিক একজনের পছন্দের নকল হবে — যা কার্যত ওই ব্যক্তিকে dictator বানায়। ভোটের সমস্যা যে Arrow-এর প্রায় দুইশো বছর আগেও জানা ছিল, তা এক ছোট উদাহরণে দেখা যায়।

A Voting Paradox (Condorcet's Paradox)। ১৭৮৫ সালে Marquis de Condorcet তাঁর গুরুত্বপূর্ণ কাজ Essay on the Application of Analysis to the Probability of Majority Decisions লেখেন — সামাজিক বিজ্ঞানে probability-র প্রথম প্রয়োগগুলোর একটা, আর তাতে নির্বাচনের এক চমকপ্রদ সমস্যার উদাহরণ। ভাবো তিন প্রার্থী A, B, C পদের জন্য লড়ছে, আর মাত্র তিন ভোটার (বা তিন দলীয় ভোট-গোষ্ঠী)। প্রত্যেকের পছন্দক্রম (সবচেয়ে পছন্দ আগে):

  • Voter 1: \(A > B > C\)
  • Voter 2: \(B > C > A\)
  • Voter 3: \(C > A > B\)

কোন প্রার্থী majority-র পছন্দ সবচেয়ে ভালো ধরে? ধরো A-কে ক্ষমতায় বসাই — Voter 1 খুশি, কিন্তু Voter 2 ও 3 অখুশি। Voter 3 বলবে নির্বাচন অন্যায্য, C অনেক ভালো — এটা পক্ষপাতী মত। কিন্তু Voter 3 খেয়াল করে Voter 2-ও অখুশি; আর এখানেই paradox-এর চাবি। Voter 2 ও 3 মিলে দেখে দুজনেই C-কে A-র চেয়ে পছন্দ করে (Voter 3-এর প্রথম পছন্দ C, Voter 2-এর কাছে C > A)। তারা মিলে Voter 1-কে হারিয়ে C-কে ক্ষমতায় বসায়। শান্তি কয়েক মিনিট টেকে, কারণ শিগগিরই Voter 2-এর আফসোস হয় — C তো A-র চেয়ে সামান্যই ভালো, তার আসল পছন্দ B। Voter 2 আর Voter 1-এর সঙ্গে কথা বলে জানে দুজনেই B-কে C-র চেয়ে পছন্দ করে; তারা মিলে B-কে ক্ষমতায় বসায়। B ক্ষমতায় থাকে সামান্য সময়, তারপর Voter 1 ও 3 জোট বাঁধে, কারণ দুজনেই A-কে B-র চেয়ে পছন্দ করে — আবার A-কে ক্ষমতায় বসানোর পক্ষে যুক্তি ওঠে।

majority পছন্দ ব্যবহার করে দেখা গেল: A হারে C-র কাছে, C হারে B-র কাছে, B হারে A-র কাছে, আবার A হারে C-র কাছে — চক্রাকারে, অসীম পর্যন্ত। এটাই দেখায় সমাজের পছন্দ ব্যক্তির চেয়ে অনেক জটিল; Arrow-এর ভাষায়, এই voting paradox "irrational" সামাজিক পছন্দের একটা উদাহরণ। এই পরিস্থিতিতে কোনো প্রার্থীই দাবি করতে পারে না সে majority-র পছন্দ — তা অসম্ভব। এবার এতে বাস্তবতার ছোঁয়া যোগ করো (মানুষ মত বদলায়, তাৎক্ষণিক সিদ্ধান্তে ভুল করে) — এটাই গণতন্ত্রের কারবার; মানুষ সবসময় কিছু না কিছু নিয়ে অভিযোগ করে, এতে অবাক হওয়ার কিছু নেই।

২.১৬ Tissue scheme — শিক্ষকের চতুর ঘুষ

ব্যক্তির পছন্দ সবসময় সন্তোষজনক দলগত সিদ্ধান্তে অনুবাদ না-ও হতে পারে, তবু তা চেষ্টা থামানোর কারণ নয় — অনেক incentive আছে যা সবার জন্য দারুণ ইতিবাচক ফল আনে। লেখকের grade school-এর ক্লাসে একটা সমস্যা ছিল — facial tissue-র অভাব; স্কুলের দেওয়া একমাত্র বাক্সটা ২৫ জন সর্দি-কাশির ছাত্রের জন্য মোটেই যথেষ্ট ছিল না, allergy-র মৌসুম আর বরফের দিনে অবস্থা আরও খারাপ। লেখকের third-grade শিক্ষক এক চতুর "ঘুষের" ব্যবস্থা করলেন: বছরের শুরুতে ঘোষণা দিলেন — school supplies-এর অংশ হিসেবে যে এক বাক্স facial tissue আনবে, সে ১০ extra credit point পাবে। স্বভাবতই সবাই বাড়ি গিয়ে বাবা-মায়ের কাছে বায়না ধরল, আর প্রায় প্রত্যেকে এক বাক্স tissue নিয়ে ক্লাসে হাজির — ১০ extra credit point পেয়ে খুশি।

বহু বছর পর লেখকের মাথায় এল ব্যাপারটা কত চতুর ছিল। যেহেতু সবাই tissue আনল, সবাই ১০ extra credit point পেল — net প্রভাব: extra credit-এ grade-এর কোনো উপকারই হলো না! শিক্ষকের ঘুষটা ছিল বুদ্ধিদীপ্ত — ক্লাস tissue-তে ভরে গেল, আর তখন কোনো ছাত্র বোঝেনি যে point-গুলো আসলে মূল্যহীন। প্রকৃত চাতুর্য: সহপাঠীদের সঙ্গে সমানে থাকতেই আমাদের tissue আনতে হলো। কার্যত শিক্ষক একটা escalation (উত্তরোত্তর বৃদ্ধি)-র খেলা কাজে লাগিয়েছিলেন — যা পরের অংশগুলোর মূল বিষয়।

২.১৭ Dollar auction — ডলার নিলামের escalation

আজকের pop music কি বড্ড জোরে আর সব একরকম শোনায়? restaurant-bar-এ মানুষের কথা শুনতে অসুবিধা হয়? এসব ঘটনার পেছনের কারণ কী? একটা game-theory উপমা এই আচরণ ব্যাখ্যা করে। "কে বেশি জোরে" খেলা। দুই producer তাদের গান radio-তে চালাতে প্রতিযোগিতায়; programmer কেবল সবচেয়ে জোরে-শোনানো গানটা বাছবে। কৌশল সহজ — প্রত্যেক producer অন্যজনকে ছাড়িয়ে নিজের গান একটু জোরে mix করবে (এতটা নয় যে কানে লাগে, কিন্তু ঠিক ততটা যাতে programmer-এর নজর কাড়ে)। ধীরে ধীরে গান জোরে হতেই থাকবে। হাস্যকর শোনালেও America-র pop music-এ ঠিক এটাই ঘটেছে — NPR-এর একটা চমৎকার বিস্তারিত লেখা এই "loudness war" নিয়ে; বিজ্ঞানীরা গত ৫০ বছরের pop music বিশ্লেষণ করে নিশ্চিত করেছেন — হ্যাঁ, music এখন জোরে ও সব একরকম শোনায়।

Dollar auction game। loudness war-এর এমন পূর্বানুমেয় ধ্বংসাত্মক ফল হলে তা আগে থামল না কেন? একটা কাজের উপমা — dollar auction game। লেখক এটা নিজের ক্লাসে শেখেন: শিক্ষক এটাকে "গরিব ছাত্রদের সামান্য লাভের সুযোগ" বলে ক্লাসের কাছে একটা $১ নোট নিলাম করলেন। bid শুরু ৫ সেন্ট থেকে, বাড়ে ৫ সেন্ট করে। দুটো প্রধান নিয়ম: (১) কেউ আর বেশি bid না করলে নিলাম শেষ — সর্বোচ্চ bidder তার bid দিয়ে $১ পুরস্কার পায়; (২) দ্বিতীয়-সর্বোচ্চ bidder-ও তার bid দেয় (জয়ী bid-এর চেয়ে ৫ সেন্ট কম), কিন্তু বিনিময়ে কিছুই পায় না। শিক্ষক দ্বিতীয় নিয়মটাকে সত্যিকারের প্রতিযোগিতার প্রতিফলন বললেন — অনেক লড়াইয়ে দুই পক্ষই খরচ/শ্রম দেয়, কিন্তু পুরস্কার পায় একজন (মামলা, খেলা, রাজনৈতিক অনুদান)।

bid শুরু হলো ৫ সেন্টে, হাত উঠল; ১০ সেন্টে আরেক হাত; ১৫ সেন্টে আরেকটা। এ পর্যায়ে bid নির্দোষ, কারণ যেকোনো কম দামে $১ কেনা স্পষ্ট লাভ। মোচড়টা স্পষ্ট হয় যখন সর্বোচ্চ bid ৭৫ সেন্ট। এখন দ্বিতীয় নিয়ম (হেরে-যাওয়া bidder-ও দেয়) incentive-কে কীভাবে বদলায় তা ছাত্ররা ভাবতে শুরু করে। ৭০ সেন্টের bidder, যে এখন পিছিয়ে, তার দুই পথ: (১) চুপ থেকে নিলাম শেষ হলে ৭০ সেন্ট হারানো; (২) ৮০ সেন্ট bid করে, নিলাম শেষ হলে $১ জিতে ২০ সেন্ট লাভ। স্পষ্টতই ৮০ সেন্ট bid করাই ভালো। কিন্তু এই চাল এখন ৭৫ সেন্টের bidder-কে দ্বিতীয়-সর্বোচ্চ বানায়, আর সে একই হিসাব করে — চুপ থেকে ৭৫ সেন্ট হারানো, নাকি ৮৫ সেন্ট bid করে ১৫ সেন্ট লাভের সুযোগ। আবারও bid বাড়ানোই যুক্তিসংগত। সাধারণভাবে, সবসময় দ্বিতীয়-সর্বোচ্চ bidder-এর bid বাড়ানোই লাভজনক।

Table comparing the dollar auction and the loudness war

চিত্র ১৯: dollar auction ও loudness war-এর কৌশলগত মিল দেখানো টেবিল। দুটোতেই প্রত্যেকে জানে চালিয়ে যাওয়া ধ্বংসাত্মক, তবু কম হারানোর জন্য ante বাড়ায়।

এই কারণেই খেলা দ্রুত খুলে যায় — শিগগিরই কপর্দকহীন ছাত্ররা $১-এর বেশি bid করে "কে কম হারাবে" তা নিয়ে লড়ে। incentive-ই এই অদ্ভুত ফল ঠিক করে দেয়। ধরো সর্বোচ্চ bid $১.৫০; যেহেতু bid পুরস্কার $১-এর ওপরে, নতুন কেউ ঢুকবে না। তাই দ্বিতীয় bidder-এর ($১.৪৫) দুই পথ: চুপ থেকে $১.৪৫ হারানো, নাকি $১.৫৫ bid করে (নিলাম শেষ হলে $১ ফেরত পেয়ে) কেবল ৫৫ সেন্ট হারানো। এখানে ক্ষতি কমানো আর লাভ খোঁজা সমান যুক্তিসংগত। যেকোনো পরিস্থিতিতে দ্বিতীয়-সর্বোচ্চ bidder bid বাড়াবে। এই bidding war তাত্ত্বিকভাবে অসীম চলতে পারে; বাস্তবে থামে যখন কেউ হাল ছাড়ে।

Kid figure: bids in the dollar auction escalating past one dollar

চিত্র ২০: (নিজের আঁকা) dollar auction-এ bid-এর escalation। bid $1.00 (সবুজ রেখা) ছাড়িয়ে যায় — এখন দুই খেলোয়াড়ই টাকা হারাচ্ছে, তবু "কম হারাতে" bid বাড়িয়েই চলে। লেখকের ক্লাসে খেলা থেমেছিল $২-এর আশপাশে, যখন একজন "এই পাগলামি" শেষ করে দেয়; কিন্তু অর্থনীতির অধ্যাপকরা বলেন $৫, $১০, বা আরও বেশিতে থামাও অস্বাভাবিক নয় (বিশেষত দুই bidder পরস্পরকে অপছন্দ করলে)।

খেলাটা দুটো শিক্ষা দেয়: (১) এমন খেলা শুরুতেই এড়াও; (২) ঢুকে পড়লে দ্রুত ক্ষতি কেটে বেরোও — $০.০২-এ হারা $২-এ হারার চেয়ে ভালো।

bar-এ loudness game। dollar auction music loudness war-এর কৌশলের অংশ ধরে — যদিও প্রত্যেকে বোঝে চালিয়ে যাওয়া ধ্বংসাত্মক, তবু কম হারাতে ante বাড়ানোয় ন্যায্যতা খুঁজে পায়। সংশ্লিষ্ট একটা খেলা: দুই bar ঠিক করে music কত জোরে বাজাবে; মানুষ প্রায়ই জোরে-বাজা bar-এ যায়। প্রতিটা bar খদ্দের খুশি করতে সামান্য করে ভলিউম বাড়ায়, যতক্ষণ না শব্দ কান-ফাটানো হয়। New York Times এই ঘটনা নিয়ে লিখেছে — bar-এ শব্দ প্রায়ই ৮৫ ডেসিবেলের বিপজ্জনক মাত্রায়, subway train-এর চেয়ে জোরে; আর একটা গবেষণায় দেখা গেছে জোরে music মদ্যপান বাড়াতে পারে, তাই bar-এর জোরে বাজানোর একটা অসৎ কারণও থাকতে পারে।

সমাধান। কোনো খেলাই খেলোয়াড়দের পক্ষে ভালো যায় না। কিছু প্রতিকার: (১) খেলো না — dollar auction-এর ফাঁদ এড়ানোর একমাত্র উপায় না-খেলা; যোগ দিতে সবসময় লোভ হয়, কিন্তু bidding war পূর্বানুমেয়, তাই দূরে থাকো (একইভাবে pop music ও জোরে bar এড়ানো যায়, যদিও কঠিন)। (২) regulation-এর ডাক দাও — সরকার second-hand smoke ঠেকাতে ধূমপান নিষিদ্ধ করতে পারলে হয়তো indoor স্থানের loudness নিয়ন্ত্রণও করতে পারে (এটা লেখকের সুপারিশ নয়, কেবল একটা সম্ভাব্য পথ)। (৩) earplug নাও — তোমার best response হতে পারে এমন কিছু যা তোমার নিয়ন্ত্রণে; ৯০ ডেসিবেলের ওপর শব্দ স্থায়ী শ্রবণক্ষতি করতে পারে, তাই সামান্য সুরক্ষা নিয়ে music-এর খেলা খেলাই ভালো।

২.১৮ Waiting in line, high heels, studying — ব্যর্থ সমন্বয়

"এখানে, দেখো, একই জায়গায় থাকতেই তোমাকে যত জোরে পারো দৌড়াতে হবে।" — Alice in Wonderland (Red Queen)।

প্রথম দেখায় লাইনে দাঁড়ানো, ফ্যাশন, আর শিক্ষা — খুব আলাদা বিষয়। অথচ game theory-র চোখে আশ্চর্যরকম মিল: এগুলো সবই আসলে ব্যক্তিগত escalation-এর কারণে ব্যর্থ সমন্বয় (failed cooperation)।

লাইনে দাঁড়াই কেন? এক blockbuster সিনেমার opening night-এ ভালো আসন পেতে লেখকরা এক ঘণ্টা আগে হাজির — তবু তাঁরাই প্রথম নন! অন্তত ১০ জন আরও আগে এসে দাঁড়িয়েছিল। লাইনে দাঁড়িয়ে লেখক ভাবছিলেন এটা কত অপচয় — চমৎকার শুক্রবার সন্ধ্যায় দাঁড়িয়ে থাকা, যখন মজার কিছু করা যেত। এটা কেন ঘটে, game theory-র চোখে বোঝা কঠিন নয়। খেলাটার দুই কৌশলগত দিক: (ক) লাইনে দাঁড়ানো বিরক্তিকর, বেশিক্ষণ দাঁড়ানো সময়ের অপচয়; (খ) আগে-আসা লোক ভালো আসন বাছতে পারে, তাই ভিড়ের আগে আসতে চাওয়া স্বাভাবিক। সবাই যদি সিনেমার সময়মতো আসত, লাইন থাকত না, আসন প্রায় random বণ্টিত হতো — সবাই গড় আসন পেত। কিন্তু এটা equilibrium হতে পারে না: কেউ দল থেকে সরে ৫ মিনিট আগে এসে সেরা আসন নিতে চাইবে — কেন নয়? এই যুক্তি অনেকের কাছেই আকর্ষণীয়, তাই অনেকে ৫ মিনিট আগে আসে; হঠাৎ খেলা বদলায় — এখন এত লোক ৫ মিনিট আগে আসে যে ৫ মিনিট আগে এলে কেবল গড় আসন মেলে! যুক্তিটা আবার খাটিয়ে কেউ ১০ মিনিট, তারপর ১৫ মিনিট আগে আসে — বড় blockbuster-এর জন্য ঘণ্টার পর ঘণ্টা, এমনকি গোটা দিন ক্যাম্প করা অস্বাভাবিক নয়। ফল — এক ভীষণ অপচয়ী equilibrium: মানুষ লাইনে দাঁড়ায় কেবল এই কারণে যে অন্যরাও দাঁড়াচ্ছে। এটা একটা সমন্বয়ের ব্যর্থতা। তত্ত্বে থিয়েটার লাইন পুরো তুলে দিতে পারত (আসন বরাদ্দ করে, বা টিকিট scan করে random আসন দিয়ে), কিন্তু Southwest Airlines-এর মতো (যারা EarlyBird Check-in-এ priority আসন বেচে টাকা কামায়) নয় — থিয়েটার priority আসন না বেচে টাকা কামায়; লম্বা লাইন buzz তৈরি করে, আর অপেক্ষমাণ ক্ষুধার্ত-ক্লান্ত দর্শকের concession বিক্রি বাড়ায়। তাই লাইনের খেলা চলে ভোক্তার escalation-এ, যাতে থিয়েটার লাভবান।

উঁচু হিল: কে সবচেয়ে লম্বা? লাইন আর উঁচু হিলের যোগসূত্র দেখো। সব নারী মিলে উঁচু হিল না পরতে রাজি হতে পারত — প্রত্যেকে আরামদায়ক জুতোয়, নিজের স্বাভাবিক উচ্চতায় গর্বে হাঁটত, জুতোর খরচও বাঁচত। কিন্তু সবাই তা করলে একজনের দল থেকে সরে যাওয়ার স্বাভাবিক লোভ — কেউ ভাববে সামান্য উঁচু হিলে লম্বা ও আকর্ষণীয় দেখানো সুবিধাজনক। কয়েকজন পরা শুরু করলে অন্যদেরও পরার লোভ বাড়ে, শেষে সবাই মনে করে উঁচু হিল পরাই যুক্তিসংগত। লাইনের সঙ্গে মিল স্পষ্ট — মানুষ অপচয়ী কিছু করে কেবল কারণ অন্যরাও তা করছে। fashion designer-রা মিলে উঁচু হিল না বানাতে রাজি হতে পারত (জেনে যে এগুলো অস্বস্তিকর, হাঁটা কঠিন করে, এমনকি আঙুল-tendon-হাড়ের দীর্ঘমেয়াদি ক্ষতি করে) — কিন্তু থিয়েটারের মতো তারাও ভোক্তার সমন্বয়হীনতায় দিব্যি খুশি।

ছাত্ররা সহযোগিতা করতে পারত, কিন্তু করে না। Stanford-এ Spring Quarter-এর চমৎকার আবহাওয়ায় লেখক প্রায়ই বাইরে সাঁতার-পুলে না গিয়ে library-র ফ্লুরোসেন্ট আলোয় পড়তেন। কয়েকবার নিজেকে প্রশ্নও করেছেন — বাইরে না গিয়ে "analysis on manifolds"-এর মতো দুর্বোধ্য বিষয় পড়ছি কেন, যা কয়েক বছরে ভুলেই যাব? সহযোগিতার (collusion) দারুণ সুযোগ ছিল: তাঁর math ক্লাসে মাত্র ~৮ জন ছাত্র; সবাই মিলে একদিন বসে খুব কম পড়তে রাজি হলে, সবাই প্রায় সমান স্কোর পেত (প্রায় সমান-বুদ্ধিমান), আর উদার curve-এ কম কাজেই সবাই ~B+ পেত! কিন্তু এই পরিকল্পনা কার্যকর করা কঠিন — সবসময় কোনো type-A ব্যক্তি থাকে যে রাজি হয়েও গোপনে পড়ে curve নষ্ট করবে; একজন পড়তে চায় জানলেই বাকিদের খারাপ grade এড়াতে পড়তে হয়। লাইন আর উঁচু হিলের মতোই এখানেও যুক্তির বৃত্তাকারতা — সবাই final-এ পড়ছে কেবল কারণ সবাই জানে বাকিরাও পড়ছে। এটা ছাত্রদের জন্য "অপচয়ী" equilibrium হলেও সমাজের জন্য ইতিবাচক — অধ্যাপকরা জ্ঞান দিতে পেরে খুশি (ক্লাস না থাকলে চাকরিই যেত!), আর সমাজ শিক্ষিত মানুষ পেয়ে উপকৃত।

Table showing the similarity between waiting in line, high heels, and studying

চিত্র ২১: তিন ঘটনার কৌশলগত মিল দেখানো টেবিল। প্রতিটাই "wasteful equilibrium" — সেরা কৌশল হলো অন্যদের চেয়ে বেশি নির্মম, বেশি ধ্বংসাত্মক, বেশি অপচয়ী হওয়া (সবচেয়ে বেশিক্ষণ ক্যাম্প করা, সবচেয়ে দামি হিল, দিন-রাত পড়া)।

কীভাবে জিতবে। প্রতিটা খেলাই একটা ব্যর্থ সমন্বয়ের উদাহরণ, ফল অপচয়ী। ভয়ংকর দিক — এসব খেলায় সেরা কৌশল হলো অন্যদের চেয়ে বেশি নির্মম/অপচয়ী হওয়া (সবচেয়ে বেশিক্ষণ ক্যাম্প করা লোকই সেরা আসন পায়, সবচেয়ে দামি হিল-পরা নারীর ফ্যাশন সেরা, দিন-রাত পড়া ছাত্রই সেরা grade)। লেখক অনেক আগে বুঝেছিলেন এদের হারানোর উপায় — তাদের খেলায় তাদের হারানোর চেষ্টা কোরো না; নিজের নিয়মে নিজের খেলা খেলো। কিছু কৌশল: সিনেমা কম জনপ্রিয় হয়ে লাইন কমা পর্যন্ত অপেক্ষা করা; থিয়েটার ছেড়ে home video-র অপেক্ষা করা; fashion উপেক্ষা করে উঁচু হিল এড়ানো; নির্দিষ্ট সময় পড়ে বাকি সময় মজা করা; grade-এর জন্য নয়, জ্ঞানের জন্য শেখা। এসব কৌশল চমকপ্রদ নয়, জনসাধারণের কাছে আকর্ষণীয়ও নয় — কিন্তু এগুলো তোমাকে সময় কাজে লাগাতে দেয়, যখন অন্যরা লাইনে সময় নষ্ট করে, শরীর কষ্ট দেয়, আর মুখস্থ তথ্য ভুলে যায়। নিজের খেলা খেললে হয়তো জিতবে।

২.১৯ Jealousy — ঈর্ষা কীভাবে খেলা বদলে দেয়

এই বইয়ের বেশির ভাগ উদাহরণে ধরা হয়েছে প্রত্যেকে নিজের সর্বোত্তম ব্যক্তিগত ফল চায়, অন্যে কী পেল তাতে সত্যি মাথা ঘামায় না — অর্থাৎ সবাই absolute অর্থে বড়লোক হলে তা সবার গরিব থাকা বা একজনের সামান্য ধনী হওয়ার চেয়ে ভালো। কিন্তু এটা স্পষ্টতই সবসময় সত্য নয়, কারণ ঈর্ষা জীবনের অংশ। এই উদাহরণ দেখায় ঈর্ষা কীভাবে মানুষের খেলা বদলে দেয়। একটা সরল খেলা (কলেজ-পরীক্ষার মতো): তুমি ও আমি গোপনে "A" বা "B" খেলি — দুজনেই A = প্রত্যেকে $৪; একজন A একজন B = A-খেলোয়াড় $১, B-খেলোয়াড় $৩; দুজনেই B = প্রত্যেকে $০।

Payoff matrix of the jealousy game in absolute dollar terms

চিত্র ২২: ঈর্ষা-খেলার absolute payoff। "A" খেলা dominant strategy — দুজনেরই $৪ পাওয়া উচিত।

absolute payoff (প্রথম সংখ্যা আমার):

You: A You: B
Me: A \((4,\ 4)\) \((1,\ 3)\)
Me: B \((3,\ 1)\) \((0,\ 0)\)

খেলা বিশ্লেষণ। এটা no-brainer: "A" একটা dominant strategy, দুজনেরই $৪ পাওয়া উচিত। যাচাই: তুমি A নিলে আমি A (\(4\)) > B (\(3\)); তুমি B নিলে আমি A (\(1\)) > B (\(0\))। তাই তুমি যা-ই করো, আমার সেরা "A"; দুজনে সহজে সহযোগিতা করে $৪ পাওয়া উচিত। "B" বাছার কোনো যুক্তি নেই। অথচ অর্ধ শতাব্দী আগে (penny দিয়ে খেলা একই ধরনের এক পরীক্ষায়) গবেষকরা দেখেন — ৫০%-এর বেশি মানুষ "B" খেলল! হতে পারে তারা নিয়ম বোঝেনি, বা penny-র জন্য সিরিয়াসলি নেয়নি; কিন্তু গবেষকরা জৈবিক দৃষ্টিকোণ থেকে আরেকটা সম্ভাবনা তোলেন।

ঈর্ষার সবুজ-চোখা দানব। দুই খেলোয়াড় "A" নিলে payoff সর্বোচ্চ — এটা স্পষ্ট। কিন্তু হয়তো আমরা ভুল motivation দিয়ে ভাবছি। game theory/economics/business-এ আমরা প্রায়ই absolute অর্থে সর্বোচ্চ মুনাফার বিকল্প বাছি ($১০০-এর চেয়ে $১,০০০ ভালো)। কিন্তু মানুষ সবসময় absolute সাফল্যে ভাবে না; কখনো ভাবে relative (আপেক্ষিক) সাফল্যে — লক্ষ্য payoff সর্বোচ্চ করা নয়, বরং গবেষকদের ভাষায় "নিজের ও অন্য খেলোয়াড়ের পার্থক্য সর্বোচ্চ করা"। Michael Shermer-এর ব্লগে আরও প্রমাণ: ধরো তুমি $৫০,০০০ পাও যখন অন্যরা $২৫,০০০ পায় — নাকি তুমি $১০০,০০০ পাও যখন অন্যরা $২৫০,০০০ পায়? $১০০,০০০ ভালো মনে হওয়া উচিত (দ্বিগুণ জিনিস কেনা যায়), কিন্তু Shermer-এর মতে — চমকপ্রদভাবে, গবেষণায় বেশির ভাগ মানুষ প্রথমটা বাছে; তারা নিজে যা পেতে পারত তার অর্ধেক পেলেও অন্যদের দ্বিগুণ পেতে চায়। এখানে "আপেক্ষিক সামাজিক অবস্থান absolute আর্থিক অবস্থাকে হারিয়ে দেয়।"

relative thinking-এর ধ্বংসাত্মক রূপ। মূল matrix ছিল absolute payoff। কিন্তু মানুষ যদি relative payoff-এ ভাবে, খেলা বদলে যায়: দুজনেই A → প্রত্যেকে অন্যের চেয়ে $০ বেশি; একজন A একজন B → B-খেলোয়াড় $২ বেশি; দুজনেই B → প্রত্যেকে অন্যের চেয়ে $০ বেশি।

Payoff matrix of the jealousy game rewritten in relative terms

চিত্র ২৩: একই খেলা relative payoff-এ — "অন্যের চেয়ে কত বেশি পেলাম"। খেলাটা এখন zero-sum ও প্রতিযোগিতামূলক।

relative payoff (প্রথম সংখ্যা আমার — "অন্যের চেয়ে কত বেশি"):

You: A You: B
Me: A \((0,\ 0)\) \((-2,\ +2)\)
Me: B \((+2,\ -2)\) \((0,\ 0)\)

payoff সম্পূর্ণ বদলে গেছে। মূল খেলা ছিল non-zero-sum ও পারস্পরিক লাভজনক; এখন হঠাৎ zero-sum ও প্রতিযোগিতামূলক। কৌশলও প্রতিযোগিতামূলক — এখন "B" dominant (তুমি A নিলে আমি B-তে \(+2\) > A-তে \(0\); তুমি B নিলে B-তে \(0\) > A-তে \(-2\))। পারস্পরিক লাভের জন্য সহযোগিতার বদলে দুজনেই "খুশিমনে" কিছুই না নিয়ে ফেরে, কেবল অন্যকে এগোতে না দিতে।

টাকার ঈর্ষা ছাড়ো। এই ফল কেবল তাত্ত্বিক নয় — মানুষ সত্যিই টাকার ঈর্ষায় আনন্দে পারস্পরিক ধ্বংসের দিকে ছোটে। লেখকের ব্যক্তিগত উপমা: সাফল্য যেন সাগর থেকে গ্লাসে পানি ভরা — প্রত্যেকের অর্জনের মাপে আলাদা মাপের গ্লাস; প্রতিবেশীর গ্লাস তোমার চেয়ে বড় কিনা ভেবে লাভ নেই, কারণ পানি যথেষ্ট, সবার জন্যই আছে। বেশি চাইলে নিজে কী পারো তাতে মন দাও — সাফল্য আসবে নিজের গ্লাস গড়ে তা ভরায়, প্রতিবেশীর গ্লাস ভাঙায় নয়। ঈর্ষার সবুজ-চোখা দানবকে বিশ্রাম দেওয়ার সময় এসেছে। (এই খেলাটি লেখক The Survival Game বইয়ে পেয়েছিলেন; মূল পরীক্ষা: Minas, Scodel, Marlowe ও Rawson, Journal of Conflict Resolution, ১৯৬০।)

২.২০ উপসংহার — খেলা বদলাও

game theory কৌশলগত পরিস্থিতির অধ্যয়ন। ক্লাসরুমে এর মানে গাণিতিক খেলা বোঝা, খেলার মডেল গড়া, ও Nash equilibria সমাধান করা। ক্লাসরুমের খেলা জীবনের জটিলতা কখনো পুরো ধরতে পারবে না; তবু আশা করি এই বই দেখিয়েছে আমরা কত ঘন ঘন game theory-র মডেলের মতো পরিস্থিতিতে পড়ি, আর সেই অন্তর্দৃষ্টি দিয়ে বুঝতে পারি মানুষ কেন নির্দিষ্টভাবে আচরণ করে এবং কেন অনেক খারাপ ফল আসলে সমন্বয়ের ব্যর্থতা (coordination failure), বোকামি নয়।

কিন্তু এখানেই থামার দরকার নেই। খেলার ফল না-পসন্দ হলে নতুন খেলা খেলা শুরু করার সময় — এই ভাগটা পুরোটাই ছিল খেলা বদলে সহযোগিতা ও সবার জন্য ভালো ফল গড়ার কৌশল নিয়ে। game theory বোঝায়, আমরা সমাজের ওপর একনায়কের মতো পরিবর্তন চাপাতে পারি না — নিয়ম-বদলে প্রত্যেকের সাড়া দেওয়ার micro-motive থেকে অপ্রত্যাশিত macro-আচরণ জন্ম নেয়। আর আমাদের সবসময় সতর্ক থাকতে হবে ঈর্ষা ও escalation-এর খেলার ভূমিকা নিয়ে, যা মানুষকে ধ্বংসাত্মক বা অপচয়ীভাবে শ্রম ঢালতে প্রলুব্ধ করে — জীবনে কত সময় তুমি কেবল লাইনে দাঁড়িয়ে নষ্ট করেছ, ভাবো তো? আশা করি game theory বোঝা তোমাকে জীবনের কৌশলগত পরিস্থিতিগুলো বুঝতে ও মোকাবিলা করতে সাহায্য করবে। অবশ্যই এই বই কেবল একটা ভূমিকা — game theory-তে আরও জটিল বিষয় আছে (repeated games, fair division, voting theory, auction theory, computational game theory), যেগুলোর কিছু আমরা পরের অধ্যায়গুলোয় (Bonanno-র আনুষ্ঠানিক তত্ত্ব থেকে) দেখব।


৩. মূল সংজ্ঞা ও যুক্তি

এবার গল্পগুলোর পেছনের আনুষ্ঠানিক ধারণাগুলো একটু গুছিয়ে নিই।

৩.১ Commitment ও credible threat

commitment (অঙ্গীকার) হলো এমন একটা পদক্ষেপ যা তোমার ভবিষ্যৎ পছন্দ সীমিত করে দেয়, যাতে প্রতিপক্ষ নিশ্চিত হয় তুমি কী করবে। মজার প্যারাডক্স: কম বিকল্প = বেশি শক্তি। lighthouse পথ বদলাতে পারে না, তাই chicken জেতে; steering wheel ফেলে দেওয়া চালক সরতে পারে না, তাই অন্যজন সরে; Cortés নিজের জাহাজ পুড়িয়ে দেন, তাই সৈন্যদের পিছু হটার পথ নেই — মরিয়া হয়ে লড়াই ছাড়া উপায় নেই।

একটা threat (হুমকি) credible তখনই, যখন হুমকি কার্যকর করাটা সত্যিই তোমার best response — অর্থাৎ যে পরিস্থিতিতে হুমকি দিচ্ছ, সেখানে পৌঁছালে হুমকি পালনই তোমার পক্ষে লাভজনক (বা অন্তত ক্ষতিহীন)। এই কারণেই —

  • বাবা-মায়ের "ঘর থেকে বের করে দেব" non-credible: বের করে দেওয়া তাদের best response নয়।
  • MAD-এ পাল্টা আক্রমণ credible কি না তা timing, payoff, second-strike capability ও commitment-এর ওপর নির্ভর করে; simultaneous matrix-এর destructive equilibrium একাই যথেষ্ট নয়।

commitment হুমকিকে credible করে, কারণ তা নিজের হাত থেকে "নরম হওয়ার" বিকল্প কেড়ে নেয়।

৩.২ Backward induction ও subgame-perfect equilibrium

backward induction (পশ্চাৎ-অনুমান) হলো sequential খেলা সমাধানের পদ্ধতি: game tree-র শেষ (নিচ) থেকে শুরু করে উপরে ওঠো। প্রতিটা শেষ-মুহূর্তের খেলোয়াড় সেখানে তার best response বাছবে ধরে নিয়ে, তার আগের খেলোয়াড় সেটা অনুমান করে নিজের best response বাছে — এভাবে root পর্যন্ত।

Kid figure: ultimatum game tree solved by backward induction

চিত্র ২৪: (নিজের আঁকা) ultimatum game-এ backward induction। নিচে P2-এর সিদ্ধান্ত: যেকোনো ধনাত্মক offer-এ accept (\(0.01 > 0\)), reject করলে \(0\)। তাই P2 সব offer accept করবে। এটা জেনে উপরে P1 সবচেয়ে ছোট offer ($0.01) দেয়, নিজে $9.99 রাখে। কমলা পথটাই subgame-perfect equilibrium: \((\$9.99,\ \$0.01)\)

যে strategy profile প্রতিটি subgame-এ একটি Nash equilibrium induce করে, তাকে subgame-perfect equilibrium (উপ-খেলা নিখুঁত ভারসাম্য) বলে। Ultimatum game-এ প্রতিটি offer-এর পরের node একটি subgame। Money-only preference ও ১-সেন্ট minimum offer থাকলে P2 প্রতিটি positive offer accept করে; P1 তাই এক সেন্ট দেয় এবং $9.99 রাখে। এই model-এ এটিই একমাত্র subgame-perfect equilibrium।

Nash বনাম subgame-perfect। Finite cent-grid model-এ একাধিক Nash equilibrium আছে। যেমন P2-এর strategy যদি $5-এর কম reject এবং $5 বা বেশি accept হয়, তবে P1-এর $5 offer-সহ profile একটি Nash equilibrium হতে পারে। কিন্তু $0.01–$4.99 offer-এর subgame-এ reject করা P2-এর money-only payoff maximize করে না, তাই এটি subgame-perfect নয়। P1 threat-টি বিশ্বাস করলেই credibility তৈরি হয় না। Fairness preference, repeated interaction বা enforceable commitment যোগ করলে rejection সত্যিই optimal হতে পারে—সেক্ষেত্রে payoff/game বদলেছে। Continuous-offer model-এ continuum of Nash equilibria থাকতে পারে; ১-সেন্ট finite grid-এ সংখ্যা finite।

৩.৩ Braess paradox-এর ব্যাখ্যা

Braess paradox দেখায় ব্যক্তিগত optimization ও সামাজিক optimum আলাদা। রাস্তা যোগ করা মানে প্রতিটা চালকের বিকল্প বাড়ানো — কিন্তু নতুন "free" রাস্তা প্রত্যেকের জন্য একটা dominant strategy তৈরি করে (সরু-দ্রুত অংশ দিয়ে যাওয়া), যা সবাই একসাথে নিলে সব সরু রাস্তা জ্যাম হয়। equilibrium-এ কেউ একা পথ বদলে লাভ করতে পারে না (\(80\)-এর জায়গায় বিকল্প পথ \(90\) মিনিট), তবু সম্মিলিতভাবে সবাই "free" রাস্তা এড়ালে \(70\) মিনিটে যেত। এটা সম্ভব নয় কারণ প্রত্যেকের cheat করার (সময় বাঁচানোর) incentive আছে — এটা Prisoner's Dilemma-র ট্রাফিক-সংস্করণ। শিক্ষা: কখনো বিকল্প সীমিত করা (রাস্তা বন্ধ) সামাজিকভাবে ভালো, আর সমন্বয়ের জন্য social planning দরকার।

৩.৪ Added value ও withholding supply

একজন player-এর added value = (সে থাকলে total value) − (সে না থাকলে total value)। এটি marginal indispensability মাপে, payoff allocation নয়। ২৬–২৬ card game-এ symmetric bargaining benchmark $50–$50 split দেয়। একটি black card সরালে প্রতিটি student-এর added value \(0\) হয়; competitive undercutting protocol-এ Adam প্রায় সব surplus capture করতে পারে। তাই withholding supply bargaining leverage বদলাতে পারে, তবে result bargaining rules-এর ওপর নির্ভর করে।

৩.৫ Signaling ও market unraveling

যখন এক পক্ষ অন্যের চেয়ে বেশি জানে (asymmetric information), বাজার unravel করতে পারে: ক্রেতা গড় মানের ভিত্তিতে দাম দেয় → ভালো পণ্যের বিক্রেতা সরে যায় → গড় মান নামে → দাম আরও নামে → ... → কেবল সবচেয়ে বাজে পণ্য (lemon) টিকে থাকে, বা বাজার পুরো বন্ধ। এটা ঠেকায় signal (সংকেত) — এমন action/গুণ যা belief বদলায় এবং সহজে জাল করা যায় না (warranty, verified history, সুনাম, degree)। জাল-না-হওয়া signal-ই বাজারকে টিকিয়ে রাখে।

চার ধরনের 'খেলা বদলানো' এক নজরে

  • ক্রম বদলানো: sequential → simultaneous (leader's dilemma, principle of embarrassment উল্টো দিকে)।
  • বিকল্প কমানো: commitment, burning bridges, lighthouse, special meal, professors' rules।
  • জোগান/তথ্য নিয়ন্ত্রণ: withholding supply (added value), signaling (asymmetric information ঠেকানো)।
  • payoff বদলানো: incentive যোগ করা (tissue scheme), regulation (loudness), individual responsibility (office phone)।

৪. উদাহরণ ও Analogy (সংখ্যাসহ)

৪.১ Ultimatum split — সংখ্যায়

$10 ভাগের খেলা, offer ১ সেন্ট ধাপে। P2 reject করলে $0। Money-only subgame-perfect solution: P1 offer করে $0.01, নিজে রাখে $9.99; P2 accept করে। এখন যদি P2 commit করতে পারে যে $5-এর কম offer স্বয়ংক্রিয়ভাবে reject হবে, অথবা তার fairness-inclusive utility-তে এমন rejection optimal হয়, P1 $5 offer করবে। এটি শুধু belief পরিবর্তন নয়: commitment feasible strategy বদলেছে, আর fairness preference payoff বদলেছে। Commitment ছাড়া একই money-only game-এ $5 threshold একটি non-credible off-path threat; তা Nash equilibrium support করতে পারলেও subgame-perfect নয়।

৪.২ Dollar auction escalation — সংখ্যায়

$1 নিলাম, ৫ সেন্ট ধাপ, দ্বিতীয়-সর্বোচ্চও bid হারায়। ধরো এখন সর্বোচ্চ bid $1.50 (bidder A), দ্বিতীয় $1.45 (bidder B):

  • B চুপ থাকলে: হারায় $1.45 (কিছু পায় না)।
  • B $1.55 bid করে জিতলে: $1 ফেরত পায়, নিট হারায় \(1.55 − \$1.00 = \$0.55\)

$0.55 হারানো $1.45 হারানোর চেয়ে ভালো — তাই B আবার bid করে। এই যুক্তি সর্বদা দ্বিতীয় bidder-কে টানে, তাই bid $1 ছাড়িয়ে অসীম উঠতে পারে (চিত্র ২০)। প্রকৃত উপায়: খেলো না, বা ঢুকলে দ্রুত বেরোও।

৪.৩ Braess — সংখ্যায়

  • রাস্তা ছাড়া: equilibrium \(A = B = 500\); প্রতি পথ \(= 500/25 + 50 = 20 + 50 = 70\) মিনিট।
  • "free" A-B রাস্তাসহ: সবাই start-A-B-end; সময় \(= 1000/25 + 0 + 1000/25 = 40 + 0 + 40 = 80\) মিনিট।
  • বিকল্প পথ start-A-end বা start-B-end এখন \(= 40 + 50 = 90\) মিনিট, তাই কেউ সরে না — \(80\) মিনিটই Nash equilibrium, যদিও \(70\) সম্ভব ছিল।

৪.৪ Card game — added value সংখ্যায়

  • ২৬ red, ২৬ black: Adam-এর added value \(=26\times100=2600\); প্রতি student-এর \(=100\)। Symmetric Nash-bargaining benchmark-এ প্রতি pair $50–$50, কিন্তু added value একা এই division force করে না।
  • ২৫ black: Adam-এর added value \(=2500\); প্রতি student-এর \(=0\)। Bertrand-style undercutting ধরলে Adam-এর share \(\approx2500\) হতে পারে; protocol না দিলে exact division indeterminate।

Analogy সংক্ষেপে

  • ultimatum = ভাগের ক্ষমতা: যে "না" বলতে পারে বিশ্বাসযোগ্যভাবে, শক্তি তার।
  • dollar auction = sunk cost ফাঁদ: ইতিমধ্যে হারানো টাকা "উদ্ধার" করতে গিয়ে আরও হারানো।
  • Braess = সবার শর্টকাট, সবার দেরি: ব্যক্তিগত চালাকি সম্মিলিত বোকামি।
  • withholding supply = কৃত্রিম দুর্লভতা: কম দিয়ে বেশি দাম।

৫. Python-এ করো

নিচে numpy দিয়ে তিনটা মূল ধারণা simulate করি: ultimatum game-এর backward induction, dollar auction-এর escalation, আর Braess paradox-এর equilibrium।

(ক) Ultimatum game — backward induction ও exogenous threshold-এর প্রভাব।

import numpy as np

# $10 ভাগের খেলা, ১ সেন্ট ধাপ; reject করলে দুজনেই $0
pot_cents = 1000                      # $10 = 1000 সেন্ট
offers = np.arange(1, pot_cents + 1)  # P1 P2-কে দিতে পারে 1..1000 সেন্ট

def p2_accepts(offer_cents, threshold_cents):
    # P2 accept করে যদি offer তার ন্যূনতম দাবি (threshold) মেটায়
    return offer_cents >= threshold_cents

def best_offer_for_p1(threshold_cents):
    # P1 চায় নিজের ভাগ সর্বোচ্চ (pot - offer), শর্ত: P2 accept করবে
    accepted = offers[offers >= threshold_cents]   # যেসব offer accept হবে
    if len(accepted) == 0:
        return None, 0, 0                          # কোনো offer কাজ করে না
    best = accepted.min()                          # সবচেয়ে ছোট গ্রহণযোগ্য offer
    return best, pot_cents - best, best            # (offer, P1-ভাগ, P2-ভাগ)

# ক্ষেত্র ১: সম্পূর্ণ যুক্তিবাদী P2 -> threshold = 1 সেন্ট (subgame-perfect)
o, p1, p2 = best_offer_for_p1(threshold_cents=1)
print(f"যুক্তিবাদী P2 : P1 offer {o}c -> P1 রাখে {p1}c, P2 পায় {p2}c")

# ক্ষেত্র ২: committed/fairness-threshold P2 -> $5 (500c)-এর কম হলে reject
o, p1, p2 = best_offer_for_p1(threshold_cents=500)
print(f"threshold P2 : P1 offer {o}c -> P1 রাখে {p1}c, P2 পায় {p2}c")
# আউটপুট:
# যুক্তিবাদী P2 : P1 offer 1c -> P1 রাখে 999c, P2 পায় 1c
# threshold P2 : P1 offer 500c -> P1 রাখে 500c, P2 পায় 500c

এই code threshold-টিকে exogenous acceptance rule হিসেবে ধরে; এটি নিজে threshold-এর credibility prove করে না। Money-only game-এ threshold \(1\) subgame-perfect behavior দেখায়। Threshold \(500\) বোঝাতে commitment বা fairness-inclusive utility আলাদাভাবে model করতে হবে।

(খ) Dollar auction — escalation simulate।

import numpy as np

prize = 100          # $1.00 = 100 সেন্ট পুরস্কার
step  = 5            # প্রতি bid ৫ সেন্ট বাড়ে

# দুই bidder পালা করে bid বাড়ায় যতক্ষণ দ্বিতীয়-সর্বোচ্চ bidder লাভবান/ক্ষতি-কমানোর সুযোগ পায়
high = 0             # বর্তমান সর্বোচ্চ bid
history = []
for _ in range(40):
    challenger_bid = high + step          # দ্বিতীয় bidder নতুন bid দেয়
    # দ্বিতীয় bidder চুপ থাকলে হারায় (high - step); bid করলে জিতলে নিট = challenger_bid - prize
    loss_if_quit = high - step            # আগের bid হেরে হারানো
    loss_if_bid  = challenger_bid - prize # bid করে জিতলে নিট ক্ষতি (ঋণাত্মক হলে লাভ)
    if loss_if_bid < loss_if_quit:        # bid করা কম-ক্ষতি হলে চালিয়ে যায়
        high = challenger_bid
        history.append(high)
    else:
        break

print("bid escalation (সেন্ট):", history[:12], "...")
print(f"শেষ সর্বোচ্চ bid = {high}c, অর্থাৎ ${high/100:.2f} — $1 পুরস্কারের বহু গুণ!")
# bid $1 (100c) সহজেই ছাড়িয়ে যায়: দ্বিতীয় bidder সবসময় বাড়াতে চায়।

(গ) Braess paradox — দুই equilibrium।

import numpy as np

N = 1000                       # মোট চালক
# রাস্তা ছাড়া: A জন start-A-end, (N-A) জন start-B-end
# start-A-end = A/25 + 50 ; start-B-end = 50 + (N-A)/25
# equilibrium: দুই পথ সমান সময়
A = np.arange(0, N + 1)
tA = A / 25 + 50               # start-A-end সময়
tB = 50 + (N - A) / 25         # start-B-end সময়
eq = A[np.argmin(np.abs(tA - tB))]      # যেখানে দুই সময় সবচেয়ে কাছাকাছি
print(f"রাস্তা ছাড়া equilibrium: A={eq}, B={N-eq}, সময় = {eq/25 + 50:.0f} মিনিট")

# 'free' A-B রাস্তাসহ: সবাই start-A + (A-B free) + B-end = N/25 + 0 + N/25
t_with_road = N / 25 + 0 + N / 25
print(f"free রাস্তাসহ (সবাই S-A-B-E): সময় = {t_with_road:.0f} মিনিট")
# আউটপুট:
# রাস্তা ছাড়া equilibrium: A=500, B=500, সময় = 70 মিনিট
# free রাস্তাসহ (সবাই S-A-B-E): সময় = 80 মিনিট  <- রাস্তা যোগ করেও ধীর!

তিনটি simulation তিনটি আলাদা mechanism দেখায়: ultimatum-এ imposed threshold P1-এর offer বদলায়, dollar auction-এ escalation চলতে পারে, আর Braess network-এ রাস্তা যোগ করেও equilibrium travel time বাড়তে পারে।


৬. সাধারণ ভুল (Common mistakes)

  1. non-credible threat-কে credible ভাবা। "৯০% না দিলে reject করব" — যুক্তিবাদী, টাকা-লোভী খেলোয়াড়ের কাছে এটা ফাঁপা, কারণ reject করলে সে $0 পায়। threat তখনই ধরো, যখন তা পালন করা সত্যিই best response।
  2. backward induction উপর থেকে করা। sequential খেলা সমাধান করতে হয় নিচ থেকে উপরে, শেষ চাল থেকে শুরু করে। উপর থেকে "প্রথমে কে কী করবে" ভাবলে ভুল হয়।
  3. Nash equilibrium, belief ও subgame perfection গুলিয়ে ফেলা। ১-সেন্ট finite grid-এ বহু কিন্তু finite Nash equilibrium থাকতে পারে; continuous-offer version-এ continuum হতে পারে। Off-path rejection strategy Nash equilibrium support করলেও প্রতিটি subgame-এ optimal না হলে তা subgame-perfect নয়। বাস্তব rejection fairness preference বা অন্য payoff নির্দেশ করতে পারে; belief একা threat credible করে না।
  4. "বেশি বিকল্প = বেশি শক্তি" ধরে নেওয়া। commitment-এর সারকথা উল্টো — বিকল্প কমানোই (lighthouse, steering wheel ফেলা, Cortés-এর জাহাজ পোড়ানো) হুমকি credible করে। এটা না বুঝলে chicken/negotiation-এর কৌশল ভুল হয়।
  5. Braess paradox-কে "যোগ করা ভালো/খারাপ" নিয়মে গোলানো। রাস্তা যোগ সবসময় খারাপ নয়; প্যারাডক্স হলো এটা হতে পারে খারাপ, কারণ ব্যক্তিগত incentive সামাজিক optimum-এর সঙ্গে সংঘর্ষে যায়। মূল বিষয় Nash equilibrium বনাম সামাজিক optimum।
  6. MAD-এর simultaneous matrix থেকে sequential credibility ধরে নেওয়া। Destructive equilibrium একটি warning, কিন্তু retaliation credible করতে second-strike capability ও commitment দরকার। Timing ও payoff না দেখে causal conclusion টানা যাবে না।
  7. dollar auction-এ sunk cost অনুসরণ করা। ইতিমধ্যে দেওয়া bid "উদ্ধার" করতে আরও bid করা ফাঁদ। সিদ্ধান্তে কেবল ভবিষ্যৎ (marginal) লাভ-ক্ষতি ধরো, ডুবে যাওয়া খরচ নয়।
  8. added value থেকে payoff সরাসরি infer করা। Added value marginal contribution মাপে; exact division-এর জন্য bargaining protocol বা solution concept দরকার। $50–$50 হলো symmetric benchmark, automatic theorem নয়।
  9. relative আর absolute payoff গুলিয়ে ফেলা। absolute-এ dominant "A", relative-এ dominant "B" — একই খেলা, ভিন্ন motivation, বিপরীত ফল। ঈর্ষা matrix-কে zero-sum করে দেয়।

৭. এক্সারসাইজ (Exercises)

  1. (সহজ) নিজের ভাষায় বলো credible threat আর non-credible threat-এর পার্থক্য, প্রতিটার একটা করে নতুন উদাহরণ দাও (বই থেকে নয়)।
  2. (সহজ) ultimatum game-এ $20 ভাগ হচ্ছে, ১ সেন্ট ধাপ। সম্পূর্ণ যুক্তিবাদী P2-এর জন্য subgame perfect equilibrium কী? P1 ও P2 কত পায়?
  3. (সহজ) MAD-এর payoff matrix (\(-1\) শান্তি, \(-N\) ধ্বংস) থেকে দুটো Nash equilibrium চিহ্নিত করো এবং দেখাও (back off, strike) কেন equilibrium নয়।
  4. (মাঝারি) Braess নেটওয়ার্কে চালক-সংখ্যা \(1000\)-এর বদলে \(500\) ধরো (সব সময়ের সূত্র একই)। (ক) রাস্তা ছাড়া equilibrium সময় বের করো। (খ) "free" A-B রাস্তাসহ সবাই start-A-B-end নিলে সময় বের করো। প্যারাডক্স কি এখনো টেকে?
  5. (মাঝারি) dollar auction-এ সর্বোচ্চ bid এখন $0.95, দ্বিতীয় bidder $0.90-এ। ধাপ ৫ সেন্ট। দ্বিতীয় bidder চুপ থাকলে বনাম $1.00 bid করলে তার নিট ফল সংখ্যায় তুলনা করো। সে কী করবে?
  6. (মাঝারি) leader's dilemma-র sequential game tree-তে backward induction চালাও এবং দেখাও ফল \((1,1)\)। কেন \((2,2)\) [\(H,M\)] enforce করা যায় না, ব্যাখ্যা করো।
  7. (মাঝারি-কঠিন) card game-এ ২৬ ছাত্র, কিন্তু Adam দুটো কালো কার্ড পোড়ায় (২৪ কালো থাকে)। প্রতি ছাত্রের ও Adam-এর added value বের করো। এতে Adam-এর দর কষাকষির শক্তি ২৫-কালো ক্ষেত্রের তুলনায় বাড়ে না কমে — যুক্তি দাও।
  8. (কঠিন) ঈর্ষা-খেলায় absolute payoff একই রাখো, কিন্তু ধরো একজন খেলোয়াড় অর্ধেক ওজন relative আর অর্ধেক absolute-এ দেয় (অর্থাৎ তার কার্যকর payoff = absolute + ০.৫ × নিজের-ও-অন্যের পার্থক্য)। তার জন্য "A" নাকি "B" dominant — হিসাব করে দেখাও, এবং ব্যাখ্যা করো কেন সামান্য ঈর্ষাও ফল বদলে দিতে পারে।
  9. (কঠিন) Condorcet-এর তিন-ভোটার উদাহরণে ভোটার ৩-এর পছন্দ বদলে \(C > B > A\) করো (বাকি দুই অপরিবর্তিত)। এখন কি এখনো voting cycle থাকে, নাকি কোনো Condorcet winner (যে সবার সঙ্গে জোড়ায় জেতে) আছে? দেখাও।

৮. সমাধান (ব্যাখ্যাসহ)

১-নং সমাধান দেখাও

credible threat = যেটা পালন করা তোমার নিজের best response, তাই প্রতিপক্ষ বিশ্বাস করে। উদাহরণ: bank ঋণের কিস্তি না দিলে জামানত বাজেয়াপ্ত করবে — bank সত্যিই করে, তাই credible।

non-credible threat = পালন করা তোমার নিজেরই ক্ষতি, তাই বুদ্ধিমান প্রতিপক্ষ বিশ্বাস করে না। উদাহরণ: বন্ধু বলল "একবার দেরি করলে আর কখনো তোমার সঙ্গে কথা বলব না" — কথা বন্ধ করলে তারও ক্ষতি, তাই ফাঁপা। (মূল যুক্তি: threat credible কেবল যদি তা পালন করা best response হয়।)

২-নং সমাধান দেখাও

reject করলে P2 পায় $0; যেকোনো ধনাত্মক offer ($0.01) সেটার চেয়ে ভালো, তাই সম্পূর্ণ যুক্তিবাদী P2 যেকোনো offer accept করে। backward induction: P1 এটা জেনে ন্যূনতম offer দেয়।

তাই subgame perfect equilibrium: P1 offer করে $0.01, P2 accept করে। P1 পায় $19.99, P2 পায় $0.01। (pot বড় হলেও যুক্তি একই — total negotiating power P1-এর।)

৩-নং সমাধান দেখাও

matrix (US, Soviet), \(-1\) শান্তি, \(-N\) ধ্বংস (\(N\) বিশাল):

Soviet: back off Soviet: strike
US: back off \((-1,\ -1)\) \((-N,\ -N)\)
US: strike \((-N,\ -N)\) \((-N,\ -N)\)

(back off, back off): US-এর জবাব — Soviet back off করছে, তাই US back off (\(-1\)) > strike (\(-N\))। Soviet-এরও একই। দুজনেই best response → equilibrium

(strike, strike): Soviet strike করছে, US strike করলে \(-N\), back off করলেও \(-N\) — সমান, তাই strike একটা best response। উল্টোটাও। দুজনেই best response → equilibrium

(back off, strike): Soviet strike করছে ধরে US-এর best response strike/back off (দুটোই \(-N\)) — ঠিক আছে। কিন্তু US back off করছে ধরে Soviet-এর best response back off (\(-1\) > \(-N\)), strike নয়। তাই Soviet best response দিচ্ছে না → equilibrium নয়

৪-নং সমাধান দেখাও

(ক) রাস্তা ছাড়া, \(N = 500\): equilibrium-এ দুই পথ সমান সময়, symmetry-তে \(A = B = 250\)। সময় \(= A/25 + 50 = 250/25 + 50 = 10 + 50 = 60\) মিনিট।

(খ) "free" রাস্তাসহ: সবাই start-A-B-end, সময় \(= 500/25 + 0 + 500/25 = 20 + 0 + 20 = 40\) মিনিট।

এখানে "free" রাস্তাসহ (\(40\)) আসলে রাস্তা-ছাড়ার (\(60\)) চেয়ে ভালো! কারণ \(N\) ছোট হওয়ায় সরু রাস্তা কম জ্যাম। Braess paradox তখনই দেখা দেয় যখন ভিড় যথেষ্ট বেশি (এখানে \(N=1000\)-এ \(80 > 70\))। শিক্ষা: প্যারাডক্স congestion-নির্ভর, সবসময় ঘটে না — এটাই সূক্ষ্ম দিক।

৫-নং সমাধান দেখাও

সর্বোচ্চ bid $0.95, দ্বিতীয় bidder $0.90-এ।

  • চুপ থাকলে: সে দ্বিতীয়-সর্বোচ্চ, তাই তার $0.90 bid হারে, কিছু পায় না → নিট \(-\$0.90\)
  • $1.00 bid করে জিতলে: $1 পুরস্কার পায়, $1.00 দেয় → নিট \(\$1.00 - \$1.00 = \$0\)

\(0\) > \(-\$0.90\), তাই সে $1.00 bid করবে। (এমনকি ঠিক ভাঙা-সমান হলেও সে bid করে ক্ষতি এড়ায়, আর এরপরই bid $1 ছাড়িয়ে যেতে থাকে — escalation শুরু।)

৬-নং সমাধান দেখাও

payoff (leader, follower): \(L,M \to (1,1)\); \(L,I \to (2,0)\); \(H,M \to (2,2)\); \(H,I \to (0,4)\)

backward induction (follower-এর জবাব):

  • leader \(L\) দিলে follower: match (\(1\)) vs imitate (\(0\)) → match, leader পায় \(1\)
  • leader \(H\) দিলে follower: match (\(2\)) vs imitate (\(4\)) → imitate, leader পায় \(0\)

leader-এর পছন্দ: \(L \to 1\) vs \(H \to 0\)\(L\), ফল \((1,1)\)

\((2,2)\) কেন enforce হয় না: \((2,2)\) আসে \(H,M\)-এ। কিন্তু leader \(H\) দিলে follower-এর best response match (\(2\)) নয়, imitate (\(4\)) — follower পুরো বাজার নেবে, leader পাবে \(0\)। follower-এর imitate করার incentive থাকায় \(H,M\) চুক্তি টেকে না; enforce করার কোনো উপায় নেই। এটাই leader's dilemma।

৭-নং সমাধান দেখাও

২৬ লাল, ২৪ কালো (২টা পোড়ানো)। জোড়া সর্বোচ্চ \(24\), মোট পুরস্কার \(24 \times 100 = 2400\)

  • Adam-এর added value: Adam না থাকলে কোনো কালো কার্ড নেই → \(0\) পুরস্কার। তাই added value \(= 2400\)
  • প্রতি ছাত্রের added value: ২৬ লাল, ২৪ কালো — দুটো লাল কার্ড উদ্বৃত্ত। যেকোনো একজন ছাত্র সরে গেলেও এখনো ২৫ লাল ≥ ২৪ কালো, মোট পুরস্কার \(2400\) অপরিবর্তিত। তাই প্রতি ছাত্রের added value \(= 0\)

২৫-কালো ক্ষেত্রেও প্রতি ছাত্রের added value ছিল \(0\); এখানেও \(0\)। তাই Adam-এর আপেক্ষিক দর কষাকষির শক্তি সমানভাবে প্রবল (ছাত্ররা এখনো "বাদ পড়ার" ভয়ে দাম নামায়)। তবে মোট আহরণযোগ্য মূল্য কমে গেছে (\(2500 \to 2400\)) — বেশি কার্ড পোড়ানো নিজের ভাগও কিছুটা কমায়। অর্থাৎ scarcity তৈরির শক্তি এক কার্ড পোড়াতেই এসে যায়; দুই কার্ড পোড়ানো বাড়তি শক্তি না দিয়ে শুধু মোট pot কমায়।

৮-নং সমাধান দেখাও

absolute payoff: both A → \(4\); A vs B → A পায় \(1\), B পায় \(3\); both B → \(0\)। কার্যকর payoff \(= \text{absolute} + 0.5 \times (\text{own} - \text{other})\) (অর্থাৎ নিজের ও অন্যের পার্থক্য)।

ধরি আমার সিদ্ধান্ত, প্রতিপক্ষের চালের বিপরীতে —

  • প্রতিপক্ষ A: আমি A → absolute \(4\), পার্থক্য \(0\)\(4 + 0 = 4\)। আমি B → absolute \(3\), পার্থক্য \(3-1=2\)\(3 + 0.5(2) = 4\)সমান (৪ = ৪) — dominance ভাঙার কিনারায়।
  • প্রতিপক্ষ B: আমি A → absolute \(1\), পার্থক্য \(1-3=-2\)\(1 + 0.5(-2) = 0\)। আমি B → absolute \(0\), পার্থক্য \(0\)\(0\)সমান (০ = ০)

ঠিক \(0.5\) ওজনে দুই পক্ষ উদাসীন (indifferent) — এটাই সেই সন্ধিক্ষণ। ওজন সামান্য বাড়ালে (\(> 0.5\)) "B" কঠোরভাবে dominant হয়ে যায় (যেমন full-relative ক্ষেত্রে), সামান্য কমালে "A" dominant থাকে। এই কারণেই অল্প ঈর্ষাও cooperative "A"-কে ভেঙে destructive "B"-তে ঠেলে দিতে পারে — সন্ধিক্ষণটা খুব ভঙ্গুর।

৯-নং সমাধান দেখাও

নতুন পছন্দ:

  • Voter 1: \(A > B > C\)
  • Voter 2: \(B > C > A\)
  • Voter 3: \(C > B > A\) (বদলানো)

জোড়ায় majority:

  • A vs B: B-কে এগিয়ে রাখে Voter 2, 3 (দুজন) — B জেতে
  • B vs C: B-কে এগিয়ে রাখে Voter 1, 2 — B জেতে
  • A vs C: C-কে এগিয়ে রাখে Voter 2, 3 — C জেতে (A হারে)।

এখন B সবার সঙ্গে জোড়ায় জেতে (A ও C উভয়কে) — B হলো Condorcet winner, কোনো cycle নেই। শিক্ষা: cycle সবসময় হয় না; ভোটারদের পছন্দ যথেষ্ট "সারিবদ্ধ" (single-peaked-এর মতো) হলে একটা স্থিতিশীল majority winner থাকতে পারে। Condorcet-এর মূল উদাহরণে পছন্দগুলো ছিল চক্রাকার, তাই paradox দেখা দিয়েছিল।


৯. সারসংক্ষেপ ও Checklist

এই অধ্যায়ে "খেলা বদলানো"-র পুরো হাতিয়ার-বাক্স এক জায়গায়:

  • মূল সুর: খারাপ ফল = খেলার কাঠামোর দোষ, খেলোয়াড়ের নয়। রাগ নয়, খেলা বদলাও
  • credible vs non-credible threat: হুমকি credible কেবল যদি তা পালন করা তোমার best response; commitment (বিকল্প কমানো) হুমকিকে credible করে।
  • game of chicken: immovable হও (lighthouse), toughness-এর reputation, go for broke, brinkmanship।
  • ultimatum game: ১-সেন্ট money-only model-এ backward induction → P1 $9.99, P2 $0.01; finite grid-এ অন্য Nash equilibrium থাকতে পারে, কিন্তু non-credible off-path threat-যুক্তগুলো subgame-perfect নয়।
  • MAD ও gossip war: destructive equilibrium সম্ভাব্য ঝুঁকি দেখায়; বাস্তব retaliation-এর credibility timing, payoff, second-strike capability ও commitment দিয়ে verify করতে হয়। ছোট escalation-retaliation-এ back off কখন optimal, সেটিও payoff-এর ওপর নির্ভর করে।
  • limiting options: airline food, professors' rules, burning bridges (Cortés) — কম বিকল্প = বেশি শক্তি।
  • withholding supply ও added value: supply কমালে opponent-এর marginal contribution \(0\) হতে পারে; competitive bargaining-এ এতে surplus share বদলায়, তবে exact ফল protocol-dependent।
  • Braess paradox: রাস্তা যোগ করলেও (congestion বেশি হলে) সবার দেরি বাড়তে পারে — Nash equilibrium ≠ সামাজিক optimum।
  • leader's dilemma: sequential → simultaneous (mixed strategy) বদলে গড় payoff বাড়ানো।
  • market unraveling ও signaling: asymmetric information বাজার ভাঙে; জাল-না-হওয়া signal তা ঠেকায়।
  • smart pill / voting paradox / dollar auction / jealousy: dominant-strategy ফাঁদ, Condorcet cycle ও Arrow, sunk-cost escalation, আর relative thinking কীভাবে খেলাকে zero-sum করে।

Checklist — নিজেকে যাচাই করো:

  • [ ] credible ও non-credible threat আলাদা করতে পারি এবং commitment কীভাবে হুমকি credible করে বলতে পারি।
  • [ ] একটা sequential খেলায় backward induction চালিয়ে subgame perfect equilibrium বের করতে পারি।
  • [ ] ultimatum game-এর money-only subgame-perfect equilibrium এবং fairness/commitment যোগ করলে model কীভাবে বদলায় ব্যাখ্যা করতে পারি।
  • [ ] MAD-এর simultaneous payoff matrix-এর equilibrium আর sequential retaliation-এর credibility আলাদা করে analyze করতে পারি।
  • [ ] "limiting options = বেশি শক্তি" প্যারাডক্স উদাহরণসহ বোঝাতে পারি।
  • [ ] added value হিসাব করে withholding supply-এর কৌশল ব্যাখ্যা করতে পারি।
  • [ ] Braess paradox-এ দুই equilibrium সময় (\(70\) vs \(80\)) হিসাব করতে পারি এবং কেন এটা congestion-নির্ভর বলতে পারি।
  • [ ] dollar auction-এ দ্বিতীয় bidder কেন সবসময় bid বাড়ায় সংখ্যায় দেখাতে পারি।
  • [ ] absolute vs relative payoff-এ dominant strategy কীভাবে উল্টে যায় (A → B) তা matrix দিয়ে দেখাতে পারি।

➡️ পরের অধ্যায়: 10.4 — Introduction (Bonanno) — এবার Talwalkar-এর গল্প থেকে Bonanno-র আনুষ্ঠানিক তত্ত্বে। Part 10 সূচি