
1. 从“田忌赛马”到现代博弈对策论是什么如果你玩过石头剪刀布或者在商业谈判中思考过如何出价甚至在游戏中琢磨过对手的策略那么你已经不自觉地运用了对策论的思想。对策论也叫博弈论它研究的核心就是在互动决策中当你的结果不仅取决于自己的选择也取决于他人的选择时如何做出最优决策。这听起来有点绕但一个流传千年的中国故事——“田忌赛马”就是对它最生动的诠释。田忌与齐王赛马双方各有上、中、下三等马。如果硬碰硬田忌必输。但孙膑给出的策略是用下等马对齐王的上等马输用上等马对齐王的中等马赢用中等马对齐王的下等马赢。最终田忌以三局两胜赢得比赛。这个故事完美展示了对策论的几个关键要素参与者田忌、齐王、策略马的出场顺序、收益比赛的胜负。田忌的胜利并非因为他的马更好而是因为他选择了一个针对齐王可能策略的、更优的策略组合。所以对策论绝不仅仅是数学课本里的抽象公式它是理解商业竞争、政策制定、人际交往甚至生物进化中无数“斗智”场景的思维框架。在数学建模中对策论为我们提供了一套强大的工具用于分析、预测和优化存在多方互动和利益冲突的系统行为。接下来我们就剥开这层理论的外衣看看它到底怎么用。2. 拆解对策论的核心构件从收益矩阵到纳什均衡要建立一个对策论模型首先得把现实问题“翻译”成数学语言。这个过程需要定义几个核心构件它们就像建筑的砖瓦缺一不可。2.1 参与者谁在“玩游戏”参与者是对策模型中的决策主体。可以是两个人如田忌和齐王也可以是多人如寡头市场中的几家公司甚至是“自然”代表不确定性如天气。在建模时我们需要明确参与者的集合通常用N {1, 2, ...,n} 表示。一个关键假设是参与者是理性的即他们总是试图最大化自己的收益或最小化损失。同时我们通常假设参与者拥有共同知识即每个人都知道游戏规则每个人都知道其他人知道游戏规则如此递归无穷。这个假设很强但它是许多经典模型的基础。2.2 策略每个玩家有哪些“出牌”方式策略是参与者在游戏中可以选择的完整行动计划。它不是一个简单的动作而是一个“如果...那么...”的完整方案。在田忌赛马中策略就是三匹马的出场顺序排列。策略分为纯策略和混合策略。纯策略参与者明确选择一个具体的行动。例如在“石头剪刀布”中你明确出“石头”。混合策略参与者以一定的概率分布随机选择不同的纯策略。例如你以1/3的概率出石头1/3出剪刀1/3出布。混合策略的引入是为了应对对手可能预测你行动的情况增加自身策略的不可预测性。所有参与者策略的组合构成了一个策略组合它决定了游戏的最终走向。2.3 收益游戏的“得分”如何计算收益也叫支付是每个参与者在特定策略组合下所获得的结果量化。它可以是利润、效用、市场份额、满意度等。收益通常用收益矩阵来表示这对于两人有限策略游戏尤为直观。假设两家公司A和B决定是否进行广告战。双方都有两个策略打广告Ad或不打广告NoAd。收益矩阵如下单位百万利润A \ B打广告 (Ad)不打广告 (NoAd)打广告 (Ad)(2, 2)(5, 1)不打广告 (NoAd)(1, 5)(4, 4)这个矩阵怎么读以单元格(Ad, Ad)为例它表示A选择AdB也选择Ad时A的收益是2B的收益也是2。括号内第一个数字是**行参与者A的收益第二个数字是列参与者B**的收益。这个简单的矩阵蕴含了丰富的策略互动我们稍后会用它来分析。2.4 纳什均衡策略互动的“稳定点”这是对策论中最核心、也最著名的概念由约翰·纳什提出。在一个策略组合中如果没有任何一个参与者可以通过单方面改变自己的策略而获得更高的收益那么这个策略组合就是一个纳什均衡。通俗地说纳什均衡是一种“僵局”状态。在均衡点上每个人都认为给定别人现在的策略我的策略已经是最好的了我要是变招只会让自己更吃亏。所以没有人有动机主动偏离这个状态。让我们用上面的广告战例子来找找纳什均衡。我们逐一检查每个策略组合(Ad, Ad)A收益2。如果A单方面改成NoAd收益会变成1更差。B收益2如果B单方面改成NoAd收益也会变成1更差。所以双方都没有单方面改变的动机。(Ad, Ad)是一个纳什均衡。(Ad, NoAd)A收益5。如果A单方面改成NoAd收益变成4更差所以A不会改。B收益1。如果B单方面改成Ad收益变成2更好所以B有动机改变。因此**(Ad, NoAd)不是均衡**。(NoAd, Ad)同理B不会改但A有动机改成Ad收益从1变5所以不是均衡。(NoAd, NoAd)A收益4。如果A单方面改成Ad收益变成5更好所以A有动机改变。因此不是均衡。所以这个“广告战”博弈只有一个纯策略纳什均衡(Ad, Ad)即双方都打广告。但注意这个结果(2,2)的收益比双方都不打广告的(4,4)要差这就是著名的囚徒困境模型。个体理性每个人都追求自身利益最大化导致了集体非理性整体收益变差。这个模型深刻解释了为什么价格战、军备竞赛等现象难以避免。注意纳什均衡可能存在多个多重均衡也可能不存在纯策略均衡但一定存在混合策略均衡这是纳什证明的定理。寻找均衡是分析对策模型的关键步骤。3. 对策模型的分类与经典范式根据不同的标准对策模型可以分成多种类型不同类型的模型其分析方法和结论也大相径庭。3.1 合作 vs. 非合作对策这是最根本的划分。非合作对策研究参与者在无法达成有约束力协议的条件下如何做出决策。我们前面讨论的收益矩阵、纳什均衡都属于这个范畴。它关注个体在竞争中的最优策略。绝大多数数学建模问题涉及的都是非合作对策。合作对策研究参与者可以结成联盟并如何公平地分配联盟带来的总收益。它关注的是集体理性下的分配方案核心概念如夏普利值。这类问题在资源分配、成本分摊等场景中应用较多。3.2 静态 vs. 动态对策这关乎行动的顺序和信息。静态对策同时对策所有参与者同时行动或者虽然行动有先后但后行动者不知道先行动者的具体选择。上面的广告战例子就是静态的。通常用收益矩阵表示。动态对策序贯对策参与者的行动有明确的先后顺序并且后行动者能够观察到先行动者的行动。这类对策通常用扩展式博弈树来表示。例如市场进入博弈一家在位企业Incumbent先观察到潜在进入者Entrant是否进入市场然后决定是默许还是发起价格战。动态分析的核心是子博弈精炼纳什均衡它要求参与者在每一个决策点包括可能不会发生的点上的策略都是最优的排除了不可信的威胁。3.3 完全信息 vs. 不完全信息这关乎参与者对彼此的了解程度。完全信息每个参与者的收益函数是公共知识。前面所有例子都是完全信息的。不完全信息至少有一个参与者不确定其他参与者的收益函数。例如在拍卖中你不知道别人对拍品的真实估价。处理不完全信息的标准方法是引入类型的概念并分析贝叶斯纳什均衡。这大大增加了模型的复杂性和现实性。3.4 零和 vs. 非零和对策这关乎参与者之间的利益关系。零和对策所有参与者的收益之和在任何情况下都为零或一个常数。一方所得即为另一方所失。如棋类游戏、赌博。这类博弈通常可以用最小最大定理来分析寻找鞍点。非零和对策参与者的收益之和是可变的。大部分经济、社会博弈都是非零和的存在合作共赢或两败俱伤的可能。广告战、囚徒困境都是非零和博弈。4. 数学建模实战以“价格竞争”为例构建与求解理论说得再多不如动手建一个模。我们假设一个经典的“古诺双寡头”竞争模型并将其转化为一个对策论问题来求解。问题描述市场上有两家生产同质化产品的企业企业1和企业2。它们同时决定各自的产量q1和q2。市场的总产量Q q1 q2决定了市场价格P。假设反需求函数价格与总产量的关系为线性P a - Q 其中a为常数表示市场最大可能价格。假设两家企业的生产成本相同且单位成本为常数c。那么每家企业应生产多少第一步定义对策模型要素参与者N {企业1 企业2}。策略每个企业选择的产量qi ≥ 0。这是一个连续策略空间。收益企业的收益就是其利润πi。企业1的利润π1 [P - c] * q1 [ (a - q1 - q2) - c ] * q1 (a - c - q1 - q2) * q1同理企业2的利润π2 (a - c - q1 - q2) * q2第二步求解纳什均衡在纳什均衡下给定对手的产量每个企业选择的产量应使自己的利润最大化。这转化为一个最优化问题。对于企业1给定q2它要最大化π1(q1, q2)。对π1关于q1求一阶导数并令其为零 ∂π1/∂q1 a - c - 2q1 - q2 0 q1 (a - c - q2) / 2* —— 这就是企业1的反应函数。它描述了针对企业2的每一个可能产量企业1的最优产量是多少。同理对于企业2给定q1其反应函数为q2 (a - c - q1) / 2*纳什均衡是双方同时处于各自反应函数上的点即联立两个反应函数方程 q1 (a - c - q2) / 2 q2 (a - c - q1) / 2解这个二元一次方程组 将第二个方程代入第一个q1 [a - c - (a - c - q1)/2] / 2 解得q1 (a - c) / 3* 由对称性可知q2 (a - c) / 3*均衡结果总产量 Q* 2(a-c)/3市场价格 P* a - Q* a - 2(a-c)/3 (a 2c)/3每家企业的利润 πi* (P* - c) * qi* [(a2c)/3 - c] * (a-c)/3 (a-c)^2 / 9第三步与垄断和完全竞争对比延伸分析垄断情况一家企业垄断企业最大化利润 π (a - Q - c) * Q。求导得 Q_m (a-c)/2 P_m (ac)/2 π_m (a-c)^2/4。完全竞争情况价格等于边际成本即 P c 此时 Q_c a-c。对比可以发现市场结构总产量市场价格总利润行业完全竞争a-cc0古诺双寡头2(a-c)/3(a2c)/32(a-c)^2/9垄断(a-c)/2(ac)/2(a-c)^2/4产量完全竞争 双寡头 垄断 价格垄断 双寡头 完全竞争 这符合我们的经济直觉竞争越激烈产量越高价格越低消费者福利越高。实操心得在数学建模中构建反应函数并求解联立方程是求解静态完全信息博弈纳什均衡的通用方法。关键在于正确写出每个参与者的收益目标函数。对于更复杂的模型如成本不对称、需求非线性可能需要用到数值方法如迭代法、优化算法来求解均衡。5. 超越经典演化博弈与有限理性经典对策论假设参与者是完全理性的超级计算器这在实际中往往不成立。人们的行为会受到习惯、模仿、试错的影响。演化博弈论提供了一个更贴近现实的视角。它借鉴了生物进化的思想参与者不是一个超级理性的个体而是一个采用某种策略的“类型”如“合作型”、“背叛型”。这些策略在群体中竞争收益更高的策略适应度更高会有更多的“后代”被模仿、被学习从而在群体中的比例逐渐上升。这个过程可以用复制者动态方程来描述。核心概念是演化稳定策略如果一个策略在群体中占据主导时任何微小的变异策略入侵都无法取得成功那么这个策略就是ESS。ESS是演化博弈中的稳定均衡点。一个经典模型鹰鸽博弈假设群体中的个体争夺一份价值V的资源。它们有两种策略鹰派强硬争夺不惜战斗。战斗会导致双方各损失C。鸽派展示但不战斗如果遇到鹰派就逃跑如果遇到同类就平分资源。收益矩阵如下个体1 \ 个体2鹰 (H)鸽 (D)鹰 (H)(V-C)/2, (V-C)/2V, 0鸽 (D)0, VV/2, V/2通过复制者动态分析我们可以得到如果 V C资源价值高战斗成本低那么鹰派策略是唯一的ESS群体将充满斗争。如果 V C资源价值低战斗成本高则不存在纯策略ESS但存在一个混合策略ESS群体中以一定的概率p V/C出现鹰派以概率(1-p)出现鸽派。这是一个多态均衡。演化博弈论被广泛应用于分析社会规范的形成、合作行为的演化、文化传播等现象。在数学建模中当涉及群体行为、策略扩散、学习过程时演化博弈是一个强有力的工具。6. 在数学建模竞赛中应用对策论的要点与避坑指南将对策论成功应用于数学建模竞赛如国赛、美赛需要特别注意以下几点1. 问题识别什么时候该用对策论当你的问题描述中出现以下关键词时就要考虑对策论了竞争、博弈、互动决策、多方利益冲突、策略选择、均衡、拍卖、竞价、谈判、合作与背叛等。例如“多家公司的市场竞争策略”、“交通拥堵路段中司机的路径选择”、“电商平台与商家的佣金博弈”、“国际气候谈判中的减排承诺”等。2. 模型选择选对范式和简化程度这是最容易出错的地方。首先要判断是合作还是非合作竞赛题绝大多数是非合作博弈。是静态还是动态如果行动有明显先后且后动者能观察先动者用动态博弈博弈树否则先尝试静态模型。信息是否完全如果不清楚对手的收益考虑不完全信息博弈贝叶斯博弈但这会大大增加难度谨慎使用。是零和吗如果是纯粹的竞争分配如体育比赛对阵考虑零和博弈及最小最大策略。一个常见的坑是过度复杂化。首次建模尽量从完全信息静态博弈开始用收益矩阵或反应函数分析纳什均衡。这足以解决很多问题并体现核心思想。动态和不完全信息模型可以作为灵敏度分析或模型拓展部分。3. 参数设定与收益量化让模型落地收益函数中的参数如a, c, V, C必须有现实依据或合理的假设。在竞赛中可以通过以下方式处理从题目数据中估算如从历史价格和销量数据拟合需求曲线得到参数a。合理假设并做灵敏度分析如果参数难以确定可以假设一组基准值然后分析当这些参数在合理范围内变动时均衡结果如何变化。这是展示模型稳健性的好方法。收益的量化收益可以是利润、效用、市场份额、得分等。有时需要将不同维度的收益如利润和风险综合为一个效用值这需要设定权重权重选择要有依据。4. 求解与计算从解析解到数值模拟解析解像古诺模型那样通过求导解方程得到精确的均衡解。这是最理想的但只适用于结构简单的模型。数值方法当模型复杂如多人、策略空间连续或离散但庞大时需要借助计算机。迭代法模拟反应函数动态调整的过程直到策略稳定收敛到均衡。优化算法将寻找纳什均衡转化为一个优化问题如求解一个互补性问题使用MATLAB的fmincon、Python的SciPy.optimize等工具包求解。模拟仿真特别是对于演化博弈编写多智能体仿真程序让大量个体根据规则互动观察群体策略的演化结果。Python的Mesa、NumPy库非常适合做这个。5. 结果分析与论文呈现解释均衡的经济/现实意义不要只摆出数学结果。要说清楚这个均衡状态意味着什么比如“在均衡下两家公司都选择了中等力度的广告投入这是因为...”。进行对比分析像我们之前做的那样将博弈结果与垄断、完全竞争等其他市场结构对比或者与“合作解”如共谋对比突出博弈带来的效率损失或策略互动特性。提出策略建议基于模型结论为参与者提出可操作的建议。例如“对于新进入市场的企业模型显示采取温和的产量策略是更优的因为...”。讨论模型局限性与扩展诚实地指出模型的假设如完全理性、完全信息在现实中可能不成立并简要讨论如果放松这些假设如引入有限理性、不完全信息模型可能会发生什么变化。这能体现思考的深度。个人踩坑经验在一次模拟竞赛中我们试图用动态博弈分析一个多阶段投标问题。一开始就想构建一个完美的多阶段博弈树结果因为分支太多收益函数复杂导致根本无法求解浪费了大量时间。后来我们退而求其次先简化为一个两阶段模型求出了解析解并清晰地画出了博弈树。然后在模型拓展部分我们指出“若考虑更多阶段其定性结论与两阶段模型类似但计算复杂度呈指数增长可采用逆向归纳法思想结合数值模拟进行求解”并简要描述了模拟思路。评委最终认可了这种由简入繁、重点清晰的建模思路。所以先解决一个简化但核心的问题远比纠结于一个复杂却无法求解的“完美”模型要重要得多。