math-skill 1.0.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +21 -0
- package/README.md +278 -0
- package/agents/math-critic.md +203 -0
- package/commands/abstraction.md +34 -0
- package/commands/algorithmic-thinking.md +34 -0
- package/commands/ask.md +21 -0
- package/commands/axiomatization.md +34 -0
- package/commands/causal-inference.md +34 -0
- package/commands/discrete-combinatorial.md +34 -0
- package/commands/game-theory.md +34 -0
- package/commands/induction-analogy.md +34 -0
- package/commands/information-theory.md +34 -0
- package/commands/logic-deduction.md +34 -0
- package/commands/modeling.md +37 -0
- package/commands/optimization.md +33 -0
- package/commands/probability-statistics.md +36 -0
- package/commands/symmetry-invariance.md +34 -0
- package/commands/topological-thinking.md +33 -0
- package/commands/transformation.md +33 -0
- package/docs/CLAUDE.md +187 -0
- package/docs/inspiration.md +113 -0
- package/knowledge-base/overview.md +230 -0
- package/package.json +60 -0
- package/skills/abstraction/SKILL.md +264 -0
- package/skills/abstraction/original-texts.md +175 -0
- package/skills/algorithmic-thinking/SKILL.md +371 -0
- package/skills/algorithmic-thinking/original-texts.md +256 -0
- package/skills/axiomatization/SKILL.md +213 -0
- package/skills/axiomatization/original-texts.md +160 -0
- package/skills/causal-inference/SKILL.md +374 -0
- package/skills/causal-inference/original-texts.md +167 -0
- package/skills/discrete-combinatorial/SKILL.md +286 -0
- package/skills/discrete-combinatorial/original-texts.md +185 -0
- package/skills/game-theory/SKILL.md +318 -0
- package/skills/game-theory/original-texts.md +131 -0
- package/skills/induction-analogy/SKILL.md +310 -0
- package/skills/induction-analogy/original-texts.md +154 -0
- package/skills/information-theory/SKILL.md +242 -0
- package/skills/information-theory/original-texts.md +127 -0
- package/skills/logic-deduction/SKILL.md +280 -0
- package/skills/logic-deduction/original-texts.md +173 -0
- package/skills/meta-selector/SKILL.md +188 -0
- package/skills/meta-selector/original-texts.md +105 -0
- package/skills/modeling/SKILL.md +318 -0
- package/skills/modeling/original-texts.md +165 -0
- package/skills/optimization/SKILL.md +292 -0
- package/skills/optimization/original-texts.md +168 -0
- package/skills/probability-statistics/SKILL.md +312 -0
- package/skills/probability-statistics/original-texts.md +193 -0
- package/skills/symmetry-invariance/SKILL.md +358 -0
- package/skills/symmetry-invariance/original-texts.md +221 -0
- package/skills/topological-thinking/SKILL.md +273 -0
- package/skills/topological-thinking/original-texts.md +164 -0
- package/skills/transformation/SKILL.md +264 -0
- package/skills/transformation/original-texts.md +216 -0
|
@@ -0,0 +1,318 @@
|
|
|
1
|
+
---
|
|
2
|
+
name: game-theory
|
|
3
|
+
description: |
|
|
4
|
+
科研模式触发:当涉及数学建模、论文分析、算法设计中的多方互动决策、纳什均衡计算、机制设计时调用。
|
|
5
|
+
生活模式触发:当涉及日常决策受他人影响、人际互动策略、生活规划中的利益协调与冲突时调用。
|
|
6
|
+
Research mode trigger: When math modeling, paper analysis, algorithm design involves multi-party interactive decisions, Nash equilibrium computation, mechanism design.
|
|
7
|
+
Life mode trigger: When daily decisions are influenced by others, interpersonal interaction strategy, benefit coordination and conflict in life planning.
|
|
8
|
+
English: Trigger when decisions involve multiple interacting parties, optimal strategy depends on others' choices, or incentive mechanisms need designing.
|
|
9
|
+
---
|
|
10
|
+
|
|
11
|
+
# 🎯 博弈论思想
|
|
12
|
+
|
|
13
|
+
> "你的最优选择取决于他人的选择——思考不仅要深入,还要互动。"
|
|
14
|
+
> "Your optimal choice depends on others' choices — thinking must be interactive, not just deep."
|
|
15
|
+
>
|
|
16
|
+
> —— 博弈论、决策论、机制设计 / Game Theory, Decision Theory, Mechanism Design
|
|
17
|
+
|
|
18
|
+
## 核心原则 / Core Principle
|
|
19
|
+
|
|
20
|
+
**战略互动——你的最优行动取决于他人做什么,而他人的最优行动取决于你做什么。纳什均衡:无人能从单方面偏离中获益的策略组合。**
|
|
21
|
+
|
|
22
|
+
**Strategic interaction — your best action depends on what others do, and theirs depend on what you do. Nash equilibrium: strategy profile where no player benefits from unilateral deviation.**
|
|
23
|
+
|
|
24
|
+
关键概念:
|
|
25
|
+
- **支付矩阵(Payoff Matrix)**:每个策略组合下各参与者的收益表
|
|
26
|
+
- **占优策略(Dominant Strategy)**:无论他人选什么,该策略总是最优
|
|
27
|
+
- **混合策略(Mixed Strategy)**:以概率分布随机选择纯策略
|
|
28
|
+
- **帕累托最优性(Pareto Optimality)**:不存在使所有人同时改善的策略组合
|
|
29
|
+
|
|
30
|
+
博弈的三种分类维度:
|
|
31
|
+
- **合作博弈 vs 非合作博弈**:参与者能否达成有约束力的协议
|
|
32
|
+
- **零和博弈 vs 一般和博弈**:参与者收益是否完全对立
|
|
33
|
+
- **同时博弈 vs 序列博弈**:参与者行动是否有序列依赖
|
|
34
|
+
|
|
35
|
+
> **数学形式化 / Mathematical Formalization**(科研模式参考)
|
|
36
|
+
>
|
|
37
|
+
> 形式化定义:n 个参与者,每人有策略集 $S_i$ 和支付函数 $u_i: S_1 \times \cdots \times S_n \to \mathbb{R}$。
|
|
38
|
+
>
|
|
39
|
+
> 纳什均衡:策略组合 $s^* = (s_1^*, \ldots, s_n^*)$ 满足
|
|
40
|
+
>
|
|
41
|
+
> $$u_i(s^*) \geq u_i(s_i, s^*_{-i}) \quad \text{for all } s_i \in S_i, \text{ all } i$$
|
|
42
|
+
>
|
|
43
|
+
> 其中 $s^*_{-i} = (s_1^*, \ldots, s_{i-1}^*, s_{i+1}^*, \ldots, s_n^*)$ 表示除参与者 $i$ 外所有其他人的策略。混合策略纳什均衡:概率分布 $\sigma^*$ 使得
|
|
44
|
+
>
|
|
45
|
+
> $$u_i(\sigma^*) \geq u_i(s_i, \sigma^*_{-i}) \quad \text{for all } s_i \in S_i, \text{ all } i$$
|
|
46
|
+
|
|
47
|
+
## 不适用场景 / When NOT to Use
|
|
48
|
+
|
|
49
|
+
- **单人决策问题,与他人无互动** `[科研/通用]` ——优化思想更适用,无需考虑他人策略响应
|
|
50
|
+
- **纯合作问题,无利益冲突** `[科研/通用]` ——参与者目标完全一致,无需战略分析
|
|
51
|
+
- **确定性问题,无战略不确定性** `[科研]` ——结果由自身行动唯一决定,不涉及他人反应
|
|
52
|
+
- **情绪驱动的即时反应,无策略考量空间** `[生活]` ——来不及分析他人选择,博弈框架无法介入
|
|
53
|
+
- **纯粹运气决定的结果,各方无策略选择** `[通用]` ——无策略集可分析,博弈论不适用
|
|
54
|
+
|
|
55
|
+
- **Single-player decision with no interaction with others** `[Research/General]` — optimization suffices, no need to consider strategic response
|
|
56
|
+
- **Purely cooperative problem with no conflict** `[Research/General]` — all players share identical goals, strategic analysis unnecessary
|
|
57
|
+
- **Deterministic problem with no strategic uncertainty** `[Research]` — outcome determined solely by own actions, no others' reactions involved
|
|
58
|
+
- **Emotion-driven instant reaction with no room for strategic deliberation** `[Life]` — too fast to analyze others' choices, game theory framework cannot intervene
|
|
59
|
+
- **Pure luck-determined outcomes with no strategic choices for any party** `[General]` — no strategy sets to analyze, game theory not applicable
|
|
60
|
+
|
|
61
|
+
## 何时使用 / When to Use
|
|
62
|
+
|
|
63
|
+
### 科研触发条件 / Research Triggers
|
|
64
|
+
|
|
65
|
+
- 多个决策者相互影响,各自的策略影响他人收益
|
|
66
|
+
- 最佳策略取决于他人可能的响应,需预判他人行动
|
|
67
|
+
- 需设计激励机制,使自利行为导向社会最优结果
|
|
68
|
+
- 谈判或讨价还价,需分析利益分配与威胁点
|
|
69
|
+
- 分析竞争市场中的定价、进入、退出等策略行为
|
|
70
|
+
- 预测均衡结果——在给定规则下系统趋向何种稳定状态
|
|
71
|
+
|
|
72
|
+
- Multiple decision-makers interact, each strategy affects others' payoffs
|
|
73
|
+
- Optimal strategy depends on others' likely responses, need to anticipate their actions
|
|
74
|
+
- Designing incentive mechanisms, making self-interested behavior lead to socially optimal outcomes
|
|
75
|
+
- Negotiating or bargaining, analyzing benefit distribution and threat points
|
|
76
|
+
- Analyzing competitive markets — pricing, entry, exit and other strategic behaviors
|
|
77
|
+
- Predicting equilibrium outcomes — what stable state the system converges to under given rules
|
|
78
|
+
|
|
79
|
+
### 生活触发条件 / Life Triggers
|
|
80
|
+
|
|
81
|
+
- 你的决定会受到别人决定的影响(如选择去哪家餐厅取决于朋友偏好)
|
|
82
|
+
- 需要预判他人反应来做决策(如谈判薪资、分配家务、竞标拍卖)
|
|
83
|
+
- 多方利益冲突需要协调(如家庭资源分配、团队任务分工)
|
|
84
|
+
- 感觉陷入两难——无论怎么选都不满意,可能需要改变互动规则
|
|
85
|
+
- 重复互动中需要建立合作或信任(如邻里关系、长期合作)
|
|
86
|
+
- 需要设计规则让别人自愿做出好选择(如激励机制、团队奖惩制度)
|
|
87
|
+
|
|
88
|
+
- Your decision is influenced by others' decisions (e.g., choosing a restaurant depends on friends' preferences)
|
|
89
|
+
- Need to anticipate others' reactions before deciding (e.g., salary negotiation, chore division, bidding)
|
|
90
|
+
- Multiple parties' interests conflict and need coordination (e.g., family resource allocation, team task division)
|
|
91
|
+
- Feeling trapped in a dilemma — no choice satisfies, may need to change interaction rules
|
|
92
|
+
- Need to build cooperation or trust in repeated interactions (e.g., neighbor relations, long-term partnerships)
|
|
93
|
+
- Need to design rules so others voluntarily make good choices (e.g., incentive mechanisms, team reward/penalty systems)
|
|
94
|
+
|
|
95
|
+
## 方法流程 / Method
|
|
96
|
+
|
|
97
|
+
### 第一步:识别参与者与策略 / Identify Players and Strategies
|
|
98
|
+
|
|
99
|
+
#### 科研模式 / Research Mode
|
|
100
|
+
|
|
101
|
+
定义博弈的基本要素:
|
|
102
|
+
- **参与者(Players)**:$N = \{1, 2, \ldots, n\}$,谁在做决策?
|
|
103
|
+
- **策略集(Strategy Sets)**:$S_i$ 为参与者 $i$ 的所有可选行动
|
|
104
|
+
- **支付函数(Payoff Functions)**:$u_i: S_1 \times \cdots \times S_n \to \mathbb{R}$,每个策略组合下 $i$ 的收益
|
|
105
|
+
- **信息结构(Information Structure)**:各参与者知道什么?不知道什么?信息是否对称?
|
|
106
|
+
|
|
107
|
+
关键问题:是否存在隐藏信息(不完全信息博弈)?行动是否有序列(序列博弈)?参与者能否通信?
|
|
108
|
+
|
|
109
|
+
#### 生活模式 / Life Mode
|
|
110
|
+
|
|
111
|
+
回答以下问题来识别博弈要素:
|
|
112
|
+
- **谁在影响你的决策?** 列出所有相关方——他们不是旁观者,他们的选择会影响你的结果
|
|
113
|
+
- **他们的选择会影响你的结果吗?** 如果不会,这不是博弈,只需优化
|
|
114
|
+
- **你了解他们的动机吗?** 各方真正在意什么?表面说法 vs 实际利益
|
|
115
|
+
- **各方有哪些可选行动?** 不需要列完所有选项,但要覆盖关键可能性
|
|
116
|
+
|
|
117
|
+
#### 共通要点 / Common Key Points
|
|
118
|
+
|
|
119
|
+
核心是识别"互动结构"——谁的选择影响谁的结果。遗漏关键参与者是最常见的错误。
|
|
120
|
+
|
|
121
|
+
---
|
|
122
|
+
|
|
123
|
+
### 第二步:构建支付矩阵/函数 / Construct Payoff Matrix or Functions
|
|
124
|
+
|
|
125
|
+
#### 科研模式 / Research Mode
|
|
126
|
+
|
|
127
|
+
- **2人博弈**:用支付矩阵(表格)表示,行参与者和列参与者的策略组合对应单元格 $(u_1, u_2)$
|
|
128
|
+
- **n人博弈**:用效用函数 $u_i(s_1, \ldots, s_n)$ 表示,每个参与者的收益依赖于所有人的策略
|
|
129
|
+
- 验证完备性:是否遗漏了关键参与者或策略?支付是否准确反映偏好?
|
|
130
|
+
|
|
131
|
+
关键问题:支付是零和的还是一般和的?是否存在外部性(一人的策略影响非参与者)?
|
|
132
|
+
|
|
133
|
+
#### 生活模式 / Life Mode
|
|
134
|
+
|
|
135
|
+
梳理各方的得失:
|
|
136
|
+
- **各方的得失是什么?** 不同选择下每个人会得到什么、失去什么?得失不限于金钱——时间、情感、声誉都是支付
|
|
137
|
+
- **不同选择下每个人会得到什么、失去什么?** 尝试画出简单的"如果A选X、B选Y,各方的结果"
|
|
138
|
+
- **你是否完整考虑了所有人的利益?** 只考虑自己的支付而忽略他人的,会导致错误的策略预判
|
|
139
|
+
|
|
140
|
+
#### 共通要点 / Common Key Points
|
|
141
|
+
|
|
142
|
+
支付(payoff)是博弈分析的根基。如果支付评估不准,后续所有分析都会偏。务必考虑所有参与者的完整利益维度。
|
|
143
|
+
|
|
144
|
+
---
|
|
145
|
+
|
|
146
|
+
### 第三步:寻找占优策略 / Find Dominant Strategies
|
|
147
|
+
|
|
148
|
+
#### 科研模式 / Research Mode
|
|
149
|
+
|
|
150
|
+
- **严格占优策略(Strictly Dominant)**:$s_i^*$ 使得 $u_i(s_i^*, s_{-i}) > u_i(s_i, s_{-i})$ 对所有 $s_i \neq s_i^*$ 和所有 $s_{-i}$ 成立
|
|
151
|
+
- **弱占优策略(Weakly Dominant)**:$u_i(s_i^*, s_{-i}) \geq u_i(s_i, s_{-i})$ 对所有 $s_{-i}$ 成立,且至少一个 $s_{-i}$ 严格不等
|
|
152
|
+
- **迭代消去劣策略(Iterated Elimination of Dominated Strategies)**:依次删去每个参与者的劣策略,缩小策略空间
|
|
153
|
+
|
|
154
|
+
若存在占优策略均衡,这是最强形式的均衡——无人有任何偏离动机,不论理性程度。
|
|
155
|
+
|
|
156
|
+
#### 生活模式 / Life Mode
|
|
157
|
+
|
|
158
|
+
问自己:
|
|
159
|
+
- **有没有一个选择,无论对方怎么做都是你的最佳?** 如果有,直接选它——不需要猜测对方意图
|
|
160
|
+
- 如果没有占优策略,你的最优选择取决于对方怎么做——这时需要进入下一步分析
|
|
161
|
+
- 排除明显不好的选项:有些选择在任何情况下都不如其他选择,先删掉它们简化决策
|
|
162
|
+
|
|
163
|
+
#### 共通要点 / Common Key Points
|
|
164
|
+
|
|
165
|
+
占优策略是最强的结论——一旦找到,问题就解决了。如果没有占优策略,才需要更复杂的均衡分析。
|
|
166
|
+
|
|
167
|
+
---
|
|
168
|
+
|
|
169
|
+
### 第四步:计算纳什均衡 / Compute Nash Equilibria
|
|
170
|
+
|
|
171
|
+
#### 科研模式 / Research Mode
|
|
172
|
+
|
|
173
|
+
- **纯策略纳什均衡**:通过最优响应分析(best response analysis)——对每个 $s_{-i}$,找出 $i$ 的最优响应 $BR_i(s_{-i})$,交叉点即为均衡
|
|
174
|
+
- **混合策略纳什均衡**:计算使其他参与者无差异的概率分布——参与者 $i$ 的混合策略 $\sigma_i$ 使得参与者 $j$ 的所有纯策略期望支付相等
|
|
175
|
+
|
|
176
|
+
$$u_j(s_j, \sigma^*_{-j}) = u_j(s_j', \sigma^*_{-j}) \quad \text{for all } s_j, s_j' \in S_j$$
|
|
177
|
+
|
|
178
|
+
- **多重均衡**:帕累托排序——比较各均衡下所有参与者的支付,标注帕累托最优均衡与帕累托劣均衡
|
|
179
|
+
|
|
180
|
+
#### 生活模式 / Life Mode
|
|
181
|
+
|
|
182
|
+
寻找稳定状态:
|
|
183
|
+
- **是否存在一个稳定状态——大家都不愿意单方面改变策略?** 这就是最可能的结果
|
|
184
|
+
- 如果存在这样的稳定状态,那就是最可能的结局——每个人都在做自己能做的最好选择
|
|
185
|
+
- **如果有多个稳定状态,哪个更可能发生?** 多重均衡意味着结果不确定——需要看历史惯例、沟通协调或焦点效应(salience)
|
|
186
|
+
|
|
187
|
+
#### 共通要点 / Common Key Points
|
|
188
|
+
|
|
189
|
+
纳什均衡是博弈论的核心预测工具——它告诉你"在理性假设下,最可能的结果是什么"。多重均衡是常态,需要额外信息选择。
|
|
190
|
+
|
|
191
|
+
---
|
|
192
|
+
|
|
193
|
+
### 第五步:分析博弈类型 / Analyze Game Type
|
|
194
|
+
|
|
195
|
+
#### 科研模式 / Research Mode
|
|
196
|
+
|
|
197
|
+
- **零和博弈**:minimax 定理 $\max_x \min_y f(x,y) = \min_y \max_x f(x,y)$,最优策略是保守的——在最坏情况下最大化收益
|
|
198
|
+
- **序列博弈**:逆向归纳法(backward induction)与子博弈完美均衡(subgame perfect equilibrium)——每一步都是后续子博弈的纳什均衡
|
|
199
|
+
- **合作博弈**:联盟形成(coalition formation)与 Shapley 值(Shapley Value)——按边际贡献分配联盟收益
|
|
200
|
+
|
|
201
|
+
$$\phi_i(v) = \sum_{S \subseteq N \setminus \{i\}} \frac{|S|!(n - |S| - 1)!}{n!} [v(S \cup \{i\}) - v(S)]$$
|
|
202
|
+
|
|
203
|
+
#### 生活模式 / Life Mode
|
|
204
|
+
|
|
205
|
+
判断互动类型,选择对应策略:
|
|
206
|
+
- **如果是竞争关系(一方得另一方必失)**:保守策略——做最坏情况下最好的选择。不要指望对方合作,先确保自己不会太惨
|
|
207
|
+
- **如果是合作关系**:寻找双赢点——双方都能改善的选项。关注如何分配合作收益,而非如何争夺
|
|
208
|
+
- **如果是谈判**:识别双方的底线和共识区域——谈判的核心是找到双方都能接受的区域,而非各自的最优
|
|
209
|
+
|
|
210
|
+
#### 共通要点 / Common Key Points
|
|
211
|
+
|
|
212
|
+
博弈类型决定了分析方法——零和用保守策略,序列用逆向推理,合作用联盟分析。误判类型会导致方法错用。
|
|
213
|
+
|
|
214
|
+
---
|
|
215
|
+
|
|
216
|
+
### 第六步:检查均衡稳定性 / Check Equilibrium Stability
|
|
217
|
+
|
|
218
|
+
#### 科研模式 / Research Mode
|
|
219
|
+
|
|
220
|
+
- **颤抖手完美(Trembling-Hand Perfect Equilibrium)**:均衡在微小失误下仍然稳定——排除依赖"对手绝不犯错"的均衡
|
|
221
|
+
- **演化稳定性(Evolutionarily Stable Strategy, ESS)**:在重复互动中,均衡策略能否抵御入侵策略——生物学与经济学交叉
|
|
222
|
+
- **偏离均衡路径的激励(Off-Equilibrium Path Incentives)**:序列博弈中,参与者是否有动机在非均衡节点上遵守承诺
|
|
223
|
+
|
|
224
|
+
关键问题:均衡是唯一的还是多重的?多重均衡中哪个更可能被选择?均衡是否对微小扰动鲁棒?
|
|
225
|
+
|
|
226
|
+
#### 生活模式 / Life Mode
|
|
227
|
+
|
|
228
|
+
评估稳定状态的可靠性:
|
|
229
|
+
- **这个稳定状态靠谱吗?** 如果有人犯小错(误解你的意图、操作失误),局面会崩吗?
|
|
230
|
+
- **在重复互动中,这个状态能持续吗?** 单次博弈的结论在长期关系中可能完全不同——合作可以在重复互动中涌现
|
|
231
|
+
- 如果稳定状态对小错误不鲁棒,实际结局可能偏离理论预测——需要考虑容错方案
|
|
232
|
+
|
|
233
|
+
#### 共通要点 / Common Key Points
|
|
234
|
+
|
|
235
|
+
稳定的均衡才是可信的预测。不稳定的均衡可能在现实中永远不会出现。
|
|
236
|
+
|
|
237
|
+
---
|
|
238
|
+
|
|
239
|
+
### 第七步:设计机制与改进 / Design Mechanisms and Improve
|
|
240
|
+
|
|
241
|
+
#### 科研模式 / Research Mode
|
|
242
|
+
|
|
243
|
+
如果不存在好的纳什均衡,重新设计博弈:
|
|
244
|
+
- **改变支付结构**:引入惩罚或奖励,使均衡转向更优结果
|
|
245
|
+
- **增加规则**:引入可强制执行的协议、惩罚偏离者
|
|
246
|
+
- **引入通信与声誉**:重复博弈中声誉机制可维持合作
|
|
247
|
+
- **Vickrey 拍卖(第二价格拍卖)**:报真实估值是占优策略——机制设计的经典范例
|
|
248
|
+
- **机制设计(Mechanism Design)**:在满足激励相容性(incentive compatibility)和效率(efficiency)的前提下设计规则
|
|
249
|
+
|
|
250
|
+
$$\text{Mechanism Design: } \max \text{ social welfare} \quad \text{s.t.} \quad \text{incentive compatibility + individual rationality}$$
|
|
251
|
+
|
|
252
|
+
显示原理(Revelation Principle):任何贝叶斯博弈的均衡都可由一个直接机制(direct mechanism)实现——参与者如实报告类型是均衡。
|
|
253
|
+
|
|
254
|
+
#### 生活模式 / Life Mode
|
|
255
|
+
|
|
256
|
+
改变规则让好结局更自然:
|
|
257
|
+
- **如果当前规则下大家都陷入不好的结局(如囚徒困境),能否改变规则让好结局成为自然选择?** 这是机制设计的核心思想
|
|
258
|
+
- **引入承诺**:先做出不可反悔的承诺,改变他人的预期和选择(如预先公开你的底线)
|
|
259
|
+
- **声誉机制**:在长期互动中,好声誉本身就是资产——维护声誉可以维持合作
|
|
260
|
+
- **改变激励结构**:让"做好事"变得自然——调整奖惩让每个人的最优选择恰好也是整体最优
|
|
261
|
+
|
|
262
|
+
#### 共通要点 / Common Key Points
|
|
263
|
+
|
|
264
|
+
机制设计是博弈论最实用的分支——与其抱怨人不合作,不如改变规则让合作成为自利选择。
|
|
265
|
+
|
|
266
|
+
## 常见错误 / Common Errors
|
|
267
|
+
|
|
268
|
+
| 错误 / Error | 数学批评 / Mathematical Critique | 正确做法 / Correct Approach |
|
|
269
|
+
|-------------|-------------------------------|---------------------------|
|
|
270
|
+
| 假设他人像自己一样思考 `[科研/通用]` | 他人可能有不同的支付函数或理性水平,$u_i \neq u_j$ | 明确各参与者的支付函数与信念 |
|
|
271
|
+
| 忽略混合策略 `[科研]` | 纯策略均衡可能不存在,但混合策略均衡总存在(Nash, 1950) | 检查是否需要混合策略分析 |
|
|
272
|
+
| 混淆纳什均衡与帕累托最优 `[科研/通用]` | 纳什均衡可以是帕累托劣的(囚徒困境),两者独立 | 分别标注均衡性与效率性 |
|
|
273
|
+
| 忽略信息不对称 `[科研]` | 不完全信息博弈的均衡与完全信息博弈截然不同 | 区分贝叶斯博弈与完全信息博弈 |
|
|
274
|
+
| 过度简化支付结构 `[科研/通用]` | 遗漏关键支付维度使均衡分析失真 | 系统检查所有参与者的完整支付 |
|
|
275
|
+
| 忽略重复互动动态 `[科研/通用]` | 单次博弈的均衡在重复博弈中可能改变(folk theorem) | 分析重复博弈的子博弈完美均衡 |
|
|
276
|
+
| 假设别人和你想法一样 `[生活]` | 不同人有不同动机、偏好和信息,不能用自己的思维代入他人 | 主动了解他人的真实利益和约束 |
|
|
277
|
+
| 忽略情绪和非理性因素 `[生活]` | 博弈论假设理性,但现实中愤怒、信任、面子等深刻影响选择 | 识别关键情绪因素,修正支付评估 |
|
|
278
|
+
| 只考虑自己的最优不考虑他人的反应 `[生活]` | 单方优化不是博弈分析——你的最优取决于他人的选择 | 先想"如果我这么做,对方会怎么反应" |
|
|
279
|
+
|
|
280
|
+
## 操作规程 / Operating Procedure
|
|
281
|
+
|
|
282
|
+
当本 skill 被触发时,先判断模式:
|
|
283
|
+
|
|
284
|
+
> **模式选择 / Mode Selection**
|
|
285
|
+
> - 若问题涉及数学建模、论文分析、算法设计、均衡计算 → **科研模式**
|
|
286
|
+
> - 若问题涉及日常决策、人际互动、生活规划、冲突协调 → **生活模式**
|
|
287
|
+
> - 若问题同时涉及两者 → **双模式并行,生活模式优先输出,科研模式作为补充验证**
|
|
288
|
+
|
|
289
|
+
### 科研模式输出格式 / Research Mode Output Format
|
|
290
|
+
|
|
291
|
+
1. **[参与者]:[列表]**:明确所有决策者及其类型(理性/有限理性/未知)
|
|
292
|
+
2. **[策略集]:[描述]**:列出每个参与者的可选策略,标注是否为有限/无限策略集
|
|
293
|
+
3. **[支付矩阵]:[关键值]**:写出核心策略组合的支付值 $(u_1, u_2, \ldots)$ 或支付函数形式
|
|
294
|
+
4. **[均衡]:[纳什均衡策略/混合概率]**:计算所有纳什均衡(纯策略和混合策略),标注多重均衡
|
|
295
|
+
5. **[博弈类型]:[零和/非零和/序列/合作]**:分类博弈结构,选择对应分析方法
|
|
296
|
+
6. **[稳定性]:[分析]**:检查均衡的颤抖手完美性、演化稳定性、偏离均衡路径激励
|
|
297
|
+
7. **[机制建议]:[改进]**:若均衡不理想,提出机制设计建议——改变支付、增加规则、引入声誉等
|
|
298
|
+
|
|
299
|
+
**输出必须包含以上 7 项,不得只输出分析性文字而不给出结论。**
|
|
300
|
+
|
|
301
|
+
### 生活模式输出格式 / Life Mode Output Format
|
|
302
|
+
|
|
303
|
+
1. **[参与者]:[谁在影响你的决策]** — 列出所有相关方及其可能的行动
|
|
304
|
+
2. **[得失]:[各方的利益]** — 不同选择下每个人的得失
|
|
305
|
+
3. **[稳定状态]:[分析]** — 是否存在没人愿意单方面改变的策略组合?标注多重稳定状态
|
|
306
|
+
4. **[互动类型]:[竞争/合作/谈判]** — 分类互动结构,选择对应策略
|
|
307
|
+
5. **[稳定性]:[评估]** — 这个稳定状态是否对小错误鲁棒?能否在重复互动中持续?
|
|
308
|
+
6. **[规则建议]:[改进]** — 如果当前规则下结局不理想,如何改变规则让好结局更自然
|
|
309
|
+
|
|
310
|
+
**输出必须包含以上 6 项,不得只输出分析性文字而不给出结论。**
|
|
311
|
+
|
|
312
|
+
## 与其他 skill 的关系
|
|
313
|
+
|
|
314
|
+
- **优化思想**:Nash均衡是互相优化——每个参与者在他人的策略约束下优化自己的支付,均衡是所有优化问题的共同解
|
|
315
|
+
- **概率与统计**:混合策略以概率分布选择行动,贝叶斯博弈用概率处理类型不确定性,均衡计算依赖期望支付
|
|
316
|
+
- **信息论思想**:信息不对称与信号传递——Spence 信号博弈模型中,信息结构直接影响均衡的存在与性质
|
|
317
|
+
- **因果推断思想**:因果与博弈互动——参与者的策略选择因果影响他人收益,战略互动中的因果链是双向的
|
|
318
|
+
- **算法思想**:博弈算法与均衡计算——纳什均衡的计算复杂度(PPAD-complete),Lemke-Howson 算法,演化博弈的模拟算法
|
|
@@ -0,0 +1,131 @@
|
|
|
1
|
+
# 数学出处与经典文献 / Mathematical Sources and Classic Texts
|
|
2
|
+
|
|
3
|
+
## Zermelo 定理 / Zermelo's Theorem (1913)
|
|
4
|
+
|
|
5
|
+
> Zermelo(1913)证明:在有限完美信息二人博弈中(如国际象棋),先手或后手必有一方有必胜策略或双方有必和策略。即博弈是"确定的"(determined)。
|
|
6
|
+
|
|
7
|
+
**核心论点**:对任何有限完美信息博弈,$\exists$ 先手必胜策略 $\lor$ $\exists$ 后手必胜策略 $\lor$ $\exists$ 双方必和策略。证明了此类博弈不存在真正的"不确定性"——不确定性的来源是计算复杂度而非逻辑结构。
|
|
8
|
+
|
|
9
|
+
**思想**:完美信息博弈的结局在逻辑上是预定的——不确定性来自计算能力的限制而非博弈本身。Zermelo 的证明使用逆向归纳法(backward induction),这在后来成为子博弈完美均衡的核心工具。数学背景:Zermelo 同年也在集合论中提出选择公理(AC),博弈论与集合论共享"有限选择必可穷尽"的逻辑。
|
|
10
|
+
|
|
11
|
+
## von Neumann Minimax 定理 / von Neumann's Minimax Theorem (1928)
|
|
12
|
+
|
|
13
|
+
> von Neumann(1928)证明:在二人零和博弈中,$\max_{x \in \Delta} \min_{y \in \Delta} \sum_{ij} a_{ij} x_i y_j = \min_{y \in \Delta} \max_{x \in \Delta} \sum_{ij} a_{ij} x_i y_j$。即保守策略的最优结果等于对手保守策略下的最优结果——max-min = min-max。
|
|
14
|
+
|
|
15
|
+
**核心定理**:对任何二人零和矩阵博弈 $A$,存在混合策略 $x^*$ 和 $y^*$ 使得
|
|
16
|
+
|
|
17
|
+
$$v^* = \max_x \min_y x^\top A y = \min_y \max_x x^\top A y$$
|
|
18
|
+
|
|
19
|
+
$v^*$ 称为博弈的值(value of the game)。证明利用了凸集分离定理(后与 Brouwer 不动点定理有深层联系)。
|
|
20
|
+
|
|
21
|
+
**思想**:minimax 定理揭示了零和博弈的结构对称性——"我尽可能赢"等价于"对手尽可能防"。最优混合策略使对手对所有纯策略无差异。此定理是线性规划对偶性的先声:Dantzig(1947)发现 LP 对偶与 minimax 等价,von Neumann 独立发现了同样联系。
|
|
22
|
+
|
|
23
|
+
## Nash 均衡的存在性 / Existence of Nash Equilibrium (1950)
|
|
24
|
+
|
|
25
|
+
> Nash(1950)证明:每个有限博弈(任意人数、非零和)至少存在一个混合策略纳什均衡。证明使用 Brouwer 不动点定理——构造最优响应映射 $BR: \Delta \to \Delta$,其不动点即为纳什均衡。
|
|
26
|
+
|
|
27
|
+
**核心定理**:对任何有限博弈 $(N, \{S_i\}, \{u_i\})$,$\exists \sigma^* \in \Delta_1 \times \cdots \times \Delta_n$ 使得对所有 $i$ 和 $s_i \in S_i$,
|
|
28
|
+
|
|
29
|
+
$$u_i(\sigma^*) \geq u_i(s_i, \sigma^*_{-i})$$
|
|
30
|
+
|
|
31
|
+
Nash 的证明将 Brouwer 不动点定理应用于最优响应映射:$F(\sigma) = (BR_1(\sigma_{-1}), \ldots, BR_n(\sigma_{-n}))$,$F$ 的不动点即均衡。后续证明也用 Kakutani 不动点定理(对应集值映射)。
|
|
32
|
+
|
|
33
|
+
**思想**:纳什均衡的存在性不依赖参与者的"善意"或"合作意愿"——它是自私行为在战略互动中的逻辑必然。Nash 均衡推广了 minimax 定理到非零和博弈,从二人对抗到多人互动。数学背景:Brouwer 不动点定理(1911)是拓扑学核心定理——连续映射必有不动点,博弈论与拓扑学在此交汇。
|
|
34
|
+
|
|
35
|
+
## 囚徒困境 / Prisoner's Dilemma
|
|
36
|
+
|
|
37
|
+
> 囚徒困境是博弈论最经典的范例:两个参与者各自有"合作"和"背叛"策略。背叛是占优策略,但(背叛, 背叛)是帕累托劣于(合作, 合作)——个体理性导致集体非理性。
|
|
38
|
+
|
|
39
|
+
**支付矩阵**:
|
|
40
|
+
|
|
41
|
+
| | 合作 (C) | 背叛 (D) |
|
|
42
|
+
|---|---|---|
|
|
43
|
+
| 合作 (C) | (3, 3) | (0, 5) |
|
|
44
|
+
| 背叛 (D) | (5, 0) | (1, 1) |
|
|
45
|
+
|
|
46
|
+
严格占优策略分析:对每个参与者,背叛严格优于合作($5 > 3$ 且 $1 > 0$)。唯一纳什均衡 (D, D) 支付 (1, 1),帕累托劣于 (C, C) 支付 (3, 3)。
|
|
47
|
+
|
|
48
|
+
**思想**:囚徒困境揭示了个体理性与集体理性的根本张力——纳什均衡不保证帕累托最优。此困境在现实中无处不在:军备竞赛、公地悲剧、价格战、碳排放。Axelrod(1984)的计算机竞赛表明:在重复囚徒困境中,"一报还一报"(Tit-for-Tat)策略可维持合作——重复互动改变均衡结构。
|
|
49
|
+
|
|
50
|
+
## 逆向归纳法与子博弈完美 / Backward Induction & Subgame Perfection
|
|
51
|
+
|
|
52
|
+
> 逆向归纳法(backward induction)是序列博弈的核心分析工具:从终端节点向前回溯,每步选择最优行动。Selten(1965)定义子博弈完美均衡(subgame perfect equilibrium, SPE):在每个子博弈上都构成纳什均衡的策略组合——排除基于不可信威胁的均衡。
|
|
53
|
+
|
|
54
|
+
**核心概念**:纳什均衡允许"不可信威胁"——参与者声称将采取某行动,但到达该节点时偏离更有利。SPE 要求均衡在每个子博弈上都成立,因此排除了不可信威胁。逆向归纳法是求解 SPE 的标准方法。
|
|
55
|
+
|
|
56
|
+
**思想**:序列博弈中,时间结构引入了承诺与可信性问题——"威胁"必须是理性的才有效。逆向归纳法将多阶段决策分解为单阶段子问题,与 Bellman 最优性原理一脉相承。数学背景:Zermelo(1913)的定理使用逆向归纳法,Selten(1965)将其系统化为 SPE 概念。Selten 与 Nash、Harsanyi 共获 1994 年诺贝尔经济学奖。
|
|
57
|
+
|
|
58
|
+
## Shapley 值与合作博弈 / Shapley Value & Cooperative Game Theory (1953)
|
|
59
|
+
|
|
60
|
+
> Shapley(1953)提出合作博弈中唯一满足效率、对称性、哑元性和可加性的分配规则——Shapley 值 $\phi_i(v)$。它按边际贡献的平均值分配联盟收益。
|
|
61
|
+
|
|
62
|
+
$$\phi_i(v) = \sum_{S \subseteq N \setminus \{i\}} \frac{|S|!(n - |S| - 1)!}{n!} [v(S \cup \{i\}) - v(S)]$$
|
|
63
|
+
|
|
64
|
+
Shapley 值是唯一满足以下四条公理的分配:
|
|
65
|
+
1. **效率性**:$\sum_i \phi_i(v) = v(N)$
|
|
66
|
+
2. **对称性**:若 $i$ 和 $j$ 在所有联盟中贡献相同,则 $\phi_i = \phi_j$
|
|
67
|
+
3. **哑元性**:若 $i$ 对所有联盟无边际贡献,则 $\phi_i = 0$
|
|
68
|
+
4. **可加性**:$\phi_i(v + w) = \phi_i(v) + \phi_i(w)$
|
|
69
|
+
|
|
70
|
+
**思想**:Shapley 值将"公平"转化为数学公理——公平不是主观判断,而是逻辑必然。合作博弈的核心问题:联盟产生的总收益如何分配?Shapley 值给出唯一满足公理的答案。核心(core)是另一种解概念——任何联盟的分配不低于其自身价值,但核心可能为空集。
|
|
71
|
+
|
|
72
|
+
## Nash 讨价还价解 / Nash Bargaining Solution (1950)
|
|
73
|
+
|
|
74
|
+
> Nash(1950)提出满足帕累托最优性、对称性、尺度无关性和独立性缩减的唯二讨价还价解。设威胁点 $d = (d_1, d_2)$,可行集 $S \subseteq \mathbb{R}^2$,Nash 解最大化 $(u_1 - d_1)(u_2 - d_2)$。
|
|
75
|
+
|
|
76
|
+
$$\max_{(u_1, u_2) \in S, u_i \geq d_i} (u_1 - d_1)(u_2 - d_2)$$
|
|
77
|
+
|
|
78
|
+
Nash 证明此解是满足四条公理的唯一分配。威胁点 $d$ 是谈判失败时各方的收益——威胁点越有利,谈判结果越有利。
|
|
79
|
+
|
|
80
|
+
**思想**:讨价还价问题将"谈判"转化为数学优化——在可行集和威胁点约束下最大化联合收益。Nash 解的对称性与帕累托最优性使其成为公平谈判的自然基准。数学背景:此模型将合作博弈与非合作博弈联系起来——Nash 程序(Nash program)主张所有合作博弈解都应通过非合作博弈模型推导。
|
|
81
|
+
|
|
82
|
+
## 演化博弈论 / Evolutionary Game Theory (Maynard Smith, 1973)
|
|
83
|
+
|
|
84
|
+
> Maynard Smith(1973)提出演化稳定策略(Evolutionarily Stable Strategy, ESS):策略 $\sigma^*$ 是 ESS,若对任何入侵策略 $\sigma \neq \sigma^*$,要么 $u(\sigma^*, \sigma^*) > u(\sigma, \sigma^*)$,要么 $u(\sigma^*, \sigma^*) = u(\sigma, \sigma^*)$ 且 $u(\sigma^*, \sigma) > u(\sigma, \sigma)$。
|
|
85
|
+
|
|
86
|
+
**核心定义**:ESS 是比纳什均衡更强的稳定性概念——不仅要"不被偏离",还要"不被入侵"。纳什均衡是 ESS 的必要条件,但 ESS 附加了稳定性要求。
|
|
87
|
+
|
|
88
|
+
**思想**:演化博弈论将博弈论从"理性选择"推广到"适应性动态"——参与者不必理性,只需在重复互动中调整策略。生物学应用:性别比例博弈、鹰鸽博弈(Hawk-Dove)、资源竞争。经济学应用:市场惯例的形成、技术标准的扩散。数学背景:ESS 与复制者动态(replicator dynamics)联系——ESS 是复制者动态的局部稳定点。
|
|
89
|
+
|
|
90
|
+
## Vickrey 拍卖与拍卖理论 / Vickrey Auction & Auction Theory (1961)
|
|
91
|
+
|
|
92
|
+
> Vickrey(1961)提出第二价格拍卖(second-price sealed-bid auction):出价最高者获胜,但支付第二高出价。报真实估值是占优策略——机制设计的奠基之作。
|
|
93
|
+
|
|
94
|
+
**核心定理**:在 Vickrey 拍卖中,报真实估值 $b_i = v_i$ 是每个投标者的弱占优策略。证明:设真实估值 $v_i$,第二高出价 $p$。若 $v_i > p$,报 $b_i = v_i$ 获胜支付 $p$,收益 $v_i - p > 0$;若 $b_i > v_i > p$ 同样获胜但收益不变;若 $b_i < v_i$ 可能失去正收益。因此如实报告最优。
|
|
95
|
+
|
|
96
|
+
Vickrey 证明了对称风险中性投标者,四种标准拍卖(英式、荷式、第一价格密封、第二价格密封)的期望收入相等——**收入等价定理(Revenue Equivalence Theorem)**。Milgrom & Weber(1982)推广到关联估值(affiliated values),发现英式拍卖收入最高。
|
|
97
|
+
|
|
98
|
+
**思想**:Vickrey 拍卖是激励相容(incentive-compatible)机制的典范——通过巧妙设计支付规则,使自利行为自动导向效率最优。拍卖理论将博弈论应用于市场设计:如何通过规则引导理性参与者产生最优结果?数学背景:Vickrey 共获 1996 年诺贝尔经济学奖。
|
|
99
|
+
|
|
100
|
+
## 机制设计 / Mechanism Design (Hurwicz, Myerson, Maskin — Nobel 2007)
|
|
101
|
+
|
|
102
|
+
> 机制设计是博弈论的"逆向工程"——给定目标结果,设计博弈规则使理性参与者的自利行为自动实现该目标。Hurwicz、Myerson、Maskin 因此获 2007 年诺贝尔经济学奖。
|
|
103
|
+
|
|
104
|
+
**核心概念**:
|
|
105
|
+
- **激励相容性(Incentive Compatibility)**:如实报告类型是均衡策略——参与者没有动机谎报
|
|
106
|
+
- **显示原理(Revelation Principle)**:任何贝叶斯博弈的均衡都可由直接机制实现——参与者如实报告类型即达均衡,无需复杂策略
|
|
107
|
+
- **Myerson 最优拍卖**:在独立私人估值模型下,最大化卖家期望收入的最优机制——虚拟估值 $v_i - (1 - F_i(v_i))/f_i(v_i)$ 最高者获胜
|
|
108
|
+
|
|
109
|
+
$$\text{Virtual valuation: } \varphi_i(v_i) = v_i - \frac{1 - F_i(v_i)}{f_i(v_i)}$$
|
|
110
|
+
|
|
111
|
+
- **Maskin 可实施性(Maskin Monotonicity)**:社会选择函数可被纳什实施的必要条件——偏好单调性
|
|
112
|
+
|
|
113
|
+
**思想**:机制设计回答"如何设计规则"而非"给定规则下如何行动"——从博弈的结果反推博弈的结构。显示原理简化了机制设计:只需考虑直接机制。激励相容性保证了规则与动机的一致——制度设计不是空想,而是可被数学验证的工程。数学背景:Hurwicz(1960s)引入激励相容性概念;Myerson(1981)发展最优拍卖理论;Maskin(1977/1999)发展纳什可实施性理论。
|
|
114
|
+
|
|
115
|
+
## 信号博弈 / Signaling Games (Spence, 1973)
|
|
116
|
+
|
|
117
|
+
> Spence(1973)提出信号传递模型:在信息不对称下,拥有私人信息的发送者通过可观察的行动(信号)向接收者传递信息。经典应用:教育作为能力信号——高能力者获得教育的成本更低,因此教育投资传递了能力信息。
|
|
118
|
+
|
|
119
|
+
**核心模型**:发送者有类型 $t \in \{H, L\}$(高/低能力),选择信号 $s \in \{e, 0\}$(受教育/不受教育),接收者观测 $s$ 后选择响应 $a$。分离均衡:$H$ 选 $e$,$L$ 选 $0$——信号完美传递类型。混同均衡:两者都选相同信号——信号无信息量。
|
|
120
|
+
|
|
121
|
+
**思想**:信号博弈揭示了信息传递的经济学——信号必须有成本差异才能传递信息(否则人人都会模仿)。Spence 模型中,教育的社会价值可能完全是信号价值而非生产力提升——这引发了关于教育本质的深刻讨论。Spence 共获 2001 年诺贝尔经济学奖。数学背景:信号博弈是贝叶斯博弈的子类——类型是私人信息,策略是类型依赖的。
|
|
122
|
+
|
|
123
|
+
## 重复博弈与 Folk 定理 / Repeated Games & Folk Theorem
|
|
124
|
+
|
|
125
|
+
> Folk 定理(民间定理,1970s 非正式流传,Aumann 1981 系统化):在无限重复博弈中,任何个体理性支付 $v_i \geq \min_{s_{-i}} \max_{s_i} u_i(s_i, s_{-i})$(minimax 支付)都可以作为子博弈完美均衡的平均支付被实现。
|
|
126
|
+
|
|
127
|
+
**核心定理**:设 $v = (v_1, \ldots, v_n)$ 为可行且个体理性的支付向量($v_i \geq \underline{v}_i$,$\underline{v}_i$ 为 $i$ 的 minimax 值),则在贴现因子 $\delta$ 足够接近 1 时,$v$ 可作为无限重复博弈的子博弈完美均衡的平均支付被实现。
|
|
128
|
+
|
|
129
|
+
实现机制:惩罚策略(punishment strategy)——偏离者将被"惩罚"回 minimax 支付水平,偏离的短期收益被长期惩罚抵消。
|
|
130
|
+
|
|
131
|
+
**思想**:Folk 定理是重复博弈的核心结果——它解释了为什么合作在长期互动中可能维持:偏离的短期收益小于长期惩罚的损失。此定理也解释了为什么重复博弈有无数个均衡——几乎任何可行支付都可被实现。Aumann(2005 年诺贝尔奖)系统化了此理论。数学背景:贴现因子 $\delta$ 趋近 1 使得未来惩罚足够重——$\delta \geq \frac{g}{g + l}$,$g$ 为偏离收益,$l$ 为惩罚损失。
|