math-skill 1.0.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (55) hide show
  1. package/LICENSE +21 -0
  2. package/README.md +278 -0
  3. package/agents/math-critic.md +203 -0
  4. package/commands/abstraction.md +34 -0
  5. package/commands/algorithmic-thinking.md +34 -0
  6. package/commands/ask.md +21 -0
  7. package/commands/axiomatization.md +34 -0
  8. package/commands/causal-inference.md +34 -0
  9. package/commands/discrete-combinatorial.md +34 -0
  10. package/commands/game-theory.md +34 -0
  11. package/commands/induction-analogy.md +34 -0
  12. package/commands/information-theory.md +34 -0
  13. package/commands/logic-deduction.md +34 -0
  14. package/commands/modeling.md +37 -0
  15. package/commands/optimization.md +33 -0
  16. package/commands/probability-statistics.md +36 -0
  17. package/commands/symmetry-invariance.md +34 -0
  18. package/commands/topological-thinking.md +33 -0
  19. package/commands/transformation.md +33 -0
  20. package/docs/CLAUDE.md +187 -0
  21. package/docs/inspiration.md +113 -0
  22. package/knowledge-base/overview.md +230 -0
  23. package/package.json +60 -0
  24. package/skills/abstraction/SKILL.md +264 -0
  25. package/skills/abstraction/original-texts.md +175 -0
  26. package/skills/algorithmic-thinking/SKILL.md +371 -0
  27. package/skills/algorithmic-thinking/original-texts.md +256 -0
  28. package/skills/axiomatization/SKILL.md +213 -0
  29. package/skills/axiomatization/original-texts.md +160 -0
  30. package/skills/causal-inference/SKILL.md +374 -0
  31. package/skills/causal-inference/original-texts.md +167 -0
  32. package/skills/discrete-combinatorial/SKILL.md +286 -0
  33. package/skills/discrete-combinatorial/original-texts.md +185 -0
  34. package/skills/game-theory/SKILL.md +318 -0
  35. package/skills/game-theory/original-texts.md +131 -0
  36. package/skills/induction-analogy/SKILL.md +310 -0
  37. package/skills/induction-analogy/original-texts.md +154 -0
  38. package/skills/information-theory/SKILL.md +242 -0
  39. package/skills/information-theory/original-texts.md +127 -0
  40. package/skills/logic-deduction/SKILL.md +280 -0
  41. package/skills/logic-deduction/original-texts.md +173 -0
  42. package/skills/meta-selector/SKILL.md +188 -0
  43. package/skills/meta-selector/original-texts.md +105 -0
  44. package/skills/modeling/SKILL.md +318 -0
  45. package/skills/modeling/original-texts.md +165 -0
  46. package/skills/optimization/SKILL.md +292 -0
  47. package/skills/optimization/original-texts.md +168 -0
  48. package/skills/probability-statistics/SKILL.md +312 -0
  49. package/skills/probability-statistics/original-texts.md +193 -0
  50. package/skills/symmetry-invariance/SKILL.md +358 -0
  51. package/skills/symmetry-invariance/original-texts.md +221 -0
  52. package/skills/topological-thinking/SKILL.md +273 -0
  53. package/skills/topological-thinking/original-texts.md +164 -0
  54. package/skills/transformation/SKILL.md +264 -0
  55. package/skills/transformation/original-texts.md +216 -0
@@ -0,0 +1,312 @@
1
+ ---
2
+ name: probability-statistics
3
+ description: |
4
+ 科研模式触发:当需要进行统计分析、假设检验、回归建模、实验设计、因果推断、拟合优度检验时调用。
5
+ English (Research Mode): Trigger when needing statistical analysis, hypothesis testing, regression modeling, experimental design, causal inference, or goodness-of-fit testing.
6
+ 生活模式触发:当需要评估风险、解读新闻数据、在日常生活中面对不确定性决策、区分"看起来有效"和"真的有效"时调用。
7
+ English (Life Mode): Trigger when needing risk assessment, interpreting news data, evaluating uncertainty in daily decisions, or distinguishing "seems effective" from "actually effective."
8
+ ---
9
+
10
+ # 🎲 概率与统计
11
+
12
+ > "不确定性是可量化的——概率不只是数学公式,而是理解随机世界的方式。量化不确定性,从数据中提取规律,做出理性的推断和决策。"
13
+ > "Uncertainty is quantifiable—probability is not just a mathematical formula, but a way to understand the random world. Quantifying uncertainty, extracting patterns from data, and making rational inferences and decisions."
14
+ >
15
+ > —— 概率论、数理统计
16
+ > —— Probability Theory, Mathematical Statistics
17
+
18
+ ## 核心原则 / Core Principle
19
+
20
+ **世界充满不确定性。理性决策不是追求确定性(那几乎不存在),而是在不确定性中做出期望值最优的选择。概率是量化的信念,数据是量化的证据。**
21
+
22
+ **The world is full of uncertainty. Rational decision-making is not about pursuing certainty (which almost never exists), but about making choices with the best expected value under uncertainty. Probability is quantified belief, data is quantified evidence.**
23
+
24
+ > **数学形式化 / Mathematical Formalization**(科研模式参考)
25
+ >
26
+ > 概率论的根基是 Kolmogorov 公理体系——概率空间 (Ω, 𝔽, P) 由三元组定义:
27
+ >
28
+ > - **非负性公理**:P(A) ≥ 0,对 𝔽 中任意事件 A 成立
29
+ > - **规范性公理**:P(Ω) = 1,必然事件概率为 1
30
+ > - **可加性公理**:若 A₁, A₂, … 为 𝔽 中互不相交的可数事件族,则 P(∪ᵢ Aᵢ) = Σᵢ P(Aᵢ)(可数可加性)
31
+ >
32
+ > 三条公理推导出全部概率定理——互补律 P(Aᶜ) = 1 − P(A)、包含律 P(A∪B) = P(A) + P(B) − P(A∩B)、单调性 A ⊆ B ⇒ P(A) ≤ P(B)、全概率公式 P(B) = Σᵢ P(B|Aᵢ)P(Aᵢ)。Kolmogorov 公理是概率论的"欧几里得公理",一切统计方法的合法性最终回溯于此。
33
+
34
+ 概率思维的核心概念:
35
+ - **概率是信念的度量**:先验概率 → 新证据 → 后验概率(贝叶斯更新)
36
+ - **大数定律**:单次观察不可靠,大量观察才揭示真实规律;n → ∞ 时样本频率收敛于理论概率
37
+ - **期望值**:理性决策的依据是期望值 E[X] = Σx·P(x),不是最可能的结果
38
+ - **方差与风险**:期望值相同的情况下,Var(X) = E[(X−μ)²] 代表波动与风险
39
+ - **偏差-方差权衡**:模型复杂度 ↑ ⇒ 偏差 ↓、方差 ↑;总误差 = 偏差² + 方差 + 不可约噪声
40
+
41
+ > 详细数学依据见 `original-texts.md`
42
+
43
+ ## 不适用场景 / When NOT to Use
44
+
45
+ - **确定性问题**(已知答案或可通过演绎推理得到)——不需要概率工具 `[科研/通用/生活]`
46
+ - **样本量极小(n < 5)且无法增加**——统计推断需要足够的样本,此时应报告数据本身而非推断 `[科研]`
47
+ - **纯粹的定性描述需求**(如"解释一下这个概念")——不需要数据分析 `[科研/通用]`
48
+ - **因果机制已明确且无需概率建模**——直接使用确定性因果链即可 `[科研]`
49
+ - **数据完全缺失或严重损坏**——无法进行任何有意义的统计操作 `[科研/通用]`
50
+ - **直觉已足够且决策后果极低**——不需要量化分析,直接凭经验判断即可 `[生活]`
51
+ - **情绪驱动决策而非理性决策**——概率工具无法帮助非理性情境 `[生活]`
52
+
53
+ ## 何时使用 / When to Use
54
+
55
+ ### 科研触发条件 / Research Mode Triggers
56
+
57
+ - 阅读论文时,审查其统计方法是否正确、结论是否显著
58
+ - 实验数据分析、结果显著性检验、效应量评估
59
+ - 回归建模与预测(线性回归、逻辑回归、模型选择)
60
+ - 实验设计与功效分析(随机化、区组化、因子设计)
61
+ - 因果推断(从观测数据识别因果效应,DAG + 后门准则)
62
+ - 拟合优度检验与方差比较(χ² 检验、F 检验)
63
+ - 贝叶斯推断与先验-后验更新
64
+
65
+ ### 生活触发条件 / Life Mode Triggers
66
+
67
+ - 解读新闻或报告中的统计数据,识别统计谬误("某产品疗效显著"——真的是显著吗?)
68
+ - 评估风险(投资风险、健康风险、决策风险)——"这个选择的风险有多大?"
69
+ - 避免认知偏差(幸存者偏差、确认偏差、基础率忽视)——"我是否只看到了成功的案例?"
70
+ - 在日常生活中做出概率性决策——"要不要买保险?要不要等下去?"
71
+ - 区分"看起来有效"和"真的有效"——"这个方法真的有用,还是只是碰巧?"
72
+ - 面对不确定性时需要理性判断而非直觉——"我有多大把握?还剩多少不确定?"
73
+
74
+ ## 方法流程 / Method
75
+
76
+ ### 第一步:定义随机现象 / Define the Random Phenomenon
77
+
78
+ **科研模式:**
79
+ 明确:
80
+ - **随机变量 X**是什么?(你要测量的量)
81
+ - **样本空间 Ω**是什么?(所有可能结果的集合)
82
+ - **事件域 𝔽**:Ω 的哪些子集可被赋予概率?(满足 σ-代数条件:含 Ω、对补封闭、对可数并封闭)
83
+ - 随机变量是**离散的**还是**连续的**?
84
+ - **概率测度 P**:Ω → [0,1] 的映射,满足 Kolmogorov 三公理
85
+
86
+ **生活模式:**
87
+ 你面对的不确定性是什么?是"不知道结果会怎样"还是"不知道概率有多大"?
88
+ - 明确你真正关心的问题——不是"会不会发生",而是"发生的可能性有多大"
89
+ - 区分两种不确定性:结果不确定(不知道会怎样)和概率不确定(不知道可能性多大)
90
+ - 把模糊的担忧转化为可思考的问题:"我担心的是A还是B?"
91
+
92
+ **共通要点:** 无论科研还是生活,第一步都是把模糊的不确定性变成清晰的可量化问题。
93
+
94
+ ### 第二步:选择概率模型 / Choose the Probability Model
95
+
96
+ **科研模式:**
97
+
98
+ 根据现象的性质选择合适的分布:
99
+
100
+ | 分布 / Distribution | 适用场景 / Use Case | 关键参数 / Key Parameters |
101
+ |---|---|---|
102
+ | 二项分布 Binomial | N 次独立伯努利试验中成功次数 | n(试验数),p(成功概率) |
103
+ | 泊松分布 Poisson | 单位时间/空间内稀有事件发生次数 | λ(平均发生率) |
104
+ | 正态分布 Normal | 大量独立小因素叠加(中心极限定理) | μ(均值),σ²(方差) |
105
+ | 指数分布 Exponential | 等待时间、无记忆性 P(X>t+s|X>s)=P(X>t) | λ(速率) |
106
+ | 贝叶斯模型 Bayesian | 先验 + 似然 → 后验,逐步更新信念 | 先验参数,似然函数 |
107
+ | t-分布 Student's t | 小样本均值推断(Student 1908),尾部比正态厚 | df = n − 1(自由度) |
108
+ | χ²-分布 Chi-squared | 拟合优度检验、列联表分析、方差估计 | df(自由度) |
109
+ | F-分布 F | 比较两组方差、ANOVA 方差分析 | df₁, df₂(两个自由度) |
110
+ | 均匀分布 Uniform | 等概率事件、随机数生成、无先验信息时的默认 | a, b(区间端点) |
111
+
112
+ 选择原则:数据类型(离散/连续)、样本量(大样本趋正态,小样本用 t)、物理机制(泊松对应稀有独立事件、指数对应等待时间)。
113
+
114
+ **生活模式:**
115
+ 你对这个不确定性的了解有多少?是"完全不了解"、"知道大致范围"还是"有历史数据可参考"?
116
+ - **完全不了解** → 默认均匀分布(不做任何假设,所有结果等可能)
117
+ - **知道大致范围** → 用范围约束缩小可能性(比如"大概在10%到30%之间")
118
+ - **有历史数据可参考** → 用历史频率作为先验估计,但要警惕数据是否有偏
119
+
120
+ **共通要点:** 模型选择本质上是对已知信息的编码——你知道多少,模型就反映多少;不知道的就留为不确定性。
121
+
122
+ ### 第三步:收集数据 / Collect Data
123
+
124
+ **科研模式:**
125
+ - 样本量是否足够?(小样本的推断不可靠;功效分析确定最小 n)
126
+ - 样本是否有偏?(选择偏差、幸存者偏差、自愿响应偏差)
127
+ - 数据质量如何?(测量误差、缺失值、异常值检测)
128
+ - 收集方式是否随机化?(随机抽样 vs 方便抽样)
129
+ - 是否存在区组结构?(区组化可减少混杂变异)
130
+
131
+ **生活模式:**
132
+ 你能获取什么信息来减少不确定性?信息的质量比数量更重要——少量高质量信息优于大量低质量数据。
133
+ - 区分"看起来很多的数据"和"真正有用的信息"——10个朋友的经验 ≠ 科学证据
134
+ - 检查信息来源是否有偏——只看好评不算客观评估
135
+ - 优先寻找反面证据——确认偏差会让你只注意到支持自己观点的信息
136
+ - 一条可靠的专业意见可能胜过一百条网络评论
137
+
138
+ **共通要点:** 数据的代表性比数据量更重要。有偏的大样本比无偏的小样本更危险,因为它给你"假信心"。
139
+
140
+ ### 第四步:统计推断 / Statistical Inference
141
+
142
+ **科研模式:**
143
+ - **点估计**:用样本统计量估计总体参数(样本均值 x̄ → μ)
144
+ - **最大似然估计 MLE**:选择使似然函数 L(θ; x) = f(x|θ) 最大的 θ̂ = argmax_θ L(θ; x);大样本下 MLE 渐近正态、渐近有效
145
+ - **置信区间**:以指定置信水平(如 95%)给出参数的区间估计;频率学派解释:重复抽样时 95% 的区间包含真实参数
146
+ - **假设检验**:H₀ vs H₁,p-value = P(观察到此数据或更极端 | H₀);p < α 则拒绝 H₀
147
+ - **贝叶斯更新**:后验 P(θ|D) = P(D|θ)·P(θ)/P(D);先验 → 似然 → 后验,后验再遇新数据成为新先验
148
+
149
+ **生活模式:**
150
+ 从已有信息中能得出什么结论?结论有多可靠?——区分"看起来有效"和"真的有效"。
151
+ - **先看基础概率**:这件事在一般情况下的发生率是多少?(基率/Base Rate)
152
+ - **再看新证据**:新信息让概率变大了还是变小了?变了多少?
153
+ - **判断可靠性**:结论是基于充分数据还是少量例子?3个成功案例不等于普遍规律
154
+ - **警惕假阳性**:如果基础概率很低,即使检测准确率很高,阳性结果也可能是假的
155
+
156
+ **共通要点:** 推断的核心是从有限信息推断整体规律——但推断永远有不确定性,关键是量化这个不确定性而非忽略它。
157
+
158
+ ### 第五步:回归建模 / Regression Modeling
159
+
160
+ **科研模式:**
161
+ - **线性回归**:Y = β₀ + β₁X + ε,ε ~ N(0, σ²);最小二乘估计 β̂ = (XᵀX)⁻¹XᵀY;假设:线性、独立、同方差、正态残差
162
+ - **多元线性回归**:Y = β₀ + β₁X₁ + … + βₖXₖ + ε;控制多个解释变量
163
+ - **逻辑回归**:P(Y=1|X) = 1/(1+e^(−(β₀+β₁X)));二分类问题,用最大似然估计,输出概率而非类别
164
+ - **模型选择**:AIC = −2lnL + 2k(偏重拟合,适合预测),BIC = −2lnL + k·ln(n)(偏重简约,适合解释),调整 R² = 1 − (1−R²)(n−1)/(n−k−1)
165
+ - **偏差-方差权衡**:总误差 = 偏差² + 方差 + σ²(不可约误差);交叉验证选择最优复杂度
166
+
167
+ **生活模式:**
168
+ 哪些因素真正影响结果?它们的影响力有多大?——不是所有看起来相关的因素都是真正的原因。
169
+ - **列出所有可能因素**:哪些东西可能影响结果?
170
+ - **区分相关和因果**:冬天穿厚衣服和感冒同时发生,但穿厚衣服不是感冒的原因
171
+ - **关注影响力大小**:有些因素看起来有关但影响极小,不值得关注
172
+ - **警惕混杂因素**:可能有一个隐藏的第三因素同时影响了两件事
173
+
174
+ **共通要点:** 回归的本质是"因素分析"——哪些变量真正驱动了结果,以及每个变量的贡献有多大。
175
+
176
+ ### 第六步:实验设计 / Experimental Design
177
+
178
+ **科研模式:**
179
+ - **随机化 Randomization**:随机分配处理,消除系统偏差;使处理组与对照组在所有变量(已知与未知)上期望相等
180
+ - **区组化 Blocking**:将相似单元分组(如同年龄段、同地区),区组内比较减少混杂变异
181
+ - **样本量与功效分析 Power Analysis**:功效 Power = 1 − β = P(拒绝 H₀ | H₁ 为真);给定效应量 δ、显著性水平 α,计算所需最小样本量 n;低功效 = 高假阴性风险
182
+ - **因子设计 Factorial Designs**:2ᵏ 设计同时研究 k 个因素及交互效应;比逐因素实验更高效,能发现交互作用
183
+
184
+ **生活模式:**
185
+ 如何验证你的判断?有没有办法做一个小测试来确认结论?
186
+ - **小规模试验**:在做大决定前,先小范围试一下——换工作前先去面试了解情况
187
+ - **对比思考**:如果我做了A和没做A,结果会有什么不同?
188
+ - **避免自证循环**:验证时不要只寻找支持自己判断的证据,也要找反面证据
189
+ - **控制条件**:尽量在相似条件下比较,否则差异可能来自条件不同而非你的判断
190
+
191
+ **共通要点:** 实验设计的本质是"公平对比"——确保你看到的差异真的来自你想测试的原因,而不是其他干扰因素。
192
+
193
+ ### 第七步:因果推理 / Causal Inference
194
+
195
+ **科研模式:**
196
+ - **混淆变量 Confounders**:同时影响处理 X 和结果 Y 的变量 Z,使 P(Y|X) ≠ P(Y|do(X));不调整混淆则效应估计有偏
197
+ - **DAG 有向无环图**:可视化因果结构,节点=变量,箭头=直接因果;识别混淆路径(后门路径)、中介路径
198
+ - **do-演算 do-calculus**:Pearl 的干预算子,P(Y|do(X)) 表示"强制设定 X 时 Y 的概率",区别于观察性 P(Y|X)
199
+ - **后门准则 Back-door Criterion**:若存在变量集 S 使得:(1) S 阻断 X→Y 的所有后门路径,(2) S 不包含 X 的后代,则调整 S 可得到因果效应 P(Y|do(X)) = Σₛ P(Y|X,S=s)·P(S=s)
200
+ - **随机化作为黄金标准**:随机实验直接阻断所有后门路径,无需识别混淆变量;无法随机化时依赖 DAG + 后门准则
201
+
202
+ **生活模式:**
203
+ 这件事真的是因果关系还是恰好同时发生?——区分"因为"和"碰巧"。
204
+ - **问三个问题**:(1) 有没有合理的机制解释A导致B?(2) 如果A不发生,B还会发生吗?(3) 是否有第三因素同时导致A和B?
205
+ - **常见伪因果**:早起的人更成功 → 但可能是自律这个第三因素同时导致早起和成功
206
+ - **反向因果**:是A导致B,还是B导致A?——健康的人运动多,但也是运动让人健康
207
+ - **纯巧合**:两件事恰好一起变化,但毫无因果联系——任何足够大的数据集都能找到"显著相关"
208
+
209
+ **共通要点:** 因果推理是最难也最重要的推理——相关容易发现,因果需要额外证据(机制、反事实、控制实验)。
210
+
211
+ ### 第八步:解释结果 / Interpret Results
212
+
213
+ **科研模式:**
214
+ - 区分**统计显著**与**实际显著**(p < 0.05 不等于效应大;大样本下微小差异也能"显著")
215
+ - **效应量 Effect Size**:Cohen's d = (μ₁−μ₂)/σ(标准化均值差);odds ratio = (P₁/(1−P₁))/(P₂/(1−P₂));不报告效应量的显著性检验是无意义的
216
+ - 注意**相关不等于因果**——关联 P(Y|X) ≠ 因果 P(Y|do(X)),除非消除了混淆
217
+ - 考虑**多重比较问题**——m 个独立检验,期望假阳性 = m·α;需 Bonferroni 或 BH-FDR 校正
218
+
219
+ **生活模式:**
220
+ 结论对你意味着什么?是"大概率如此"还是"可能如此但不确定"?——把统计结论翻译为实际决策。
221
+ - **翻译概率**:30%的概率不是"大概不会"——意味着每10次就有3次会发生
222
+ - **关注实际影响**:即使概率低,如果后果严重(比如严重疾病),也需要认真对待
223
+ - **区分"显著"和"重要"**:新闻说"显著提升15%"——但基数可能很小,15%的实际影响微乎其微
224
+ - **考虑个人情况**:群体统计不等于个人概率——"平均寿命80"不代表你能活到80
225
+
226
+ **共通要点:** 解释的核心是"翻译"——把数学语言翻译为决策语言,把统计结论翻译为实际含义。
227
+
228
+ ### 第九步:量化不确定性 / Quantify Uncertainty
229
+
230
+ **科研模式:**
231
+ - 给出估计的**置信区间**(频率学派:重复抽样覆盖率)或**可信区间**(贝叶斯:参数在此区间的概率)
232
+ - 区分两种区间解释:频率学派 CI = "如果重复实验,95% 的区间包含真值";贝叶斯 CrI = "参数在此区间的概率为 95%"
233
+ - 说明结论的可靠性程度和统计功效
234
+ - 识别剩余的不确定性来源(模型假设、测量误差、未观测混淆)
235
+ - 报告效应量的置信区间,而非仅报告点估计
236
+
237
+ **生活模式:**
238
+ 还有多少不确定?我该留多大余地?——决策时为不确定性预留缓冲空间。
239
+ - **坦诚不确定**:与其假装确定然后出错,不如承认不确定并做好准备
240
+ - **留缓冲空间**:如果估计需要5天完成,计划7天;如果估计花费1000元,预算1200元
241
+ - **区分信心等级**:90%把握的行动和60%把握的行动应该有不同的决策策略
242
+ - **准备B计划**:当主要判断出错时,有没有备用方案?——不确定性的最佳应对不是追求确定,而是为多种可能性做准备
243
+
244
+ **共通要点:** 不确定性不是弱点,而是现实——承认并量化不确定性比假装它不存在更理性。
245
+
246
+ ## 常见错误 / Common Errors
247
+
248
+ | 错误 / Error | 数学批评 / Mathematical Critique | 正确做法 / Correct Approach | 标签 |
249
+ |---|---|---|---|
250
+ | 把 p-value 当真理 | p = 0.05 不表示"有 95% 的把握",而是在 H₀ 下观察到该数据或更极端的概率 | 理解 p-value 的真正含义:P(数据或更极端 | H₀) | `[科研/通用]` |
251
+ | 混淆概率与频率 | 概率是理论值 P(A),频率是经验值 f(A)/n;两者仅在大数定律下收敛 | 用大数定律连接两者:n→∞ 时 f/n → P | `[科研]` |
252
+ | 忽视先验概率 | 基础率忽视:只看新证据,不看基础概率;罕见病检验中尤其危险 | 贝叶斯公式:P(H|E) = P(E|H)·P(H)/P(E) | `[科研/通用/生活]` |
253
+ | 幸存者偏差 | 只看到成功者,没看到失败者;样本空间被截断 | 考虑完整样本空间 Ω,包括失败样本 | `[科研/通用/生活]` |
254
+ | 小样本陷阱 | n = 3 的"规律"不可信;小样本方差估计不稳定 | 检查样本量,计算统计功效,用 t 分布而非正态 | `[科研/通用]` |
255
+ | 相关当因果 | 两个变量相关 ≠ 一个导致另一个;P(Y|X) ≠ P(Y|do(X)) | 寻找混淆变量,用 DAG + 后门准则做因果推断 | `[科研/通用/生活]` |
256
+ | 赌徒谬误 | "已经连续 5 次正面了,下次该反面了"——每次独立事件 | 区分独立事件 P(第6次=H)=0.5 与依赖事件 | `[通用/生活]` |
257
+ | 忽视回归均值 | 极端表现后倾向于回归平均水平 E[X] | 用回归分析而非直觉判断趋势 | `[科研/通用]` |
258
+ | 小样本用正态而非 t 分布 | 当 n < 30 时,t 分布尾部更厚,正态近似低估不确定性;t 的置信区间更宽 | n < 30 必须用 t 分布,df = n − 1;n ≥ 30 时 t ≈ 正态 | `[科研]` |
259
+ | 混淆 AIC 与 BIC | AIC 惩罚 2k 偏重拟合,BIC 惩罚 k·ln(n) 偏重简约;n 大时 BIC 选更简模型 | 目标为预测用 AIC,目标为解释用 BIC;两者矛盾时需进一步分析 | `[科研]` |
260
+ | 观测数据推断因果 | 无随机化时,混淆变量无法消除;P(Y|X) ≠ P(Y|do(X)),效应估计有偏 | 用 DAG + 后门准则调整混淆集,或承认仅能推断关联而非因果 | `[科研]` |
261
+ | 忽略多重比较校正 | m 个独立检验,期望假阳性 = m·α;α=0.05, m=20 → 期望 1 个假阳性 | Bonferroni:α_adj = α/m;BH-FDR 控制假发现率,更温和 | `[科研]` |
262
+ | 忽略统计 power 与效应量 | 低 power 实验:即使真实效应存在也可能不显著;只报告 p 不报告效应量 | 设计前计算所需样本量,报告效应量 Cohen's d 或 odds ratio | `[科研]` |
263
+ | 把小样本结论当定论 | 3个人的经验不等于普遍规律;少量案例不能代表总体 | 区分"有趣的现象"和"已被验证的规律"——小样本结论需要更多验证 | `[生活]` |
264
+ | 忽视基率(不考虑背景概率) | 不考虑背景概率就判断可能性——"检测阳性就一定是患病"忽略罕见病的低基率 | 先看背景概率再看新证据:P(H|E) = P(E|H)·P(H)/P(E),基率 P(H) 不可忽略 | `[生活]` |
265
+ | 混淆"看起来有效"和"真的有效" | 只看结果不看对比——"用了这个方法后变好了"可能只是自然恢复或回归均值 | 需要对比组:没用这个方法的人也变好了吗?区分随机波动和真实效应 | `[生活]` |
266
+
267
+ ## 操作规程 / Operating Procedure
268
+
269
+ 当本 skill 被触发时,首先确定模式:
270
+
271
+ **模式选择器 / Mode Selector:**
272
+ - 如果任务涉及统计分析、假设检验、回归建模、实验设计、因果推断 → **科研模式**
273
+ - 如果任务涉及风险评估、解读新闻数据、日常不确定性决策 → **生活模式**
274
+ - 如果任务同时涉及两者 → **混合模式**(科研模式为主,辅以生活模式解读)
275
+
276
+ ---
277
+
278
+ ### 科研模式输出格式 / Research Mode Output Format
279
+
280
+ 1. **随机变量定义**:明确 `[变量]: [含义] [类型: 离散/连续]`,指定样本空间 Ω 和事件域 𝔽
281
+ 2. **概率模型**:说明使用的分布及理由 `[分布]: [选择] 因为 [理由]`,注明自由度 df 或关键参数
282
+ 3. **数据评估**:`[样本量]: N, [偏差检查]: [结果], [质量]: [评估], [收集方式]: [随机/方便]`
283
+ 4. **统计推断结果**:`[估计值]: [θ̂], [置信区间]: [a, b], [p-value]: [值], [估计方法]: [MLE/Bayesian]`
284
+ 5. **回归建模(如适用)**:`[模型]: [线性/逻辑], [系数]: [β̂], [选择准则]: [AIC/BIC值], [R²]: [值]`
285
+ 6. **实验设计评估(如适用)**:`[设计]: [随机化/区组/因子], [功效]: [Power值], [最小样本量]: [n]`
286
+ 7. **因果评估(如适用)**:`[DAG]: [路径图], [混淆变量]: [列表], [调整集]: [S], [因果效应]: [P(Y|do(X))]`
287
+ 8. **偏差检查**:逐一检查常见统计谬误(表中所列 16 项),标注 `✅ 无此问题` 或 `⚠️ 发现 [具体问题]`
288
+ 9. **效应量与不确定性**:报告效应量 Cohen's d / odds ratio 及其置信区间,注明统计功效和剩余不确定性
289
+
290
+ **科研模式输出必须包含以上 9 项,不得只输出分析性文字而不给出结论。**
291
+
292
+ ---
293
+
294
+ ### 生活模式输出格式 / Life Mode Output Format
295
+
296
+ 1. **[不确定性]:[描述]** — 你面对的不确定性是什么
297
+ 2. **[已知信息]:[列表]** — 你对这件事了解多少,信息质量如何
298
+ 3. **[大概率结论]:[判断]** — 基于现有信息最可能的结论是什么
299
+ 4. **[不确定性余量]:[评估]** — 结论有多可靠,还剩多少不确定
300
+ 5. **[验证方式]:[建议]** — 如何进一步验证这个结论
301
+ 6. **[行动建议]:[步骤]** — 在当前不确定性下最务实的行动方案
302
+
303
+ **生活模式输出必须包含以上 6 项,语言应避免专业术语,用日常类比和具体例子解释概率与不确定性。**
304
+
305
+ ## 与其他 skill 的关系 / Relations to Other Skills
306
+
307
+ - **建模思想**:概率模型是建模的重要工具——不确定性需要概率框架
308
+ - **优化思想**:在不确定性下的优化需要期望值优化或鲁棒优化
309
+ - **归纳与类比**:从数据中发现规律本质上是归纳推理的概率版本
310
+ - **逻辑演绎**:经典逻辑是确定性的,概率逻辑是不确定性的推广
311
+ - **因果推断思想**:因果与统计的根本区分——P(Y|X) 是统计关联,P(Y|do(X)) 是因果效应;因果需要机制假设(DAG),不能纯靠数据得出;统计方法只能发现关联,因果推断思想提供从关联到因果的推理框架
312
+ - **信息论思想**:熵 H(X) = −ΣP(x)lnP(x) 量化随机变量的不确定性;信息增益 I(X;Y) = H(X) − H(X|Y) 衡量一个变量对另一个的减少不确定性能力;最大熵原则:在约束下选择使熵最大的分布(最少假设)
@@ -0,0 +1,193 @@
1
+ # 数学出处与经典文献 / Mathematical Sources and Classic Texts
2
+
3
+ ## 贝叶斯定理 / Bayes' Theorem (Bayes, 1763)
4
+
5
+ > P(H|E) = P(E|H) × P(H) / P(E)
6
+ >
7
+ > 后验概率 = 似然 × 先验概率 / 证据
8
+
9
+ **含义**:当我们观察到新证据 E 时,我们关于假设 H 的信念从先验 P(H) 更新为后验 P(H|E)。
10
+
11
+ **贝叶斯思维的核心**:
12
+ 1. 先有信念(先验概率)
13
+ 2. 观察数据(证据)
14
+ 3. 更新信念(后验概率)
15
+ 4. 重复这个过程
16
+
17
+ **数学背景**:Thomas Bayes 的论文 "An Essay towards solving a Problem in the Doctrine of Chances" 于 1763 年由 Richard Price 代为发表。贝叶斯定理本质上是条件概率的定义 P(A∩B) = P(A|B)P(B) = P(B|A)P(A) 的重排,但其哲学意义远超数学本身——它为"从数据学习"提供了严格的数学框架。
18
+
19
+ ## 大数定律 / Law of Large Numbers (Bernoulli, 1713)
20
+
21
+ > 当试验次数 n 趋于无穷时,样本均值依概率收敛于期望值。
22
+ > As the number of trials n approaches infinity, the sample mean converges in probability to the expected value.
23
+
24
+ **含义**:单次观察不可赖,但大量观察会揭示真实规律。这是统计推断的理论基础。
25
+
26
+ **数学背景**:Jacob Bernoulli 在《Ars Conjectandi》(1713) 中证明了弱大数定律:对任意 ε>0, P(|X̄ₙ - μ| ≥ ε) → 0。Borel (1909) 与 Kolmogorov 进一步强化为强大数定律——几乎必然收敛:P(lim X̄ₙ = μ) = 1。
27
+
28
+ ## 中心极限定理 / Central Limit Theorem (De Moivre-Laplace, 1733–Lindeberg-Feller, 20世纪)
29
+
30
+ > 大量独立同分布随机变量的和近似服从正态分布,无论原始分布是什么。
31
+ > The sum of a large number of i.i.d. random variables is approximately normally distributed, regardless of the original distribution.
32
+
33
+ **含义**:正态分布之所以普遍,是因为它是"大量小因素叠加"的自然结果。
34
+
35
+ **数学背景**:De Moivre (1733) 首先发现二项分布的正态近似;Laplace (1810) 推广到一般情形。Lindeberg-Feller 条件给出最精确的独立但非同分布情形的收敛条件。Lyapunov (1901) 引入特征函数证明方法,成为现代概率论的核心工具。
36
+
37
+ ## Kolmogorov 公理化体系 / Kolmogorov Axioms (1933)
38
+
39
+ > 概率论的基础公理:
40
+ > 1. 非负性:P(A) ≥ 0
41
+ > 2. 规范性:P(Ω) = 1
42
+ > 3. 可加性:若 A₁, A₂, ... 互不相交,则 P(∪Aₖ) = ΣP(Aₖ)
43
+
44
+ **含义**:概率被定义为测度——概率论从此成为严格的数学分支,而非经验规则集合。
45
+
46
+ **数学背景**:Andrey Kolmogorov 在《Grundbegriffe der Wahrscheinlichkeitsrechnung》(1933) 中将概率论嵌入测度论框架 (Ω, F, P),即样本空间、事件域(σ-代数)与概率测度三元组。这一公理化使大数定律、条件概率、随机变量等概念获得精确定义,是现代概率论的基石。
47
+
48
+ ## Neyman-Pearson 检验理论 / Neyman-Pearson Lemma (1928/1933)
49
+
50
+ > 在给定显著性水平 α 下,似然比检验是最强大的检验:
51
+ > 拒绝 H₀ 当 L(x|H₁)/L(x|H₀) > k,其中 k 由 α 决定。
52
+
53
+ **含义**:统计检验不是主观判断,而是可以在"控制犯错概率"的前提下达到最优。
54
+
55
+ **数学背景**:Jerzy Neyman 与 Egon Pearson 在 1928–1933 年间系统化了假设检验理论,引入 Type I 错误(α,假阳性)与 Type II 错误(β,假阴性)、检验功效 (power = 1-β) 等概念。Neyman-Pearson 引理证明了简单假设 vs 简单假设情形下似然比检验的最优性。这一框架成为现代统计检验的标准范式。
56
+
57
+ ## Fisher 统计推断体系 / Fisher's Statistical Inference (1920s–1930s)
58
+
59
+ - **最大似然估计**:选择使观测数据出现概率最大的参数 θ̂ = argmax L(θ; x)
60
+ - **p-value**:在原假设为真的条件下,观察到当前或更极端数据的概率
61
+ - **显著性检验**:通过 p-value 判断是否拒绝原假设
62
+ - **充分性原则**:统计量 T(X) 是充分的,若 P(X|T) 不依赖于 θ
63
+
64
+ **数学背景**:R.A. Fisher 的贡献远不止 p-value。他提出一致性、有效性等估计量评价准则; Fisher 信息量 I(θ) = E[(∂log L/∂θ)²] 度量数据对参数的信息含量,与 Cramér-Rao 下界紧密关联:Var(θ̂) ≥ 1/I(θ)。
65
+
66
+ ## Fisher 实验设计 / Fisher's Experimental Design (1935)
67
+
68
+ > 随机化不是忽视因果,而是使因果推断成为可能。
69
+
70
+ **含义**:科学实验的可信度不来自"精密控制",而来自"随机分配"。
71
+
72
+ **数学背景**:Fisher 在《The Design of Experiments》(1935) 中提出三大原则——随机化 (randomization)、区组化 (blocking)、复因子设计 (factorial designs)。随机化使处理效应的估计免受系统偏差;区组化控制已知干扰变量;2²、2³ 等因子设计可同时估计多个主效应与交互效应,效率远超逐一试验。
73
+
74
+ ## Student t 分布 / Student's t-Distribution (Gosset, 1908)
75
+
76
+ > 当样本量 n 较小且总体标准差未知时:
77
+ > t = (X̄ - μ) / (S/√n),服从 t(n-1) 分布。
78
+
79
+ **含义**:小样本不能直接用正态近似——t 分布的尾部更厚,反映了估计标准差本身的不确定性。
80
+
81
+ **数学背景**:William Sealy Gosset 以 "Student" 为笔名在 1908 年发表此结果。他在 Guinness 啤酒厂工作,因保密要求无法署真名。t 分布是标准正态与 χ²/(n-1) 的比值分布,当 n→∞ 时趋于正态。Fisher (1925) 给出了严格证明并将其推广。
82
+
83
+ ## χ² 检验 / Chi-Squared Test (Karl Pearson, 1900)
84
+
85
+ > χ² = Σ(Oₖ - Eₖ)² / Eₖ,在原假设下近似服从 χ²(k-1-p) 分布。
86
+
87
+ **含义**:观测频率与期望频率之间的差异是否超过随机波动所能解释的范围?
88
+
89
+ **数学背景**:Karl Pearson 在 1900 年提出拟合优度检验,这是第一个正式的统计检验方法。自由度 = k-1-p(k 为类别数,p 为估计参数数)的修正由 Fisher (1922) 完成。χ² 检验在列联表独立性检验、分布拟合等领域广泛应用。
90
+
91
+ ## 回归与最小二乘法 / Regression and Least Squares (Legendre 1805, Gauss 1809)
92
+
93
+ > min Σ(yₖ - (a + bxₖ))² → 最小二乘估计 β̂ = (X'X)⁻¹X'y
94
+
95
+ **含义**:在所有拟合直线中,最小二乘使残差平方和最小;在正态误差假设下,它等价于最大似然估计。
96
+
97
+ **数学背景**:Legendre (1805) 首先发表最小二乘法;Gauss (1809) 声称自己早在 1795 年就已使用该方法,并给出正态误差假设下的概率论证。"回归"一词由 Galton (1886) 提出,研究身高代际回归现象。现代线性回归模型 Y = Xβ + ε 是统计建模的核心框架。
98
+
99
+ ## Markov 链 / Markov Chains (Markov, 1906)
100
+
101
+ > P(Xₙ₊₁ = j | Xₙ = i, Xₙ₋₁, ...) = P(Xₙ₊₁ = j | Xₙ = i)
102
+ >
103
+ > 未来只依赖现在,不依赖过去——无记忆性 (memoryless property)。
104
+
105
+ **含义**:许多真实过程具有"当前状态决定未来走向"的性质,历史细节可以忽略。
106
+
107
+ **数学背景**:Andrey Markov (1906) 通过研究普希金《叶甫盖尼·奥涅金》中元音/辅音序列,首次定义了 Markov 链。遍历定理保证:对不可约、非周期、正常返链,π(j) = lim P(Xₙ = j) 存在且为唯一平稳分布。Markov 链是 MCMC (Metropolis 1943, Hastings 1970, Gelfand-Smith 1990) 的理论基础,也支撑 Google PageRank (Brin-Page 1998)。
108
+
109
+ ## 随机过程 / Stochastic Processes (Brownian Motion, Wiener Process)
110
+
111
+ > W(t) 满足:(1) W(0)=0, (2) W(t)-W(s) ~ N(0, t-s), (3) 独立增量, (4) 连续路径
112
+
113
+ **含义**:布朗运动是微观随机涨落的宏观数学模型——从花粉运动到股价波动。
114
+
115
+ **数学背景**:Brown (1827) 观察花粉微粒的无规则运动;Bachelier (1900) 首先用其模型化股价;Wiener (1923) 给出严格数学构造。Itô (1944) 发展随机积分 dX = μdt + σdW 与 Itô 公式,成为金融数学 (Black-Scholes 1973) 与随机微分方程的理论基石。
116
+
117
+ ## Shannon 信息论 / Shannon Information Theory (1948)
118
+
119
+ > H(X) = -Σ p(x) log p(x) —— 熵,随机变量的不确定性度量
120
+ > I(X;Y) = H(X) - H(X|Y) —— 互信息,Y 对 X 提供的信息量
121
+ > C = max I(X;Y) —— 信道容量,可靠通信的速率上限
122
+
123
+ **含义**:信息可以被量化;通信的根本限制由数学定律决定,而非工程技术。
124
+
125
+ **数学背景**:Claude Shannon 在《A Mathematical Theory of Communication》(1948) 中创立信息论。信源编码定理:平均编码长度 ≥ H(X);信道编码定理:传输速率 R < C 时存在可靠编码。熵与概率的深层联系——H(X) = -E[log p(X)]——使信息论成为概率论的自然延伸。
126
+
127
+ ## Pearl 因果推断 / Pearl's Causal Inference (2000)
128
+
129
+ > 因果层级:
130
+ > 1. 关联 P(y|x) —— 看到
131
+ > 2. 干预 P(y|do(x)) —— 做
132
+ > 3. 反事实 P(yₓ|x', y') —— 想
133
+
134
+ **含义**:因果不是关联的强化版——"do(x)" 与 "observe x" 在数学上截然不同。
135
+
136
+ **数学背景**:Judea Pearl 在《Causality》(2000) 中用有向无环图 (DAG) 与 do-演算系统化了因果推断。do-演算三条规则允许在可观测变量间转换干预概率;前门/后门准则给出从观测数据计算因果效应的条件。因果推断回答"若我做了 x,y 会怎样",这超出了概率论本身的表达能力。
137
+
138
+ ## Bootstrap 方法 / Bootstrap (Efron, 1979)
139
+
140
+ > 从样本 X₁,...,Xₙ 中有放回抽样 B 次,得到 B 个 bootstrap 样本,
141
+ > 用 bootstrap 分布近似真实分布。
142
+
143
+ **含义**:当理论推导困难时,用数据自身模拟抽样过程——"用自己验证自己"。
144
+
145
+ **数学背景**:Bradley Efron (1979) 提出 bootstrap,其理论保证由 Bickel-Freedman (1981) 与 Singh (1981) 建立:在温和条件下,bootstrap 分布一致收敛于真实抽样分布。Bootstrap 可估计标准误、置信区间(百分位法/BCa 法)、p-value 等,是非参数推断的通用工具。
146
+
147
+ ## 贝叶斯学派 vs 频率学派 / Bayesian vs Frequentist Debate
148
+
149
+ > 贝叶斯:概率是信念度,参数 θ 是随机变量 → P(θ|data)
150
+ > 频率学派:概率是长期频率,参数 θ 是固定未知常 → 估计量 θ̂ 的抽样分布
151
+
152
+ **含义**:这不是技术分歧,而是"概率是什么"的哲学分歧。
153
+
154
+ **核心对比**:
155
+ - 贝叶斯:先验 + 似然 → 后验,天然适合序贯更新与小样本
156
+ - 频率学派:无偏性、一致性、功效,天然适合大规模可重复实验
157
+ - 实践中:贝叶斯方法在机器学习、因果推断中占优;频率方法在临床试验、质量控制中占优
158
+
159
+ **数学背景**:争论自 Laplace vs Fisher 延续至今。Jeffreys (1939) 提出无信息先验 p(θ) ∝ |I(θ)|^(1/2);de Finetti (1937) 证明主观概率的一致性等价于可加性;Bernardo-Smith (1994) 发展参考先验理论。
160
+
161
+ ## Monty Hall 问题 / Monty Hall Problem
162
+
163
+ > 三扇门,一扇有奖品。你选一扇,主持人打开另一扇空门。
164
+ > 问:你是否应该换门?答案是:换门胜率 2/3,不换 1/3。
165
+
166
+ **含义**:直觉在此失效——主持人的行为传递了信息(他不会打开有奖品的门)。
167
+
168
+ **数学背景**:此问题是贝叶斯思维的绝佳入门案例。用贝叶斯定理:P(奖品在剩余门|主持人打开空门) = 2/3,因为主持人选择性地避开奖品,这本身是信息。类似的结构出现在医疗诊断、法律推理中——"选择性观察"改变了概率。
169
+
170
+ ## 常见统计谬误与认知偏差
171
+
172
+ **幸存者偏差(Survivorship Bias)**:
173
+ 二战期间,军方统计返航飞机的弹孔分布,发现机翼上弹孔最多,建议加固机翼。统计学家 Abraham Wald 指出:应该加固没有弹孔的部位——因为被击中那些部位的飞机根本没飞回来。Wald 的洞察本质上是条件概率:我们观察到的数据是在"飞机返航"条件下的数据,而非全部数据。
174
+
175
+ **基础率忽视(Base Rate Neglect)**:
176
+ 某种罕见病发病率 0.1%,检测准确率 99%。如果检测为阳性,真正患病的概率是多少?
177
+ - 直觉回答:99%
178
+ - 贝叶斯计算:P(患病|阳性) = 0.99 × 0.001 / (0.99 × 0.001 + 0.01 × 0.999) ≈ 9%
179
+ - 先验概率(基础率)被直觉严重低估
180
+
181
+ **回归均值(Regression to the Mean)**:
182
+ 表现极好的个体在下次测量中倾向于更接近平均水平,不是因为"能力下降",而是极端表现部分来自运气。Galton (1886) 发现高个子父母的子女往往比父母矮——这不是"退化",而是统计规律。
183
+
184
+ ## 概率思维的日常生活价值
185
+
186
+ > "概率思维的核心不是计算精确概率,而是养成'在不确定性中思考'的习惯。"
187
+
188
+ - 不要被单个案例说服——考虑基础概率
189
+ - 新信息来了要更新信念——贝叶斯更新
190
+ - 区分信号和噪声——大数定律
191
+ - 警惕极端值——回归均值
192
+ - 区分"看到"与"做了"——因果层级(Pearl)
193
+ - 量化不确定性——熵与信息(Shannon)