math-skill 2.0.1 → 3.0.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (206) hide show
  1. package/README.en-US.md +167 -175
  2. package/README.md +167 -175
  3. package/agents/math-critic.en.md +235 -0
  4. package/agents/math-critic.md +10 -8
  5. package/commands/ask.md +3 -12
  6. package/design-patterns/attention/equivariant-attention.en.md +72 -0
  7. package/design-patterns/attention/equivariant-attention.md +72 -0
  8. package/design-patterns/attention/geometry-aware-attention.en.md +73 -0
  9. package/design-patterns/attention/geometry-aware-attention.md +72 -0
  10. package/design-patterns/attention/information-bottleneck-attention.en.md +72 -0
  11. package/design-patterns/attention/information-bottleneck-attention.md +72 -0
  12. package/design-patterns/attention/projection-attention.en.md +68 -0
  13. package/design-patterns/attention/projection-attention.md +68 -0
  14. package/design-patterns/attention/spectral-attention.en.md +71 -0
  15. package/design-patterns/attention/spectral-attention.md +71 -0
  16. package/design-patterns/compression/leverage-score-selection.en.md +71 -0
  17. package/design-patterns/compression/leverage-score-selection.md +71 -0
  18. package/design-patterns/compression/low-rank-kv-cache.en.md +60 -0
  19. package/design-patterns/compression/low-rank-kv-cache.md +60 -0
  20. package/design-patterns/compression/spectral-token-pruning.en.md +61 -0
  21. package/design-patterns/compression/spectral-token-pruning.md +61 -0
  22. package/design-patterns/compression/topology-preserving-compression.en.md +64 -0
  23. package/design-patterns/compression/topology-preserving-compression.md +64 -0
  24. package/design-patterns/loss/constraint-penalty.en.md +67 -0
  25. package/design-patterns/loss/constraint-penalty.md +78 -0
  26. package/design-patterns/loss/contrastive-loss.en.md +59 -0
  27. package/design-patterns/loss/contrastive-loss.md +68 -0
  28. package/design-patterns/loss/information-bottleneck-loss.en.md +69 -0
  29. package/design-patterns/loss/information-bottleneck-loss.md +74 -0
  30. package/design-patterns/loss/orthogonality-loss.en.md +56 -0
  31. package/design-patterns/loss/orthogonality-loss.md +60 -0
  32. package/design-patterns/loss/variational-loss.en.md +61 -0
  33. package/design-patterns/loss/variational-loss.md +71 -0
  34. package/design-patterns/representation/equivariant-split.en.md +87 -0
  35. package/design-patterns/representation/equivariant-split.md +89 -0
  36. package/design-patterns/representation/manifold-representation.en.md +85 -0
  37. package/design-patterns/representation/manifold-representation.md +87 -0
  38. package/design-patterns/representation/shared-private-decomposition.en.md +84 -0
  39. package/design-patterns/representation/shared-private-decomposition.md +86 -0
  40. package/design-patterns/representation/subspace-alignment.en.md +90 -0
  41. package/design-patterns/representation/subspace-alignment.md +92 -0
  42. package/design-patterns/routing/graph-routing.en.md +79 -0
  43. package/design-patterns/routing/graph-routing.md +81 -0
  44. package/design-patterns/routing/moe-routing.en.md +85 -0
  45. package/design-patterns/routing/moe-routing.md +87 -0
  46. package/design-patterns/routing/optimal-transport-routing.en.md +68 -0
  47. package/design-patterns/routing/optimal-transport-routing.md +72 -0
  48. package/design-patterns/routing/spectral-clustering-routing.en.md +88 -0
  49. package/design-patterns/routing/spectral-clustering-routing.md +90 -0
  50. package/knowledge-base/differential-geometry/connection.en.md +51 -0
  51. package/knowledge-base/differential-geometry/connection.md +51 -0
  52. package/knowledge-base/differential-geometry/curvature.en.md +49 -0
  53. package/knowledge-base/differential-geometry/curvature.md +49 -0
  54. package/knowledge-base/differential-geometry/geodesic.en.md +51 -0
  55. package/knowledge-base/differential-geometry/geodesic.md +51 -0
  56. package/knowledge-base/differential-geometry/manifold.en.md +47 -0
  57. package/knowledge-base/differential-geometry/manifold.md +47 -0
  58. package/knowledge-base/differential-geometry/metric-tensor.en.md +50 -0
  59. package/knowledge-base/differential-geometry/metric-tensor.md +50 -0
  60. package/knowledge-base/differential-geometry/tangent-space.en.md +48 -0
  61. package/knowledge-base/differential-geometry/tangent-space.md +48 -0
  62. package/knowledge-base/information-geometry/fisher-metric.en.md +56 -0
  63. package/knowledge-base/information-geometry/fisher-metric.md +56 -0
  64. package/knowledge-base/information-geometry/natural-gradient.en.md +54 -0
  65. package/knowledge-base/information-geometry/natural-gradient.md +54 -0
  66. package/knowledge-base/lie-theory/equivariance.en.md +54 -0
  67. package/knowledge-base/lie-theory/equivariance.md +54 -0
  68. package/knowledge-base/lie-theory/group-action.en.md +51 -0
  69. package/knowledge-base/lie-theory/group-action.md +51 -0
  70. package/knowledge-base/lie-theory/lie-algebra.en.md +51 -0
  71. package/knowledge-base/lie-theory/lie-algebra.md +51 -0
  72. package/knowledge-base/lie-theory/lie-group.en.md +51 -0
  73. package/knowledge-base/lie-theory/lie-group.md +51 -0
  74. package/knowledge-base/lie-theory/representation.en.md +52 -0
  75. package/knowledge-base/lie-theory/representation.md +52 -0
  76. package/knowledge-base/matrix-analysis/low-rank-approximation.en.md +49 -0
  77. package/knowledge-base/matrix-analysis/low-rank-approximation.md +49 -0
  78. package/knowledge-base/matrix-analysis/matrix-perturbation.en.md +49 -0
  79. package/knowledge-base/matrix-analysis/matrix-perturbation.md +49 -0
  80. package/knowledge-base/matrix-analysis/positive-semidefinite.en.md +50 -0
  81. package/knowledge-base/matrix-analysis/positive-semidefinite.md +50 -0
  82. package/knowledge-base/matrix-analysis/projection.en.md +47 -0
  83. package/knowledge-base/matrix-analysis/projection.md +47 -0
  84. package/knowledge-base/matrix-analysis/spectral-decomposition.en.md +48 -0
  85. package/knowledge-base/matrix-analysis/spectral-decomposition.md +48 -0
  86. package/knowledge-base/optimization/constrained-optimization.en.md +53 -0
  87. package/knowledge-base/optimization/constrained-optimization.md +53 -0
  88. package/knowledge-base/optimization/convex-optimization.en.md +50 -0
  89. package/knowledge-base/optimization/convex-optimization.md +50 -0
  90. package/knowledge-base/optimization/lagrangian-duality.en.md +50 -0
  91. package/knowledge-base/optimization/lagrangian-duality.md +50 -0
  92. package/knowledge-base/optimization/proximal-method.en.md +52 -0
  93. package/knowledge-base/optimization/proximal-method.md +52 -0
  94. package/knowledge-base/optimization/riemannian-optimization.en.md +51 -0
  95. package/knowledge-base/optimization/riemannian-optimization.md +51 -0
  96. package/knowledge-base/overview.en.md +39 -0
  97. package/knowledge-base/overview.md +29 -218
  98. package/knowledge-base/probability/concentration-inequality.en.md +45 -0
  99. package/knowledge-base/probability/concentration-inequality.md +45 -0
  100. package/knowledge-base/probability/entropy.en.md +47 -0
  101. package/knowledge-base/probability/entropy.md +47 -0
  102. package/knowledge-base/probability/fisher-information.en.md +48 -0
  103. package/knowledge-base/probability/fisher-information.md +48 -0
  104. package/knowledge-base/probability/information-bottleneck.en.md +49 -0
  105. package/knowledge-base/probability/information-bottleneck.md +49 -0
  106. package/knowledge-base/probability/kl-divergence.en.md +51 -0
  107. package/knowledge-base/probability/kl-divergence.md +51 -0
  108. package/knowledge-base/topology/euler-characteristic.en.md +54 -0
  109. package/knowledge-base/topology/euler-characteristic.md +54 -0
  110. package/knowledge-base/topology/fundamental-group.en.md +52 -0
  111. package/knowledge-base/topology/fundamental-group.md +52 -0
  112. package/knowledge-base/topology/persistent-homology.en.md +54 -0
  113. package/knowledge-base/topology/persistent-homology.md +54 -0
  114. package/lenses/algorithmic.en.md +49 -0
  115. package/lenses/algorithmic.md +49 -0
  116. package/lenses/axiomatization.en.md +48 -0
  117. package/lenses/axiomatization.md +48 -0
  118. package/lenses/categorical.en.md +48 -0
  119. package/lenses/categorical.md +48 -0
  120. package/lenses/causal.en.md +49 -0
  121. package/lenses/causal.md +49 -0
  122. package/lenses/duality.en.md +47 -0
  123. package/lenses/duality.md +47 -0
  124. package/lenses/game.en.md +50 -0
  125. package/lenses/game.md +50 -0
  126. package/lenses/geometric.en.md +53 -0
  127. package/lenses/geometric.md +53 -0
  128. package/lenses/local-to-global.en.md +52 -0
  129. package/lenses/local-to-global.md +52 -0
  130. package/lenses/perturbation.en.md +51 -0
  131. package/lenses/perturbation.md +51 -0
  132. package/lenses/probabilistic.en.md +48 -0
  133. package/lenses/probabilistic.md +48 -0
  134. package/lenses/projection.en.md +50 -0
  135. package/lenses/projection.md +50 -0
  136. package/lenses/spectral.en.md +52 -0
  137. package/lenses/spectral.md +52 -0
  138. package/lenses/symmetry.en.md +49 -0
  139. package/lenses/symmetry.md +49 -0
  140. package/lenses/topological.en.md +48 -0
  141. package/lenses/topological.md +48 -0
  142. package/lenses/variational.en.md +48 -0
  143. package/lenses/variational.md +48 -0
  144. package/package.json +11 -3
  145. package/references/agentic-workflow.en.md +53 -0
  146. package/references/agentic-workflow.md +2 -0
  147. package/references/books/abstract-algebra.md +9 -5
  148. package/references/books/algebraic-geometry-rising-sea.md +9 -5
  149. package/references/books/differential-geometry.md +7 -3
  150. package/references/books/matrix-analysis.md +8 -4
  151. package/references/books/micro-lie-theory.md +7 -3
  152. package/references/books/optimization-ml.md +5 -1
  153. package/references/books/smooth-manifolds.md +7 -3
  154. package/references/gpu-friendly-math.en.md +65 -0
  155. package/references/gpu-friendly-math.md +4 -2
  156. package/references/inspiration.en.md +113 -0
  157. package/references/inspiration.md +4 -2
  158. package/skills/math-research-activator/SKILL.en.md +187 -0
  159. package/skills/math-research-activator/SKILL.md +162 -108
  160. package/skills/math-research-activator/original-texts.en.md +105 -0
  161. package/skills/math-research-activator/original-texts.md +11 -11
  162. package/commands/abstraction.md +0 -13
  163. package/commands/algorithmic-thinking.md +0 -13
  164. package/commands/axiomatization.md +0 -13
  165. package/commands/causal-inference.md +0 -13
  166. package/commands/discrete-combinatorial.md +0 -13
  167. package/commands/game-theory.md +0 -13
  168. package/commands/induction-analogy.md +0 -13
  169. package/commands/information-theory.md +0 -13
  170. package/commands/logic-deduction.md +0 -13
  171. package/commands/modeling.md +0 -13
  172. package/commands/optimization.md +0 -13
  173. package/commands/probability-statistics.md +0 -13
  174. package/commands/symmetry-invariance.md +0 -13
  175. package/commands/topological-thinking.md +0 -13
  176. package/commands/transformation.md +0 -13
  177. package/skills/abstraction/SKILL.md +0 -119
  178. package/skills/abstraction/original-texts.md +0 -175
  179. package/skills/algorithmic-thinking/SKILL.md +0 -136
  180. package/skills/algorithmic-thinking/original-texts.md +0 -256
  181. package/skills/axiomatization/SKILL.md +0 -149
  182. package/skills/axiomatization/original-texts.md +0 -160
  183. package/skills/causal-inference/SKILL.md +0 -149
  184. package/skills/causal-inference/original-texts.md +0 -167
  185. package/skills/discrete-combinatorial/SKILL.md +0 -129
  186. package/skills/discrete-combinatorial/original-texts.md +0 -185
  187. package/skills/game-theory/SKILL.md +0 -121
  188. package/skills/game-theory/original-texts.md +0 -131
  189. package/skills/induction-analogy/SKILL.md +0 -150
  190. package/skills/induction-analogy/original-texts.md +0 -154
  191. package/skills/information-theory/SKILL.md +0 -138
  192. package/skills/information-theory/original-texts.md +0 -127
  193. package/skills/logic-deduction/SKILL.md +0 -133
  194. package/skills/logic-deduction/original-texts.md +0 -173
  195. package/skills/modeling/SKILL.md +0 -137
  196. package/skills/modeling/original-texts.md +0 -165
  197. package/skills/optimization/SKILL.md +0 -133
  198. package/skills/optimization/original-texts.md +0 -168
  199. package/skills/probability-statistics/SKILL.md +0 -149
  200. package/skills/probability-statistics/original-texts.md +0 -193
  201. package/skills/symmetry-invariance/SKILL.md +0 -137
  202. package/skills/symmetry-invariance/original-texts.md +0 -221
  203. package/skills/topological-thinking/SKILL.md +0 -126
  204. package/skills/topological-thinking/original-texts.md +0 -164
  205. package/skills/transformation/SKILL.md +0 -122
  206. package/skills/transformation/original-texts.md +0 -216
@@ -1,168 +0,0 @@
1
- # 数学出处与经典文献 / Mathematical Sources and Classic Texts
2
-
3
- ## Euler-Lagrange 变分方程与最速降线 / Euler-Lagrange Variational Equation & Brachistochrone (1696)
4
-
5
- > Johann Bernoulli 于 1696 年提出最速降线问题:在重力作用下,质点从 A 到 B 沿哪条曲线下降最快?答案是旋轮线(cycloid)。
6
-
7
- **核心方程**:对泛函 J[y] = ∫_{a}^{b} F(x, y, y') dx,极值函数满足
8
-
9
- > ∂F/∂y - d/dx(∂F/∂y') = 0 (Euler-Lagrange 方程)
10
-
11
- 最速降线问题的 F = √(1 + y'²) / √(2g(y₀ - y)),代入 Euler-Lagrange 方程后解出旋轮线参数方程:x = a(θ - sin θ), y = a(1 - cos θ)。
12
-
13
- **思想**:变分法将"在整个函数类中寻优"化为微分方程求解——这是无穷维优化的起源。Euler(1744)系统化了变分法,Lagrange(1788)引入了 δ 符号与乘数法,两者一脉相承。变分法后来发展为最优控制理论(Pontryagin 最大值原理,1961),在航天轨道设计、机器人路径规划等领域广泛应用。
14
-
15
- ## Fermat 与 Weierstrass 极值条件 / Fermat & Weierstrass Conditions for Unconstrained Optimization
16
-
17
- > Fermat(1636):可微函数 f 在 x* 处取得局部极值的必要条件是 ∇f(x*) = 0。
18
- > Weierstrass(19th c.):若 f 二阶可微且 ∇f(x*) = 0,则 Hessian H(x*) 正定 ⇔ x* 是严格局部极小;H(x*) 负定 ⇔ x* 是严格局部极大。
19
-
20
- 对凸函数,∇f(x*) = 0 不仅是必要条件,也是充分条件——且 x* 是全局极小。
21
-
22
- **思想**:一阶条件找驻点,二阶条件判极值性质——无约束优化的最基本定理。∇f = 0 是几乎所有迭代优化算法(梯度下降、牛顿法)的收敛目标。
23
-
24
- ## Lagrange 乘数法 / Lagrange Multipliers (1788)
25
-
26
- > 在约束 g(x) = 0 下求 f(x) 的极值,等价于求 L(x,λ) = f(x) - λg(x) 的无条件极值。
27
-
28
- **思想**:将约束优化问题转化为无约束问题。在最优解处,目标函数的梯度与约束函数的梯度平行:∇f(x*) = λ∇g(x*)。
29
-
30
- ## Pareto 最优性 / Pareto Optimality (Vilfredo Pareto, ~1906)
31
-
32
- > 在多目标优化中,解 x 是 Pareto 最优的,若不存在 y 使得 f_i(y) ≤ f_i(x) ∀i 且至少一个 f_j(y) < f_j(x)(严格改善)。
33
-
34
- Pareto 在《Manuale di economia politica》(1906) 中将此概念引入经济学:资源配置的效率前沿。Pareto 前沿 Pareto frontier {f(x) : x is Pareto optimal} 刻画了所有不可同时改善的权衡解。数学上,对目标 f₁,...,fₘ 的 Pareto 前沿是 {y ∈ ℝᵐ : y = (f₁(x),...,fₘ(x)), x Pareto optimal}——它是目标空间中的一个(通常非凸的)曲面。
35
-
36
- > 加权标量化:将多目标 min f₁,...,fₘ 转化为单目标 min Σw_i f_i(w_i > 0),每个权重组合对应 Pareto 前沿上的一个点。这是求解 Pareto 前沿的常用方法,但对非凸前沿不能遍历所有 Pareto 最优解。
37
-
38
- **思想**:多目标优化没有唯一的"最优解",而有一组 Pareto 最优解,需要在它们之间做权衡。这在经济学(效率与公平)、工程(性能与成本)、机器学习(精度与复杂度)中无处不在。
39
-
40
- ## 博弈论与优化 / Game Theory & Optimization (von Neumann, 1928; Nash, 1950)
41
-
42
- > Nash 均衡:策略组 (s₁*, ..., sₙ*) 使得每个玩家 i 在其他玩家策略固定时,s_i* 是其最优响应——即无人有单方面偏离的动机。
43
-
44
- von Neumann(1928)证明了零和博弈的 minimax 定理:max_{x} min_{y} f(x,y) = min_{y} max_{x} f(x,y),这本质上是线性规划对偶性的先声。Nash(1950)将均衡推广到非零和博弈,Nash 均衡是"互为最优"的优化——每个玩家的优化问题以他人策略为约束。
45
-
46
- > Nash 均衡的存在性:Nash(1950)用 Brouwer 不动点定理证明了每个有限博弈至少存在一个混合策略 Nash 均衡。这揭示了博弈论与拓扑学的深层联系。
47
-
48
- **思想**:博弈论将优化从"单人决策"推广到"多人交互决策"——最优不再是对自然的最优,而是对其他理性主体的最优响应。
49
-
50
- ## KKT 条件 / Karush-Kuhn-Tucker Conditions (1939/1951)
51
-
52
- 不等式约束优化的必要条件:
53
-
54
- > 对于 min f(x) s.t. g_i(x) ≤ 0, h_j(x) = 0,最优解 x* 满足:
55
- > - 平稳性:∇f(x*) + Σμ_i∇g_i(x*) + Σλ_j∇h_j(x*) = 0
56
- > - 可行性:g_i(x*) ≤ 0, h_j(x*) = 0
57
- > - 互补松弛性:μ_i · g_i(x*) = 0, μ_i ≥ 0
58
-
59
- Karush(1939,硕士论文)最早给出此条件;Kuhn & Tucker(1951)独立重新发现并广泛传播。
60
-
61
- **思想**:最优解处,要么约束不起作用(μ_i = 0),要么约束是紧的(g_i(x*) = 0)。互补松弛性是对偶理论的基石——它将 KKT 条件与对偶间隙为零紧密联系。当约束限定条件 constraint qualification 成立时(如 LICQ:活跃约束梯度线性无关),KKT 条件是最优性的必要条件。
62
-
63
- ## 线性规划对偶 / Linear Programming Duality (Farkas, 1902; Dantzig-von Neumann, 1947)
64
-
65
- > Farkas 引理(1902):Ax = b, x ≥ 0 有解 ⟺ Aᵀy ≥ 0, bᵀy < 0 无解——这是 LP 对偶的几何根基。
66
-
67
- > 强对偶定理:若原 LP min cᵀx s.t. Ax = b, x ≥ 0 有可行解,则 max bᵀy s.t. Aᵀy ≤ c 的最优值相等。对偶变量 y 的分量称为影子价格 shadow price——它衡量每个约束的"边际价值"。
68
-
69
- **思想**:每个 LP 都有一个"镜像"问题——原问题看成本,对偶问题看价值。对偶间隙为零是深刻的事实:资源的最小成本等于影子价格的最大收益。
70
-
71
- ## Dantzig 单纯形法 / Simplex Method (1947)
72
-
73
- 线性规划的基本算法。在可行域的顶点上搜索最优解。
74
-
75
- > Klee-Minty 立方体(1973):存在 LP 实例使得单纯形法遍历所有 2ⁿ 个顶点——最坏情况指数复杂度。
76
-
77
- > 内点法 / Interior-Point Methods:Karmarkar(1984)提出多项式时间 LP 算法,在可行域内部沿中心路径收敛,避免顶点遍历。现代内点法(如 Mehrotra predictor-corrector)在实践和理论上均表现优异。
78
-
79
- **思想**:线性规划的最优解一定在可行域的顶点上。单纯形法利用此结构沿边移动;内点法从内部逼近,两者互补。
80
-
81
- ## 对偶理论 / Duality Theory
82
-
83
- > 弱对偶:对任何优化问题,对偶问题的最优值 d* ≤ 原问题最优值 p*(对偶间隙 gap = p* - d* ≥ 0)。
84
-
85
- > 强对偶(Slater 条件):若凸优化问题存在严格可行点(Slater point:g_i(x) < 0 严格成立),则 d* = p*,对偶间隙为零。
86
-
87
- > 对偶提供了下界(原问题的最优值 ≥ 对偶值),这在分支定界、 Cutting-plane 等算法中是关键工具。
88
-
89
- **思想**:对偶将"最小化成本"与"最大化价值"联系起来——两个视角看同一问题。Slater 条件保证了凸优化的"无信息损失"。
90
-
91
- ## 梯度下降 / Gradient Descent (Cauchy, 1847; Robbins-Monro, 1951)
92
-
93
- > Cauchy(1847)提出最速下降法:x_{k+1} = x_k - α_k ∇f(x_k),沿负梯度方向迭代,α_k 为步长。对 L-平滑凸函数(Lipschitz 连续梯度),步长 α = 1/L 时 f(x_k) - f(x*) ≤ L‖x₀ - x*‖² / (2k)——线性收敛率 O(1/k)。
94
-
95
- > 牛顿法 Newton's Method:x_{k+1} = x_k - H(x_k)⁻¹ ∇f(x_k),利用二阶信息,在最优解附近达到二次收敛 O(‖x_k - x*‖²)。
96
-
97
- > 随机梯度下降 SGD:Robbins & Monro(1951)提出随机逼近,用噪声梯度 g_k ≈ ∇f(x_k) 替代真梯度。条件 Σα_k = ∞, Σα_k² < ∞ 保证收敛。SGD 在期望意义上收敛,代价是方差——minibatch 是方差与效率的折中。
98
-
99
- **思想**:梯度下降是最朴素的优化——"哪里最陡就往哪里走"。SGD 将此思想扩展到大数据场景:不需要看全部数据,只需随机采样一小部分即可逼近方向。深度学习的训练几乎全部依赖 SGD 及其变体(Adam, AdaGrad 等)。
100
-
101
- ## 整数规划与 NP-困难 / Integer Programming & NP-Hardness (Cook, 1971; Karp, 1972)
102
-
103
- > 整数线性规划 ILP:min cᵀx s.t. Ax ≤ b, x ∈ ℤⁿ——变量取整数值。即使 0-1 ILP(x ∈ {0,1}ⁿ)也是 NP困难的。
104
-
105
- > Cook(1971)证明 SAT 是 NP 完全的(Cook-Levin 定理);Karp(1972)列出 21 个 NP 完全问题,包含整数规划、背包问题、旅行商问题等。ILP 是 NP困难的——不存在(在 P ≠ NP 假设下)多项式时间精确算法。
106
-
107
- > 凸松弛:将 x ∈ ℤⁿ 松弛为 x ∈ ℝⁿ 得到 LP,其最优值给出 ILP 的下界——这正是分支定界法 branch-and-bound 的核心机制。
108
-
109
- **思想**:离散优化比连续优化本质上更难。"整数"这一看似微小的约束,将问题从多项式可解推向 NP 困难。分支定界 branch-and-bound、割平面 cutting-plane 是主要精确方法;启发法在实践中更常用。
110
-
111
- ## 凸优化 / Convex Optimization (Boyd & Vandenberghe, 2004)
112
-
113
- > 凸优化:min f(x) s.t. g_i(x) ≤ 0 (凸), h_j(x) = 0 (线性), x ∈ C (凸集)。f 为凸函数时局部极小即全局极小。
114
-
115
- > 关键性质:(1) 局部极小 = 全局极小;(2) 可行域是凸集;(3) Slater 条件下强对偶成立;(4) 内点法在多项式时间内可解。
116
-
117
- 凸优化涵盖的重要子类:
118
- - LP(线性规划):f 线性,约束线性
119
- - QP(二次规划):f 二次,约束线性
120
- - SOCP(二阶锥规划):约束含二阶锥 ‖Ax + b‖ ≤ cᵀx + d
121
- - SDP(半定规划):约束含矩阵半正定条件 X ≥ 0
122
- - GP(几何规划):对数空间下化为凸优化
123
-
124
- Boyd & Vandenberghe《Convex Optimization》(2004) 统一了上述各类问题,成为现代优化的标准教材与工程参考。凸优化是"可高效求解的优化"的边界——凸性保证了算法的收敛性与解的全局性。
125
-
126
- **思想**:凸优化是优化理论的"甜蜜区"——足够丰富以涵盖大量实际问题,又足够结构化以保证可解性。非凸问题往往通过凸松弛 convex relaxation 来近似。
127
-
128
- ## Bellman 最优性原理 / Bellman's Principle of Optimality (1957)
129
-
130
- > "一个最优策略具有这样的性质:无论初始状态和初始决策如何,剩余决策必须构成关于由初始决策产生的状态的最优策略。"
131
- > "An optimal policy has the property that whatever the initial state and initial decision are, the remaining decisions must constitute an optimal policy with regard to the state resulting from the first decision."
132
-
133
- > 递推方程:V(s) = max_a { R(s,a) + γ · V(s') },其中 s' 为状态转移结果。
134
-
135
- **思想**:动态规划的核心——最优解的子结构也是最优的。Bellman 方程将多阶段决策分解为单阶段子问题,是强化学习的理论根基。
136
-
137
- ## 优化的哲学意义
138
-
139
- 优化思想的核心是**在约束下做最好的选择**——这不仅是数学问题,也是人生问题。生活中大多数决策都可以表述为优化问题:
140
-
141
- - **目标函数**:你想最大化什么?(幸福?成就?自由?)
142
- - **约束条件**:你面临什么限制?(时间?金钱?能力?)
143
- - **可行域**:在约束下你有什么选择?
144
- - **最优解**:在所有选择中,哪个使目标最大化?
145
- - **对偶视角**:从"成本"看和从"价值"看,答案是一致的——这正是强对偶的哲学。
146
- - **凸与非凸**:凸优化有唯一全局最优;非凸优化有多个局部最优——人生的困境恰在于世界是非凸的。
147
-
148
- ## 优化理论历史年表 / Timeline of Optimization
149
-
150
- | 年份 | 事件 |
151
- |------|------|
152
- | 1636 | Fermat 提出无约束极值的必要条件 ∇f = 0 |
153
- | 1696 | Johann Bernoulli 提出最速降线问题,变分法萌芽 |
154
- | 1744 | Euler 系统化变分法 |
155
- | 1788 | Lagrange 发表乘数法,融入《分析力学》 |
156
- | 1902 | Farkas 引理——LP 对偶的几何基础 |
157
- | ~1906 | Pareto 将效率前沿概念引入经济学 |
158
- | 1928 | von Neumann 证明 minimax 定理(零和博弈) |
159
- | 1939 | Karush 给出 KKT 条件(硕士论文) |
160
- | 1947 | Dantzig 发明单纯形法;von Neumann 建立 LP 对偶 |
161
- | 1950 | Nash 证明非零和博弈均衡存在性 |
162
- | 1951 | Kuhn & Tucker 发表 KKT 条件;Robbins-Monro 提出随机逼近 |
163
- | 1957 | Bellman 发表动态规划与最优性原理 |
164
- | 1971 | Cook 证明 NP 完全性(Cook-Levin 定理) |
165
- | 1972 | Karp 列出 21 个 NP 完全问题 |
166
- | 1973 | Klee-Minty 证明单纯形法最坏情况指数复杂度 |
167
- | 1984 | Karmarkar 提出多项式时间内点法 |
168
- | 2004 | Boyd & Vandenberghe 出版《Convex Optimization》
@@ -1,149 +0,0 @@
1
- ---
2
- name: probability-statistics
3
- description: |
4
- 触发:问题涉及量化不确定性、概率分布、贝叶斯推断、假设检验、回归建模、实验设计、因果效应估计;或为随机算法/采样/量化/训练动力学设计概率机制时调用。
5
- English: Trigger when a problem involves quantifying uncertainty, probability distributions, Bayesian inference, hypothesis testing, regression modeling, experimental design, causal effect estimation; or designing probabilistic mechanisms for random algorithms/sampling/quantization/training dynamics.
6
- ---
7
-
8
- # 🎲 概率与统计 / Probability & Statistics
9
-
10
- > "不确定性是可量化的——概率不只是数学公式,而是理解随机世界的方式。量化不确定性,从数据中提取规律,做出理性的推断和决策。"
11
- > "Uncertainty is quantifiable—probability is not just a mathematical formula, but a way to understand the random world. Quantifying uncertainty, extracting patterns from data, and making rational inferences and decisions."
12
- >
13
- > —— 概率论、数理统计
14
- > —— Probability Theory, Mathematical Statistics
15
-
16
- ## 核心原则 / Core Principle
17
-
18
- **世界充满不确定性。理性决策不是追求确定性,而是在不确定性中做出期望值最优的选择——概率是量化的信念,数据是量化的证据。**
19
-
20
- > **数学形式化 / Mathematical Formalization**
21
- >
22
- > 概率空间 (Ω, 𝔽, P) 由 Kolmogorov 三公理定义:① **非负性** P(A) ≥ 0;② **规范性** P(Ω) = 1;③ **可数可加性** 对互不相交的可数事件族 Aᵢ,P(∪ᵢ Aᵢ) = Σᵢ P(Aᵢ)。由此推出互补律 P(Aᶜ)=1−P(A)、全概率公式 P(B)=Σᵢ P(B|Aᵢ)P(Aᵢ)。
23
- >
24
- > **贝叶斯更新**:P(θ|D) = P(D|θ)·P(θ)/P(D);先验 → 似然 → 后验,后验遇新数据成为新先验。
25
- >
26
- > **期望与方差**:E[X] = Σx·P(x)(离散)或 ∫x·f(x)dx(连续);Var(X) = E[(X−μ)²] = E[X²] − (E[X])²。
27
- >
28
- > **大数定律/CLT**:n → ∞ 时样本频率 f/n → P(A)、样本均值 X̄ → μ(依概率收敛);√n·(X̄ − μ)/σ →d N(0,1),故大量独立小因素叠加趋正态。
29
- >
30
- > **偏差-方差权衡**:总误差 = 偏差² + 方差 + σ²(不可约噪声)。
31
-
32
- ## GPU 友好性 / GPU-Friendliness(横切检查)
33
-
34
- 当概率方法用于**随机算法/采样/训练动力学设计**时,须过 `../../references/gpu-friendly-math.md` 八维门:
35
-
36
- - **批量采样/蒙特卡洛**:i.i.d. 采样天然可并行、GEMM 友好(重参数化 Reparam、Gumbel-Softmax);低精度可行,注意 RNG 状态与跨设备一致性。
37
- - **MLE / 对数似然**:逐元素似然可融合、可批量化(友好);softmax 交叉熵用 logsumexp 保数值稳定。
38
- - **精确贝叶斯积分/边缘化**:高维 P(θ|D)∝P(D|θ)P(θ) 的归一化 Z=P(D) 与边缘化不可闭式 → 改造为 **MCMC(HMC/NUTS)/变分推断 ELBO**(见 `../../references/books/optimization-ml.md`)。
39
- - **大表后验/协方差**:不可算 → mean-field / 低秩因子化近似(见 `../../references/books/matrix-analysis.md`)。
40
- - **反模式**:逐样本串行 MCMC、需全局归一化的精确推断、"美但不可算"的高维积分。
41
-
42
- 八维最低判定(正式术语):**张量化**看样本、粒子、分布参数是否批量;**GEMM 可映射**看似然、回归、协方差是否落矩阵运算;**复杂度**看采样步数、积分维度、后验表规模;**显存与 KV-Cache**看粒子、协方差、充分统计是否可低秩/流式;**低精度稳定**检查 logsumexp、概率归一化、尾部概率;**并行与通信**看 RNG 与跨设备归约;**稀疏结构**看图模型/协方差是否结构化;**算子融合**看采样、打分、归一化能否融合。
43
-
44
- > 配合 `../../references/books/optimization-ml.md`(变分/SAA/随机优化)与 `../../references/books/matrix-analysis.md`(协方差低秩)。
45
-
46
- ## 不适用场景 / When NOT to Use
47
-
48
- - **确定性问题**(已知答案或可演绎推理得到)——不需要概率工具。
49
- - **样本量极小(n < 5)且无法增加**——应报告数据本身而非推断。
50
- - **纯粹的定性描述需求**——不需要数据分析。
51
- - **因果机制已明确且无需概率建模**——直接用确定性因果链。
52
- - **数据完全缺失或严重损坏**——无法做有意义的统计操作。
53
-
54
- ## 何时使用 / When to Use
55
-
56
- - 审查论文/实验的统计方法是否正确、结论是否显著。
57
- - 实验数据分析、显著性检验、效应量评估、回归建模与预测。
58
- - 实验设计与功效分析(随机化、区组化、因子设计)。
59
- - 因果效应估计(DAG + 后门准则 / do-演算)。
60
- - 贝叶斯推断与先验-后验更新、拟合优度检验(χ²/F)。
61
- - **为随机算法/采样/量化/训练动力学设计概率机制**(蒙特卡洛、重参数化、概率量化),并评估其 GPU 可行性。
62
-
63
- ## 方法流程 / Method
64
-
65
- ### 第一步:定义随机现象 / Define the Random Phenomenon
66
- 明确**随机变量 X**(要测量的量)、**样本空间 Ω**(所有可能结果)、**事件域 𝔽**(Ω 的 σ-代数:含 Ω、对补封闭、对可数并封闭)、**概率测度 P**: Ω→[0,1](满足 Kolmogorov 三公理)。区分离散与连续随机变量。
67
-
68
- ### 第二步:选择概率模型 / Choose the Probability Model
69
- 根据数据类型、样本量、物理机制选择分布:
70
-
71
- | 分布 / Distribution | 适用场景 / Use Case | 关键参数 / Key Parameters |
72
- |---|---|---|
73
- | 二项 Binomial | N 次独立伯努利试验成功次数 | n, p |
74
- | 泊松 Poisson | 单位时间/空间内稀有事件次数 | λ(平均发生率) |
75
- | 正态 Normal | 大量独立小因素叠加(CLT) | μ, σ² |
76
- | 指数 Exponential | 等待时间、无记忆性 P(X>t+s\|X>s)=P(X>t) | λ(速率) |
77
- | 贝叶斯 Bayesian | 先验+似然→后验,逐步更新信念 | 先验参数,似然函数 |
78
- | t-分布 Student's t | 小样本均值推断,尾部厚于正态 | df = n − 1 |
79
- | χ²-分布 | 拟合优度检验、列联表、方差估计 | df |
80
- | F-分布 | 比较两组方差、ANOVA | df₁, df₂ |
81
- | 均匀 Uniform | 等概率事件、无先验默认 | a, b |
82
-
83
- 选择原则:离散/连续、大样本趋正态(小样本用 t)、物理机制(泊松=稀有独立事件、指数=等待时间)。
84
-
85
- ### 第三步:收集数据 / Collect Data
86
- 检查**样本量**是否足够(功效分析定最小 n)、**样本偏差**(选择/幸存者/自愿响应偏差)、**数据质量**(测量误差/缺失/异常值)、**收集方式**(随机抽样 vs 方便抽样)、**区组结构**。代表性比数据量更重要——有偏大样本比无偏小样本更危险。
87
-
88
- ### 第四步:统计推断 / Statistical Inference
89
- **点估计/MLE** θ̂ = argmax_θ L(θ;x),L(θ;x)=f(x|θ),大样本下渐近正态、渐近有效;**置信区间**以置信水平(如 95%)给区间估计,频率解释为重复抽样时 95% 区间含真值;**假设检验** H₀ vs H₁,p-value = P(观察到此数据或更极端 \| H₀),p < α 拒绝 H₀;**贝叶斯更新** P(θ|D) = P(D|θ)·P(θ)/P(D)。
90
-
91
- ### 第五步:回归建模 / Regression Modeling
92
- **线性回归** Y = β₀ + β₁X + ε, ε ~ N(0,σ²),最小二乘 β̂ = (XᵀX)⁻¹XᵀY,假设线性/独立/同方差/正态残差;**多元/逻辑回归** P(Y=1\|X) = 1/(1+e^(−(β₀+ΣβX))),MLE 估计输出概率;**模型选择** AIC = −2lnL + 2k(偏预测)、BIC = −2lnL + k·ln(n)(偏简约)、调整 R² = 1 − (1−R²)(n−1)/(n−k−1);**偏差-方差权衡** 总误差 = 偏差² + 方差 + σ²,交叉验证选复杂度。
93
-
94
- ### 第六步:实验设计 / Experimental Design
95
- **随机化**使处理组与对照组在所有变量(已知/未知)上期望相等;**区组化**将相似单元分组、区组内比较减少混杂变异;**功效分析** Power = 1 − β = P(拒绝 H₀ \| H₁ 为真),给定效应量 δ、α 算所需最小 n,低功效 = 高假阴性;**因子设计** 2ᵏ 同时研究 k 因素及交互。
96
-
97
- ### 第七步:因果推理 / Causal Inference
98
- **混淆变量** Z 同时影响 X 与 Y 使 P(Y\|X) ≠ P(Y\|do(X)),不调整则效应有偏;**DAG** 节点=变量、箭头=直接因果,识别后门/中介路径;**do-演算/后门准则** 若 S 阻断 X→Y 所有后门路径且不含 X 后代,则 P(Y\|do(X)) = Σₛ P(Y\|X,S=s)·P(S=s);**随机化**直接阻断所有后门路径,是因果效应估计的黄金标准。
99
-
100
- ### 第八步:解释结果 / Interpret Results
101
- 区分**统计显著**与**实际显著**(p<0.05 ≠ 效应大,大样本下微小差异也"显著")。报告**效应量**:Cohen's d = (μ₁−μ₂)/σ、odds ratio = (P₁/(1−P₁))/(P₂/(1−P₂))。注意**相关≠因果**(P(Y\|X) ≠ P(Y\|do(X)))、**多重比较**(m 个检验期望假阳性 = m·α,需 Bonferroni α_adj=α/m 或 BH-FDR 校正)。
102
-
103
- ### 第九步:量化不确定性 / Quantify Uncertainty
104
- 给出**置信区间**(频率:重复抽样覆盖率)或**可信区间**(贝叶斯:参数在此区间的概率);说明结论可靠性与统计功效;识别剩余不确定性来源(模型假设、测量误差、未观测混淆);报告效应量区间而非仅点估计。
105
-
106
- ## 常见错误 / Common Errors
107
-
108
- | 错误 / Error | 批评 / Critique | 正确做法 / Correct Approach |
109
- |---|---|---|
110
- | 把 p-value 当真理 | p=0.05 不表示"95% 把握",而是 H₀ 下观察到该数据或更极端的概率 | 理解 p = P(数据或更极端 \| H₀) |
111
- | 混淆概率与频率 | 概率是理论值 P(A),频率是经验值 f(A)/n | 用大数定律连接:n→∞ 时 f/n → P |
112
- | 忽视先验概率 | 基础率忽视:只看新证据不看背景概率,罕见病检验尤其危险 | 贝叶斯:P(H\|E) = P(E\|H)·P(H)/P(E) |
113
- | 幸存者偏差 | 只看成功者,样本空间被截断 | 考虑完整样本空间 Ω,含失败样本 |
114
- | 小样本陷阱 | n=3 的"规律"不可信,方差估计不稳定 | 检查样本量、算功效、用 t 分布 |
115
- | 相关当因果 | 两变量相关 ≠ 一者导致另一者 | 找混淆变量,DAG + 后门准则 |
116
- | 忽视回归均值 | 极端表现后倾向回归平均 E[X] | 用回归分析而非直觉判断趋势 |
117
- | 小样本用正态而非 t | n<30 时正态近似低估不确定性 | n<30 用 t 分布,df=n−1 |
118
- | 混淆 AIC 与 BIC | AIC 偏拟合、BIC 偏简约 | 预测用 AIC,解释用 BIC |
119
- | 观测数据推断因果 | 无随机化时混淆无法消除,P(Y\|X) ≠ P(Y\|do(X)) | DAG + 后门准则调整,或只断关联 |
120
- | 忽略多重比较校正 | m 个检验期望假阳性 = m·α | Bonferroni α/m 或 BH-FDR |
121
- | 忽略功效与效应量 | 低功效即使有真实效应也不显著;只报 p 不报效应量 | 设计前算样本量,报 Cohen's d / odds ratio |
122
- | 精确积分/大表后验不可算 | 高维归一化 Z=P(D) 与边缘化无闭式,逐样本串行 MCMC 不可并行 | 改用 MCMC/变分 ELBO/低秩近似,过 GPU 八维门 |
123
-
124
- ## 操作规程 / Operating Procedure
125
-
126
- 当本 skill 被触发时,输出必须包含:
127
-
128
- 1. **随机变量定义**:`[变量]: [含义] [类型: 离散/连续]`,指定样本空间 Ω 与事件域 𝔽
129
- 2. **概率模型**:`[分布]: [选择] 因为 [理由]`,注明 df 或关键参数
130
- 3. **数据评估**:`[样本量]: N, [偏差检查]: [结果], [收集方式]: [随机/方便]`
131
- 4. **统计推断**:`[估计值]: [θ̂], [置信区间]: [a,b], [p-value]: [值], [方法]: [MLE/Bayesian]`
132
- 5. **回归/实验设计(如适用)**:`[模型]: [线性/逻辑] [系数]: [β̂] [准则]: [AIC/BIC]`;`[设计]: [随机化/区组/因子] [功效]: [Power] [最小n]: [n]`
133
- 6. **因果评估(如适用)**:`[DAG]: [路径], [混淆]: [列表], [调整集]: [S], [因果效应]: [P(Y\|do(X))]`
134
- 7. **效应量与不确定性**:Cohen's d / odds ratio 及其区间,统计功效与剩余不确定性
135
- 8. **偏差检查**:逐一核对常见错误表,标注 `✅ 无` 或 `⚠️ 发现 [问题]`
136
- 9. **[GPU 可行性]**(若用于随机算法/采样/训练):推断是否需采样/变分近似,过八维门,标注友好/可改造/反模式 + 改造建议
137
- 10. **行动建议**:明确写出"接下来我将……"
138
-
139
- **输出不得只给分析而无结论。**
140
-
141
- ## 与其他 skill 的关系 / Relations to Other Skills
142
-
143
- - **建模思想**:概率模型是建模的重要工具——不确定性需要概率框架。
144
- - **优化思想**:不确定性下的优化需期望值优化或鲁棒优化;随机优化/SAA 把期望目标转为确定性近似。
145
- - **归纳与类比**:从数据中发现规律本质是归纳推理的概率版本。
146
- - **逻辑演绎**:经典逻辑是确定性的,概率逻辑是不确定性的推广。
147
- - **因果推断思想**:P(Y\|X) 是统计关联,P(Y\|do(X)) 是因果效应;因果需机制假设(DAG),不能纯靠数据得出。
148
- - **信息论思想**:熵 H(X)=−ΣP(x)lnP(x) 量化不确定性;信息增益 I(X;Y)=H(X)−H(X\|Y);最大熵原则在约束下选使熵最大的分布。
149
- - **现代数学激活**:`../../references/books/optimization-ml.md`(随机优化/SAA、变分推断 ELBO)、`../../references/books/matrix-analysis.md`(协方差低秩、因子化近似)。
@@ -1,193 +0,0 @@
1
- # 数学出处与经典文献 / Mathematical Sources and Classic Texts
2
-
3
- ## 贝叶斯定理 / Bayes' Theorem (Bayes, 1763)
4
-
5
- > P(H|E) = P(E|H) × P(H) / P(E)
6
- >
7
- > 后验概率 = 似然 × 先验概率 / 证据
8
-
9
- **含义**:当我们观察到新证据 E 时,我们关于假设 H 的信念从先验 P(H) 更新为后验 P(H|E)。
10
-
11
- **贝叶斯思维的核心**:
12
- 1. 先有信念(先验概率)
13
- 2. 观察数据(证据)
14
- 3. 更新信念(后验概率)
15
- 4. 重复这个过程
16
-
17
- **数学背景**:Thomas Bayes 的论文 "An Essay towards solving a Problem in the Doctrine of Chances" 于 1763 年由 Richard Price 代为发表。贝叶斯定理本质上是条件概率的定义 P(A∩B) = P(A|B)P(B) = P(B|A)P(A) 的重排,但其哲学意义远超数学本身——它为"从数据学习"提供了严格的数学框架。
18
-
19
- ## 大数定律 / Law of Large Numbers (Bernoulli, 1713)
20
-
21
- > 当试验次数 n 趋于无穷时,样本均值依概率收敛于期望值。
22
- > As the number of trials n approaches infinity, the sample mean converges in probability to the expected value.
23
-
24
- **含义**:单次观察不可赖,但大量观察会揭示真实规律。这是统计推断的理论基础。
25
-
26
- **数学背景**:Jacob Bernoulli 在《Ars Conjectandi》(1713) 中证明了弱大数定律:对任意 ε>0, P(|X̄ₙ - μ| ≥ ε) → 0。Borel (1909) 与 Kolmogorov 进一步强化为强大数定律——几乎必然收敛:P(lim X̄ₙ = μ) = 1。
27
-
28
- ## 中心极限定理 / Central Limit Theorem (De Moivre-Laplace, 1733–Lindeberg-Feller, 20世纪)
29
-
30
- > 大量独立同分布随机变量的和近似服从正态分布,无论原始分布是什么。
31
- > The sum of a large number of i.i.d. random variables is approximately normally distributed, regardless of the original distribution.
32
-
33
- **含义**:正态分布之所以普遍,是因为它是"大量小因素叠加"的自然结果。
34
-
35
- **数学背景**:De Moivre (1733) 首先发现二项分布的正态近似;Laplace (1810) 推广到一般情形。Lindeberg-Feller 条件给出最精确的独立但非同分布情形的收敛条件。Lyapunov (1901) 引入特征函数证明方法,成为现代概率论的核心工具。
36
-
37
- ## Kolmogorov 公理化体系 / Kolmogorov Axioms (1933)
38
-
39
- > 概率论的基础公理:
40
- > 1. 非负性:P(A) ≥ 0
41
- > 2. 规范性:P(Ω) = 1
42
- > 3. 可加性:若 A₁, A₂, ... 互不相交,则 P(∪Aₖ) = ΣP(Aₖ)
43
-
44
- **含义**:概率被定义为测度——概率论从此成为严格的数学分支,而非经验规则集合。
45
-
46
- **数学背景**:Andrey Kolmogorov 在《Grundbegriffe der Wahrscheinlichkeitsrechnung》(1933) 中将概率论嵌入测度论框架 (Ω, F, P),即样本空间、事件域(σ-代数)与概率测度三元组。这一公理化使大数定律、条件概率、随机变量等概念获得精确定义,是现代概率论的基石。
47
-
48
- ## Neyman-Pearson 检验理论 / Neyman-Pearson Lemma (1928/1933)
49
-
50
- > 在给定显著性水平 α 下,似然比检验是最强大的检验:
51
- > 拒绝 H₀ 当 L(x|H₁)/L(x|H₀) > k,其中 k 由 α 决定。
52
-
53
- **含义**:统计检验不是主观判断,而是可以在"控制犯错概率"的前提下达到最优。
54
-
55
- **数学背景**:Jerzy Neyman 与 Egon Pearson 在 1928–1933 年间系统化了假设检验理论,引入 Type I 错误(α,假阳性)与 Type II 错误(β,假阴性)、检验功效 (power = 1-β) 等概念。Neyman-Pearson 引理证明了简单假设 vs 简单假设情形下似然比检验的最优性。这一框架成为现代统计检验的标准范式。
56
-
57
- ## Fisher 统计推断体系 / Fisher's Statistical Inference (1920s–1930s)
58
-
59
- - **最大似然估计**:选择使观测数据出现概率最大的参数 θ̂ = argmax L(θ; x)
60
- - **p-value**:在原假设为真的条件下,观察到当前或更极端数据的概率
61
- - **显著性检验**:通过 p-value 判断是否拒绝原假设
62
- - **充分性原则**:统计量 T(X) 是充分的,若 P(X|T) 不依赖于 θ
63
-
64
- **数学背景**:R.A. Fisher 的贡献远不止 p-value。他提出一致性、有效性等估计量评价准则; Fisher 信息量 I(θ) = E[(∂log L/∂θ)²] 度量数据对参数的信息含量,与 Cramér-Rao 下界紧密关联:Var(θ̂) ≥ 1/I(θ)。
65
-
66
- ## Fisher 实验设计 / Fisher's Experimental Design (1935)
67
-
68
- > 随机化不是忽视因果,而是使因果推断成为可能。
69
-
70
- **含义**:科学实验的可信度不来自"精密控制",而来自"随机分配"。
71
-
72
- **数学背景**:Fisher 在《The Design of Experiments》(1935) 中提出三大原则——随机化 (randomization)、区组化 (blocking)、复因子设计 (factorial designs)。随机化使处理效应的估计免受系统偏差;区组化控制已知干扰变量;2²、2³ 等因子设计可同时估计多个主效应与交互效应,效率远超逐一试验。
73
-
74
- ## Student t 分布 / Student's t-Distribution (Gosset, 1908)
75
-
76
- > 当样本量 n 较小且总体标准差未知时:
77
- > t = (X̄ - μ) / (S/√n),服从 t(n-1) 分布。
78
-
79
- **含义**:小样本不能直接用正态近似——t 分布的尾部更厚,反映了估计标准差本身的不确定性。
80
-
81
- **数学背景**:William Sealy Gosset 以 "Student" 为笔名在 1908 年发表此结果。他在 Guinness 啤酒厂工作,因保密要求无法署真名。t 分布是标准正态与 χ²/(n-1) 的比值分布,当 n→∞ 时趋于正态。Fisher (1925) 给出了严格证明并将其推广。
82
-
83
- ## χ² 检验 / Chi-Squared Test (Karl Pearson, 1900)
84
-
85
- > χ² = Σ(Oₖ - Eₖ)² / Eₖ,在原假设下近似服从 χ²(k-1-p) 分布。
86
-
87
- **含义**:观测频率与期望频率之间的差异是否超过随机波动所能解释的范围?
88
-
89
- **数学背景**:Karl Pearson 在 1900 年提出拟合优度检验,这是第一个正式的统计检验方法。自由度 = k-1-p(k 为类别数,p 为估计参数数)的修正由 Fisher (1922) 完成。χ² 检验在列联表独立性检验、分布拟合等领域广泛应用。
90
-
91
- ## 回归与最小二乘法 / Regression and Least Squares (Legendre 1805, Gauss 1809)
92
-
93
- > min Σ(yₖ - (a + bxₖ))² → 最小二乘估计 β̂ = (X'X)⁻¹X'y
94
-
95
- **含义**:在所有拟合直线中,最小二乘使残差平方和最小;在正态误差假设下,它等价于最大似然估计。
96
-
97
- **数学背景**:Legendre (1805) 首先发表最小二乘法;Gauss (1809) 声称自己早在 1795 年就已使用该方法,并给出正态误差假设下的概率论证。"回归"一词由 Galton (1886) 提出,研究身高代际回归现象。现代线性回归模型 Y = Xβ + ε 是统计建模的核心框架。
98
-
99
- ## Markov 链 / Markov Chains (Markov, 1906)
100
-
101
- > P(Xₙ₊₁ = j | Xₙ = i, Xₙ₋₁, ...) = P(Xₙ₊₁ = j | Xₙ = i)
102
- >
103
- > 未来只依赖现在,不依赖过去——无记忆性 (memoryless property)。
104
-
105
- **含义**:许多真实过程具有"当前状态决定未来走向"的性质,历史细节可以忽略。
106
-
107
- **数学背景**:Andrey Markov (1906) 通过研究普希金《叶甫盖尼·奥涅金》中元音/辅音序列,首次定义了 Markov 链。遍历定理保证:对不可约、非周期、正常返链,π(j) = lim P(Xₙ = j) 存在且为唯一平稳分布。Markov 链是 MCMC (Metropolis 1943, Hastings 1970, Gelfand-Smith 1990) 的理论基础,也支撑 Google PageRank (Brin-Page 1998)。
108
-
109
- ## 随机过程 / Stochastic Processes (Brownian Motion, Wiener Process)
110
-
111
- > W(t) 满足:(1) W(0)=0, (2) W(t)-W(s) ~ N(0, t-s), (3) 独立增量, (4) 连续路径
112
-
113
- **含义**:布朗运动是微观随机涨落的宏观数学模型——从花粉运动到股价波动。
114
-
115
- **数学背景**:Brown (1827) 观察花粉微粒的无规则运动;Bachelier (1900) 首先用其模型化股价;Wiener (1923) 给出严格数学构造。Itô (1944) 发展随机积分 dX = μdt + σdW 与 Itô 公式,成为金融数学 (Black-Scholes 1973) 与随机微分方程的理论基石。
116
-
117
- ## Shannon 信息论 / Shannon Information Theory (1948)
118
-
119
- > H(X) = -Σ p(x) log p(x) —— 熵,随机变量的不确定性度量
120
- > I(X;Y) = H(X) - H(X|Y) —— 互信息,Y 对 X 提供的信息量
121
- > C = max I(X;Y) —— 信道容量,可靠通信的速率上限
122
-
123
- **含义**:信息可以被量化;通信的根本限制由数学定律决定,而非工程技术。
124
-
125
- **数学背景**:Claude Shannon 在《A Mathematical Theory of Communication》(1948) 中创立信息论。信源编码定理:平均编码长度 ≥ H(X);信道编码定理:传输速率 R < C 时存在可靠编码。熵与概率的深层联系——H(X) = -E[log p(X)]——使信息论成为概率论的自然延伸。
126
-
127
- ## Pearl 因果推断 / Pearl's Causal Inference (2000)
128
-
129
- > 因果层级:
130
- > 1. 关联 P(y|x) —— 看到
131
- > 2. 干预 P(y|do(x)) —— 做
132
- > 3. 反事实 P(yₓ|x', y') —— 想
133
-
134
- **含义**:因果不是关联的强化版——"do(x)" 与 "observe x" 在数学上截然不同。
135
-
136
- **数学背景**:Judea Pearl 在《Causality》(2000) 中用有向无环图 (DAG) 与 do-演算系统化了因果推断。do-演算三条规则允许在可观测变量间转换干预概率;前门/后门准则给出从观测数据计算因果效应的条件。因果推断回答"若我做了 x,y 会怎样",这超出了概率论本身的表达能力。
137
-
138
- ## Bootstrap 方法 / Bootstrap (Efron, 1979)
139
-
140
- > 从样本 X₁,...,Xₙ 中有放回抽样 B 次,得到 B 个 bootstrap 样本,
141
- > 用 bootstrap 分布近似真实分布。
142
-
143
- **含义**:当理论推导困难时,用数据自身模拟抽样过程——"用自己验证自己"。
144
-
145
- **数学背景**:Bradley Efron (1979) 提出 bootstrap,其理论保证由 Bickel-Freedman (1981) 与 Singh (1981) 建立:在温和条件下,bootstrap 分布一致收敛于真实抽样分布。Bootstrap 可估计标准误、置信区间(百分位法/BCa 法)、p-value 等,是非参数推断的通用工具。
146
-
147
- ## 贝叶斯学派 vs 频率学派 / Bayesian vs Frequentist Debate
148
-
149
- > 贝叶斯:概率是信念度,参数 θ 是随机变量 → P(θ|data)
150
- > 频率学派:概率是长期频率,参数 θ 是固定未知常 → 估计量 θ̂ 的抽样分布
151
-
152
- **含义**:这不是技术分歧,而是"概率是什么"的哲学分歧。
153
-
154
- **核心对比**:
155
- - 贝叶斯:先验 + 似然 → 后验,天然适合序贯更新与小样本
156
- - 频率学派:无偏性、一致性、功效,天然适合大规模可重复实验
157
- - 实践中:贝叶斯方法在机器学习、因果推断中占优;频率方法在临床试验、质量控制中占优
158
-
159
- **数学背景**:争论自 Laplace vs Fisher 延续至今。Jeffreys (1939) 提出无信息先验 p(θ) ∝ |I(θ)|^(1/2);de Finetti (1937) 证明主观概率的一致性等价于可加性;Bernardo-Smith (1994) 发展参考先验理论。
160
-
161
- ## Monty Hall 问题 / Monty Hall Problem
162
-
163
- > 三扇门,一扇有奖品。你选一扇,主持人打开另一扇空门。
164
- > 问:你是否应该换门?答案是:换门胜率 2/3,不换 1/3。
165
-
166
- **含义**:直觉在此失效——主持人的行为传递了信息(他不会打开有奖品的门)。
167
-
168
- **数学背景**:此问题是贝叶斯思维的绝佳入门案例。用贝叶斯定理:P(奖品在剩余门|主持人打开空门) = 2/3,因为主持人选择性地避开奖品,这本身是信息。类似的结构出现在医疗诊断、法律推理中——"选择性观察"改变了概率。
169
-
170
- ## 常见统计谬误与认知偏差
171
-
172
- **幸存者偏差(Survivorship Bias)**:
173
- 二战期间,军方统计返航飞机的弹孔分布,发现机翼上弹孔最多,建议加固机翼。统计学家 Abraham Wald 指出:应该加固没有弹孔的部位——因为被击中那些部位的飞机根本没飞回来。Wald 的洞察本质上是条件概率:我们观察到的数据是在"飞机返航"条件下的数据,而非全部数据。
174
-
175
- **基础率忽视(Base Rate Neglect)**:
176
- 某种罕见病发病率 0.1%,检测准确率 99%。如果检测为阳性,真正患病的概率是多少?
177
- - 直觉回答:99%
178
- - 贝叶斯计算:P(患病|阳性) = 0.99 × 0.001 / (0.99 × 0.001 + 0.01 × 0.999) ≈ 9%
179
- - 先验概率(基础率)被直觉严重低估
180
-
181
- **回归均值(Regression to the Mean)**:
182
- 表现极好的个体在下次测量中倾向于更接近平均水平,不是因为"能力下降",而是极端表现部分来自运气。Galton (1886) 发现高个子父母的子女往往比父母矮——这不是"退化",而是统计规律。
183
-
184
- ## 概率思维的日常生活价值
185
-
186
- > "概率思维的核心不是计算精确概率,而是养成'在不确定性中思考'的习惯。"
187
-
188
- - 不要被单个案例说服——考虑基础概率
189
- - 新信息来了要更新信念——贝叶斯更新
190
- - 区分信号和噪声——大数定律
191
- - 警惕极端值——回归均值
192
- - 区分"看到"与"做了"——因果层级(Pearl)
193
- - 量化不确定性——熵与信息(Shannon)