math-skill 2.0.1 → 3.0.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (206) hide show
  1. package/README.en-US.md +167 -175
  2. package/README.md +167 -175
  3. package/agents/math-critic.en.md +235 -0
  4. package/agents/math-critic.md +10 -8
  5. package/commands/ask.md +3 -12
  6. package/design-patterns/attention/equivariant-attention.en.md +72 -0
  7. package/design-patterns/attention/equivariant-attention.md +72 -0
  8. package/design-patterns/attention/geometry-aware-attention.en.md +73 -0
  9. package/design-patterns/attention/geometry-aware-attention.md +72 -0
  10. package/design-patterns/attention/information-bottleneck-attention.en.md +72 -0
  11. package/design-patterns/attention/information-bottleneck-attention.md +72 -0
  12. package/design-patterns/attention/projection-attention.en.md +68 -0
  13. package/design-patterns/attention/projection-attention.md +68 -0
  14. package/design-patterns/attention/spectral-attention.en.md +71 -0
  15. package/design-patterns/attention/spectral-attention.md +71 -0
  16. package/design-patterns/compression/leverage-score-selection.en.md +71 -0
  17. package/design-patterns/compression/leverage-score-selection.md +71 -0
  18. package/design-patterns/compression/low-rank-kv-cache.en.md +60 -0
  19. package/design-patterns/compression/low-rank-kv-cache.md +60 -0
  20. package/design-patterns/compression/spectral-token-pruning.en.md +61 -0
  21. package/design-patterns/compression/spectral-token-pruning.md +61 -0
  22. package/design-patterns/compression/topology-preserving-compression.en.md +64 -0
  23. package/design-patterns/compression/topology-preserving-compression.md +64 -0
  24. package/design-patterns/loss/constraint-penalty.en.md +67 -0
  25. package/design-patterns/loss/constraint-penalty.md +78 -0
  26. package/design-patterns/loss/contrastive-loss.en.md +59 -0
  27. package/design-patterns/loss/contrastive-loss.md +68 -0
  28. package/design-patterns/loss/information-bottleneck-loss.en.md +69 -0
  29. package/design-patterns/loss/information-bottleneck-loss.md +74 -0
  30. package/design-patterns/loss/orthogonality-loss.en.md +56 -0
  31. package/design-patterns/loss/orthogonality-loss.md +60 -0
  32. package/design-patterns/loss/variational-loss.en.md +61 -0
  33. package/design-patterns/loss/variational-loss.md +71 -0
  34. package/design-patterns/representation/equivariant-split.en.md +87 -0
  35. package/design-patterns/representation/equivariant-split.md +89 -0
  36. package/design-patterns/representation/manifold-representation.en.md +85 -0
  37. package/design-patterns/representation/manifold-representation.md +87 -0
  38. package/design-patterns/representation/shared-private-decomposition.en.md +84 -0
  39. package/design-patterns/representation/shared-private-decomposition.md +86 -0
  40. package/design-patterns/representation/subspace-alignment.en.md +90 -0
  41. package/design-patterns/representation/subspace-alignment.md +92 -0
  42. package/design-patterns/routing/graph-routing.en.md +79 -0
  43. package/design-patterns/routing/graph-routing.md +81 -0
  44. package/design-patterns/routing/moe-routing.en.md +85 -0
  45. package/design-patterns/routing/moe-routing.md +87 -0
  46. package/design-patterns/routing/optimal-transport-routing.en.md +68 -0
  47. package/design-patterns/routing/optimal-transport-routing.md +72 -0
  48. package/design-patterns/routing/spectral-clustering-routing.en.md +88 -0
  49. package/design-patterns/routing/spectral-clustering-routing.md +90 -0
  50. package/knowledge-base/differential-geometry/connection.en.md +51 -0
  51. package/knowledge-base/differential-geometry/connection.md +51 -0
  52. package/knowledge-base/differential-geometry/curvature.en.md +49 -0
  53. package/knowledge-base/differential-geometry/curvature.md +49 -0
  54. package/knowledge-base/differential-geometry/geodesic.en.md +51 -0
  55. package/knowledge-base/differential-geometry/geodesic.md +51 -0
  56. package/knowledge-base/differential-geometry/manifold.en.md +47 -0
  57. package/knowledge-base/differential-geometry/manifold.md +47 -0
  58. package/knowledge-base/differential-geometry/metric-tensor.en.md +50 -0
  59. package/knowledge-base/differential-geometry/metric-tensor.md +50 -0
  60. package/knowledge-base/differential-geometry/tangent-space.en.md +48 -0
  61. package/knowledge-base/differential-geometry/tangent-space.md +48 -0
  62. package/knowledge-base/information-geometry/fisher-metric.en.md +56 -0
  63. package/knowledge-base/information-geometry/fisher-metric.md +56 -0
  64. package/knowledge-base/information-geometry/natural-gradient.en.md +54 -0
  65. package/knowledge-base/information-geometry/natural-gradient.md +54 -0
  66. package/knowledge-base/lie-theory/equivariance.en.md +54 -0
  67. package/knowledge-base/lie-theory/equivariance.md +54 -0
  68. package/knowledge-base/lie-theory/group-action.en.md +51 -0
  69. package/knowledge-base/lie-theory/group-action.md +51 -0
  70. package/knowledge-base/lie-theory/lie-algebra.en.md +51 -0
  71. package/knowledge-base/lie-theory/lie-algebra.md +51 -0
  72. package/knowledge-base/lie-theory/lie-group.en.md +51 -0
  73. package/knowledge-base/lie-theory/lie-group.md +51 -0
  74. package/knowledge-base/lie-theory/representation.en.md +52 -0
  75. package/knowledge-base/lie-theory/representation.md +52 -0
  76. package/knowledge-base/matrix-analysis/low-rank-approximation.en.md +49 -0
  77. package/knowledge-base/matrix-analysis/low-rank-approximation.md +49 -0
  78. package/knowledge-base/matrix-analysis/matrix-perturbation.en.md +49 -0
  79. package/knowledge-base/matrix-analysis/matrix-perturbation.md +49 -0
  80. package/knowledge-base/matrix-analysis/positive-semidefinite.en.md +50 -0
  81. package/knowledge-base/matrix-analysis/positive-semidefinite.md +50 -0
  82. package/knowledge-base/matrix-analysis/projection.en.md +47 -0
  83. package/knowledge-base/matrix-analysis/projection.md +47 -0
  84. package/knowledge-base/matrix-analysis/spectral-decomposition.en.md +48 -0
  85. package/knowledge-base/matrix-analysis/spectral-decomposition.md +48 -0
  86. package/knowledge-base/optimization/constrained-optimization.en.md +53 -0
  87. package/knowledge-base/optimization/constrained-optimization.md +53 -0
  88. package/knowledge-base/optimization/convex-optimization.en.md +50 -0
  89. package/knowledge-base/optimization/convex-optimization.md +50 -0
  90. package/knowledge-base/optimization/lagrangian-duality.en.md +50 -0
  91. package/knowledge-base/optimization/lagrangian-duality.md +50 -0
  92. package/knowledge-base/optimization/proximal-method.en.md +52 -0
  93. package/knowledge-base/optimization/proximal-method.md +52 -0
  94. package/knowledge-base/optimization/riemannian-optimization.en.md +51 -0
  95. package/knowledge-base/optimization/riemannian-optimization.md +51 -0
  96. package/knowledge-base/overview.en.md +39 -0
  97. package/knowledge-base/overview.md +29 -218
  98. package/knowledge-base/probability/concentration-inequality.en.md +45 -0
  99. package/knowledge-base/probability/concentration-inequality.md +45 -0
  100. package/knowledge-base/probability/entropy.en.md +47 -0
  101. package/knowledge-base/probability/entropy.md +47 -0
  102. package/knowledge-base/probability/fisher-information.en.md +48 -0
  103. package/knowledge-base/probability/fisher-information.md +48 -0
  104. package/knowledge-base/probability/information-bottleneck.en.md +49 -0
  105. package/knowledge-base/probability/information-bottleneck.md +49 -0
  106. package/knowledge-base/probability/kl-divergence.en.md +51 -0
  107. package/knowledge-base/probability/kl-divergence.md +51 -0
  108. package/knowledge-base/topology/euler-characteristic.en.md +54 -0
  109. package/knowledge-base/topology/euler-characteristic.md +54 -0
  110. package/knowledge-base/topology/fundamental-group.en.md +52 -0
  111. package/knowledge-base/topology/fundamental-group.md +52 -0
  112. package/knowledge-base/topology/persistent-homology.en.md +54 -0
  113. package/knowledge-base/topology/persistent-homology.md +54 -0
  114. package/lenses/algorithmic.en.md +49 -0
  115. package/lenses/algorithmic.md +49 -0
  116. package/lenses/axiomatization.en.md +48 -0
  117. package/lenses/axiomatization.md +48 -0
  118. package/lenses/categorical.en.md +48 -0
  119. package/lenses/categorical.md +48 -0
  120. package/lenses/causal.en.md +49 -0
  121. package/lenses/causal.md +49 -0
  122. package/lenses/duality.en.md +47 -0
  123. package/lenses/duality.md +47 -0
  124. package/lenses/game.en.md +50 -0
  125. package/lenses/game.md +50 -0
  126. package/lenses/geometric.en.md +53 -0
  127. package/lenses/geometric.md +53 -0
  128. package/lenses/local-to-global.en.md +52 -0
  129. package/lenses/local-to-global.md +52 -0
  130. package/lenses/perturbation.en.md +51 -0
  131. package/lenses/perturbation.md +51 -0
  132. package/lenses/probabilistic.en.md +48 -0
  133. package/lenses/probabilistic.md +48 -0
  134. package/lenses/projection.en.md +50 -0
  135. package/lenses/projection.md +50 -0
  136. package/lenses/spectral.en.md +52 -0
  137. package/lenses/spectral.md +52 -0
  138. package/lenses/symmetry.en.md +49 -0
  139. package/lenses/symmetry.md +49 -0
  140. package/lenses/topological.en.md +48 -0
  141. package/lenses/topological.md +48 -0
  142. package/lenses/variational.en.md +48 -0
  143. package/lenses/variational.md +48 -0
  144. package/package.json +11 -3
  145. package/references/agentic-workflow.en.md +53 -0
  146. package/references/agentic-workflow.md +2 -0
  147. package/references/books/abstract-algebra.md +9 -5
  148. package/references/books/algebraic-geometry-rising-sea.md +9 -5
  149. package/references/books/differential-geometry.md +7 -3
  150. package/references/books/matrix-analysis.md +8 -4
  151. package/references/books/micro-lie-theory.md +7 -3
  152. package/references/books/optimization-ml.md +5 -1
  153. package/references/books/smooth-manifolds.md +7 -3
  154. package/references/gpu-friendly-math.en.md +65 -0
  155. package/references/gpu-friendly-math.md +4 -2
  156. package/references/inspiration.en.md +113 -0
  157. package/references/inspiration.md +4 -2
  158. package/skills/math-research-activator/SKILL.en.md +187 -0
  159. package/skills/math-research-activator/SKILL.md +162 -108
  160. package/skills/math-research-activator/original-texts.en.md +105 -0
  161. package/skills/math-research-activator/original-texts.md +11 -11
  162. package/commands/abstraction.md +0 -13
  163. package/commands/algorithmic-thinking.md +0 -13
  164. package/commands/axiomatization.md +0 -13
  165. package/commands/causal-inference.md +0 -13
  166. package/commands/discrete-combinatorial.md +0 -13
  167. package/commands/game-theory.md +0 -13
  168. package/commands/induction-analogy.md +0 -13
  169. package/commands/information-theory.md +0 -13
  170. package/commands/logic-deduction.md +0 -13
  171. package/commands/modeling.md +0 -13
  172. package/commands/optimization.md +0 -13
  173. package/commands/probability-statistics.md +0 -13
  174. package/commands/symmetry-invariance.md +0 -13
  175. package/commands/topological-thinking.md +0 -13
  176. package/commands/transformation.md +0 -13
  177. package/skills/abstraction/SKILL.md +0 -119
  178. package/skills/abstraction/original-texts.md +0 -175
  179. package/skills/algorithmic-thinking/SKILL.md +0 -136
  180. package/skills/algorithmic-thinking/original-texts.md +0 -256
  181. package/skills/axiomatization/SKILL.md +0 -149
  182. package/skills/axiomatization/original-texts.md +0 -160
  183. package/skills/causal-inference/SKILL.md +0 -149
  184. package/skills/causal-inference/original-texts.md +0 -167
  185. package/skills/discrete-combinatorial/SKILL.md +0 -129
  186. package/skills/discrete-combinatorial/original-texts.md +0 -185
  187. package/skills/game-theory/SKILL.md +0 -121
  188. package/skills/game-theory/original-texts.md +0 -131
  189. package/skills/induction-analogy/SKILL.md +0 -150
  190. package/skills/induction-analogy/original-texts.md +0 -154
  191. package/skills/information-theory/SKILL.md +0 -138
  192. package/skills/information-theory/original-texts.md +0 -127
  193. package/skills/logic-deduction/SKILL.md +0 -133
  194. package/skills/logic-deduction/original-texts.md +0 -173
  195. package/skills/modeling/SKILL.md +0 -137
  196. package/skills/modeling/original-texts.md +0 -165
  197. package/skills/optimization/SKILL.md +0 -133
  198. package/skills/optimization/original-texts.md +0 -168
  199. package/skills/probability-statistics/SKILL.md +0 -149
  200. package/skills/probability-statistics/original-texts.md +0 -193
  201. package/skills/symmetry-invariance/SKILL.md +0 -137
  202. package/skills/symmetry-invariance/original-texts.md +0 -221
  203. package/skills/topological-thinking/SKILL.md +0 -126
  204. package/skills/topological-thinking/original-texts.md +0 -164
  205. package/skills/transformation/SKILL.md +0 -122
  206. package/skills/transformation/original-texts.md +0 -216
@@ -1,154 +0,0 @@
1
- # 数学出处与经典文献 / Mathematical Sources and Classic Texts
2
-
3
- ## 数学归纳法 / Mathematical Induction (Pascal, 1654)
4
-
5
- **原理**:
6
- > 如果 P(1) 成立,且 P(n) → P(n+1),则 P(n) 对所有正整数 n 成立。
7
- > If P(1) holds and P(n) → P(n+1), then P(n) holds for all positive integers n.
8
-
9
- **哲学含义**:从"有限"推导"无限"——只需基础与递推两步 / Deriving "infinite" from "finite" — just base case and inductive step.
10
-
11
- **经典案例**:1+2+...+n = n(n+1)/2;Fibonacci 性质;图论证明
12
-
13
- ## 强归纳法 / Strong (Complete) Induction
14
-
15
- > 若 P(1)...P(k) 全部成立可推出 P(k+1),则 P(n) 对所有正整数成立。
16
- > If P(1)...P(k) all holding implies P(k+1), then P(n) holds for all n.
17
-
18
- **适用场景**:P(k+1) 依赖多个甚至全部前命题,而非仅 P(k) / When P(k+1) depends on many or all preceding propositions, not just P(k).
19
-
20
- **案例**:唯一分解定理 / Unique factorization;Fibonacci 递推 F(n)=F(n-1)+F(n-2);算术基本定理
21
-
22
- ## 结构归纳法 / Structural Induction
23
-
24
- > 对递归定义结构(列表、树、表达式),证明性质对基础元素成立且在递推步骤中保持,则对所有实例成立。
25
- > For recursively defined structures: prove property holds for base elements and is preserved under construction steps → holds for all instances.
26
-
27
- **计算机科学应用**:编译器正确性;类型系统安全性(良类型程序不崩溃);数据结构不变量(红黑树平衡);算法终止性证明
28
-
29
- **案例**:|L₁ ++ L₂| = |L₁| + |L₂|;树高度 ≤ 节点数
30
-
31
- ## 超限归纳法 / Transfinite Induction (Cantor Ordinals)
32
-
33
- > 若对所有 γ < β,P(γ) 成立可推出 P(β) 成立,则 P(α) 对所有序数 α 成立。
34
- > If P(γ) for all γ < β implies P(β), then P(α) holds for all ordinals α.
35
-
36
- **意义**:归纳超越自然数——对任意良序集成立 / Induction extends beyond naturals — applies to any well-ordered set.
37
-
38
- **关键概念**:Cantor 序数 ω, ω+1, ω·2, ω², ω^ω...;Zorn 引理等价性;应用:证明每个向量空间都有基
39
-
40
- ## 良序原理 / Well-Ordering Principle
41
-
42
- > 自然数的每个非空子集有最小元素,与数学归纳法逻辑等价。
43
- > Every nonempty subset of naturals has a least element; logically equivalent to mathematical induction.
44
-
45
- **等价论证**:良序→归纳:反例集有最小元 m,则 P(m-1) 成立而 P(m) 不成立,矛盾。归纳→良序:用归纳法证每个非空子集含最小元。
46
-
47
- **推广**:良序定理(Zermelo 1904)——任何集合可良序化,与选择公理等价。
48
-
49
- ## Pólya《数学与猜想》/ *Mathematics and Plausible Reasoning* (1954)
50
-
51
- > "归纳、类比、特例化、一般化——发现数学真理的主要方法。"
52
- > "Induction, analogy, specialization, generalization—principal methods of discovering mathematical truths."
53
-
54
- **归纳模式**:1. 观察案例 → 2. 发现模式 → 3. 提出猜想 → 4. 验证(证明或证伪)
55
-
56
- ## 类比的数学地位 / Mathematical Status of Analogy
57
-
58
- > "类比是发现的工具,不是证明的工具。" / "Analogy is a tool for discovery, not for proof."
59
-
60
- **经典类比**:声波→光波动理论;行星轨道→Bohr 原子模型;水流→电流(电压≈水压)
61
-
62
- ## Euler 与 Basel 问题 / Euler and the Basel Problem (1735)
63
-
64
- > Euler 通过归纳发现 ∑1/n² = π²/6 ——数学史上最著名的归纳发现。
65
- > Euler discovered ∑1/n² = π²/6 by inductive reasoning — the most celebrated inductive discovery in mathematics.
66
-
67
- **归纳过程**:计算部分和 ≈1.6449 → 识别 π²/6 → 类比 sin(x) 无穷乘积与多项式根系数关系 → 严格证明。Pólya 专门以此说明"合情推理"。
68
-
69
- ## Fermi 方法 / Fermi Estimation
70
-
71
- > 通过类比和数量级估计解决未知问题 / Solve unknowns via analogy and order-of-magnitude estimation.
72
-
73
- **经典问题**:"芝加哥有多少钢琴调音师?":人口~300万→~100万户→1/20有钢琴→~5万台→每年调1次×2小时→调音师2000小时/年→≈50名调音师
74
-
75
- **价值**:合理的类比估计可得数量级正确答案 / Reasonable analogy yields order-of-magnitude correct results.
76
-
77
- ## Mill 五种归纳方法 / Mill's Five Methods (1843)
78
-
79
- > Mill 在《逻辑体系》中系统化归纳推理 / Mill systematized inductive reasoning in *A System of Logic*.
80
-
81
- 1. **一致法 / Agreement**:多场合仅一共同情况→该情况可能为原因
82
- 2. **差异法 / Difference**:两场合仅一情况不同→该差异可能为原因
83
- 3. **联合法 / Joint Method**:一致+差异结合,增强可信度
84
- 4. **共变法 / Concomitant Variations**:现象随某情况变化而变化→因果关系
85
- 5. **残差法 / Residue**:扣除已知原因效应后,剩余效应由剩余原因解释
86
-
87
- ## Ramanujan:直觉归纳 / Ramanujan: Intuitive Induction (1887–1920)
88
-
89
- > Ramanujan 以惊人模式识别发现公式,常无形式证明——直觉归纳天才。
90
- > Ramanujan discovered formulas via astonishing pattern recognition, often without formal proof — genius of intuitive induction.
91
-
92
- **案例**:1/π 级数从少数项推广到一般形式;mock theta 函数(模式描述了,证明延迟数十年)。Hardy:"他的直觉近乎超自然,但逻辑常缺。"
93
-
94
- **教训**:归纳发现可远超前于证明——直觉与严格性的张力是数学发展的动力。
95
-
96
- ## Borwein 积分:归纳警醒 / Borwein Integrals: Cautionary Tale (2000s)
97
-
98
- > 模式持续很久然后突然断裂——归纳推理的深刻警示。
99
- > A pattern holds for many terms then suddenly breaks — a profound warning about inductive reasoning.
100
-
101
- **现象**:∫sin(x)/x dx = π/2;加入 sin(x/3) 仍 = π/2;...持续到 sin(x/13);但加入 sin(x/15) 时突然偏离!数学根源:Patel-Vital 条件。
102
-
103
- **教训**:前 N 个案例成立,第 N+1 个可能打破模式。归纳结论需理论支撑,不能仅依赖经验 / First N cases may hold while case N+1 breaks. Inductive conclusions need theoretical support.
104
-
105
- ## Lakatos《证明与反驳》/ *Proofs and Refutations* (1963/1976)
106
-
107
- > 数学发现不是线性"猜想→证明",而是通过反驳、怪物排除、引理嵌入不断演进。
108
- > Mathematical discovery evolves through counterexamples, monster-barring, and lemma-incorporation — not linear "conjecture→proof".
109
-
110
- **核心概念**:怪物排除 / Monster-barring(修改定义排除反例);引理嵌入 / Lemma-incorporation(将反例条件加入前提);概念拉伸 / Concept-stretching(反例推动概念扩展)
111
-
112
- **案例**:多面体 Euler 公式 V-E+F=2 的证明生成——从 Cauchy 朴素证明到对空洞、隧道的逐步修正。
113
-
114
- ## Hume 归纳问题 / Hume's Problem of Induction (1739)
115
-
116
- > "过去太阳每天升起,不能逻辑保证明天也会升起。"
117
- > "The sun has risen every day in the past; this does not logically guarantee it will rise tomorrow."
118
-
119
- **本质缺陷**:从有限到无限永远存在不确定性 / Deriving infinite from finite always carries uncertainty.
120
-
121
- **科学方法解决**:归纳产假说(非定理)→ 可证伪(Popper)→ 持续检验 → 反例则修正/放弃
122
-
123
- ## Carnap 归纳逻辑 / Carnap's Inductive Logic (1950s)
124
-
125
- > Carnap 试图形式化量化归纳推理——为归纳概率建立逻辑基础。
126
- > Carnap attempted to formalize and quantify inductive reasoning — a logical foundation for inductive probability.
127
-
128
- **核心**:确证函数 c(h,e)——证据 e 对假说 h 的确证度 / Confirmation function c(h,e): degree of confirmation. 归纳逻辑应有严格规则;先验概率基于逻辑对称性而非主观信念。
129
-
130
- **局限**:系统对语言框架高度敏感——不同谓词集导致不同确证度;Goodman "绿蓝悖论"(grue paradox) 进一步揭示困难。
131
-
132
- ## 不充分决定 / Problem of Underdetermination
133
-
134
- > 多个类比或理论可同等吻合同一数据——数据不充分决定理论选择。
135
- > Multiple analogies or theories equally fit the same data — data underdetermines theory choice.
136
-
137
- **数学类比**:有限数据点→无数函数可拟合;多个归纳假说可能同时与经验一致;理论选择需额外准则:简洁性、解释力、预测力。
138
-
139
- **哲学根源**:Quine-Duhem 论题——任何假说可通过调整辅助假说免于证伪。
140
-
141
- ## 机器学习作为归纳 / Machine Learning as Induction
142
-
143
- > 机器学习是归纳推理的工程化——从数据推断一般规律。
144
- > Machine learning is the engineering of inductive reasoning — inferring general rules from data.
145
-
146
- **统计学习理论**:PAC 学习(Valiant 1984)——以高概率输出低误差假说;泛化界限——样本复杂度与假说类复杂度定量关系;VC 维度——衡量"归纳能力"的数学指标。
147
-
148
- **与数学归纳对比**:数学归纳=无限域确定性推理;统计归纳=有限样本概率性推理;泛化=归纳跳跃
149
-
150
- ## 类比思维的力量与局限 / Power and Limits of Analogy
151
-
152
- **力量**:跨领域迁移知识(最重要创新来源之一);将未知转化为已知;产生新思路和假说
153
-
154
- **局限**:类比不是证明——结论需独立验证;表面相似 ≠ 结构相似;每个类比有失效点——两个领域不可能完全同构
@@ -1,138 +0,0 @@
1
- ---
2
- name: information-theory
3
- description: |
4
- 触发:问题需量化不确定性、以"信息=不确定性的减少"度量信息价值;或需计算熵/互信息/KL 散度/信道容量,为压缩/KV 压缩/量化/路由设计信息准则时调用。
5
- English: Trigger when a problem needs to quantify uncertainty, measure information value as "information = reduction of uncertainty"; or compute entropy / mutual information / KL divergence / channel capacity, or design information criteria for compression / KV-cache compression / quantization / routing.
6
- ---
7
-
8
- # 📡 信息论思想 / Information Theory
9
-
10
- > "信息是不确定性的减少——知道更多意味着怀疑更少。"
11
- > "Information is reduction of uncertainty — knowing more means doubting less."
12
- >
13
- > —— 信息论、编码理论、统计推断 / Information Theory, Coding Theory, Statistical Inference
14
-
15
- ## 核心原则 / Core Principle
16
-
17
- **信息是不确定性的减少——不确定性可由熵精确量化,压缩与通信存在由熵限与信道容量刻画的不可逾越极限,信息增益则指导在不确定性下应优先获取何种观察。**
18
-
19
- **Information is reduction of uncertainty — uncertainty is precisely quantified by entropy; compression and communication have unbreakable limits set by the entropy bound and channel capacity; information gain guides which observation to prioritize under uncertainty.**
20
-
21
- > **数学形式化 / Mathematical Formalization**
22
- >
23
- > Shannon 熵 $H(X) = -\sum_x p(x)\log p(x)$ 量化随机变量的平均"惊奇度"——概率越低的事件发生时惊奇越大,熵是惊奇度的期望。
24
- >
25
- > 互信息 $I(X;Y) = H(X) - H(X|Y) = \sum_{x,y} p(x,y)\log\frac{p(x,y)}{p(x)p(y)}$,即观察 $Y$ 后对 $X$ 不确定性的减少——这正是"信息"的数学定义。
26
- >
27
- > KL 散度 $D_{KL}(P\|Q) = \sum_x p(x)\log\frac{p(x)}{q(x)}$ 衡量用 $Q$ 替代 $P$ 的信息损失,**不对称** $D(P\|Q)\neq D(Q\|P)$。
28
- >
29
- > 信源编码定理:最优压缩的平均编码长度 $\ge H(X)$ bits/symbol,低于熵限则必然丢失信息。
30
- >
31
- > 信道编码定理:可靠通信的速率上限为信道容量 $C = \max_{p(x)} I(X;Y)$;$R<C$ 时存在编码使误码率趋零,$R>C$ 时可靠通信不可能。
32
- >
33
- > 率失真函数 $R(D) = \min_{p(\hat{x}|x):\,\mathbb{E}[d(x,\hat{x})]\le D} I(X;\hat{X})$ 给定失真 $D$ 下的最小信息率——有损压缩的极限。
34
- >
35
- > 详细数学依据见 `original-texts.md`。
36
-
37
- ## GPU 友好性 / GPU-Friendliness(横切检查)
38
-
39
- 信息论量用于**压缩/剪枝/量化/KV 压缩/路由设计**时,须过 `../../references/gpu-friendly-math.md` 八维门。核心判据:**局部、可融合的熵/KL 估计 = 友好;全局精确信息估计 = 不友好**。
40
-
41
- - **量化校准(per-block 熵/Hessian)**:局部、可批量 GEMM 化、低精度可行——友好(维度 1/2/5)。
42
- - **KV-Cache 压缩(信息瓶颈/块摘要)**:低秩块摘要压缩显存——友好(维度 4);Plücker 式块摘要见 `../../references/books/algebraic-geometry-rising-sea.md`。
43
- - **互信息剪枝/特征选择**:用局部或低秩近似估计 $I(X;Y)$ 则可改造;若需全分布精确估计则不友好。
44
- - **信息增益路由**:全局精确 $I(X;Y)$ 需 $O(n^2)$ 显存、高精度、不可融合——反模式;改用 softmax/热带门控等连续可微近似(维度 3/6/8)。
45
- - **反模式**:在完整 token 分布上精确计算熵/互信息——显存爆炸、需 fp64、串行依赖,"美但不可算"。
46
-
47
- 八维最低判定(正式术语):**张量化**看熵/KL/MI 是否可按 token/block/batch 估计;**GEMM 可映射**看压缩、投影、校准是否落线性代数;**复杂度**避免全分布精确估计;**显存与 KV-Cache**量化 KV/激活/码本占用;**低精度稳定**检查 log/softmax/KL 动态范围;**并行与通信**看分块统计是否可跨设备归约;**稀疏结构**看码本/路由是否块结构化;**算子融合**看统计、mask、量化能否融合。
48
-
49
- > 配合 `../../references/books/matrix-analysis.md`(低秩压缩)、`../../references/books/abstract-algebra.md`(编码/有限域)。
50
-
51
- ## 不适用场景 / When NOT to Use
52
-
53
- - **问题无概率结构**(如纯粹符号推理、逻辑演绎)——熵与信息增益需要概率分布,无概率则无信息论。
54
- - **纯确定性场景无不确定性**(如已知精确答案的数学问题)——熵为零时信息论退化为平凡结论。
55
- - **定性判断无需量化**(如美学评价、情感判断)——信息论量化的是概率意义上的不确定性,非语义歧义。
56
-
57
- ## 何时使用 / When to Use
58
-
59
- - 需要度量不确定性的大小(熵 $H(X)$ 量化随机变量的"混乱程度")。
60
- - 需要比较不同信息源的价值(互信息 $I(X;Y)$ 衡量哪个观察 $Y$ 最能减少关于 $X$ 的不确定性)。
61
- - 需要最优数据压缩(信源编码定理保证最优压缩极限为 $H(X)$ bits/symbol)。
62
- - 需要在噪声环境下可靠通信(信道编码定理保证 $R<C$ 时可靠传输可行)。
63
- - 需要特征选择或模型选择(互信息筛选特征,AIC/BIC/MDL 作为信息准则选择模型)。
64
- - 需要贝叶斯模型比较(KL 散度 $D(P\|Q)$ 衡量分布间信息距离,贝叶斯因子量化模型间证据比)。
65
- - **为压缩 / KV-Cache 压缩 / 量化 / 路由设计信息准则**,并评估其 GPU 可行性。
66
-
67
- ## 方法流程 / Method
68
-
69
- ### 第一步:识别信息源与不确定度 / Identify Source and Uncertainty
70
- - **随机变量 $X$** 是什么?——定义信息源,明确要研究的不确定性对象。
71
- - **概率分布 $p(x)$**——离散分布用概率表,连续分布用密度函数。
72
- - **计算 $H(X) = -\sum p(x)\log p(x)$**——量化当前不确定性水平。
73
- - **识别要减少的不确定性**——明确"知道什么之后不确定性会降低?"
74
-
75
- ### 第二步:量化信息增益 / Quantify Information Gain
76
- - **计算条件熵 $H(X|Y)$**——观察 $Y$ 之后 $X$ 的剩余不确定性。
77
- - **计算互信息 $I(X;Y) = H(X) - H(X|Y)$**——$Y$ 对 $X$ 提供的信息量。
78
- - **识别最优观察**——哪个 $Y$ 使 $I(X;Y)$ 最大?该观察最值得获取。
79
- - **链式规则**——$H(X_1,\dots,X_n) = H(X_1) + H(X_2|X_1) + \dots + H(X_n|X_1,\dots,X_{n-1})$,逐变量拆解联合不确定性。
80
-
81
- ### 第三步:选择编码策略 / Choose Coding Strategy
82
- - **信源编码(压缩)**:Huffman 编码(贪心最优前缀码,平均长度接近 $H(X)$)、算术编码(更接近熵限)、通用编码(LZ77/LZ78/LZW,无需已知分布)。
83
- - **信道编码(纠错)**:Hamming 码(最小距离 3,纠正 1 位错)、Reed-Solomon 码(突发纠错)、LDPC/Turbo 码(逼近 Shannon 极限)。
84
- - **编码选择原则**:压缩需求用信源编码→逼近 $H(X)$;噪声防护用信道编码→逼近 Shannon 极限 ($R\to C$)。
85
-
86
- ### 第四步:评估信道容量 / Evaluate Channel Capacity
87
- - **计算信道容量 $C = \max_{p(x)} I(X;Y)$**——在所有输入分布上最大化互信息。
88
- - **比较传输速率 $R$ 与容量 $C$**:$R<C$ → 可靠通信可行;$R>C$ → 必定出错。
89
- - **噪声模型**:BSC(二元对称信道,翻转概率 $p$)、BEC(二元擦除信道,擦除概率 $\varepsilon$)、AWGN(加性白高斯噪声信道)。
90
- - **容量公式示例**:BSC 容量 $C = 1 - H(p)$;AWGN 容量 $C = \frac{1}{2}\log(1 + S/N)$。
91
-
92
- ### 第五步:应用信息准则 / Apply Information Criteria
93
- - **AIC(赤池信息准则)**:$\text{AIC} = -2\ln L + 2k$——偏重拟合,适合预测目标。
94
- - **BIC(贝叶斯信息准则)**:$\text{BIC} = -2\ln L + k\ln n$——偏重简约,适合解释目标。
95
- - **KL 散度 $D_{KL}(P\|Q) = \sum p(x)\log\frac{p(x)}{q(x)}$**——衡量用 $Q$ 替代 $P$ 的信息损失,注意不对称性。
96
- - **MDL 原则(最小描述长度)**:选择使"数据描述长度 + 模型描述长度"最小的模型——信息论版本的奥卡姆剃刀。
97
-
98
- ### 第六步:做出信息最优决策 / Make Information-Optimal Decision
99
- - **贝叶斯实验设计**:选择使期望信息增益 $\max\,\mathbb{E}[I(\theta;Y)]$ 最大的实验——优先获取最能减少不确定性的数据。
100
- - **最小化 KL 散度**:决策输出分布 $Q$ 应尽量接近目标分布 $P$,即 $\min D(P\|Q)$。
101
- - **最大熵原则**:在已知约束下选择使 $H(X)$ 最大的分布——最少假设,最保守推断。
102
- - **信息瓶颈**:$\min I(X;T) - \beta I(T;Y)$——在压缩 $X$ 为 $T$ 时保留关于 $Y$ 的最大相关信息。
103
-
104
- ## 常见错误 / Common Errors
105
-
106
- | 错误 / Error | 批评 / Critique | 正确做法 / Correct Approach |
107
- |---|---|---|
108
- | 把信息等同于比特而非概率减少 | 熵 $H(X)$ 是概率分布的函数,比特只是量化单位 | 理解信息为不确定性的减少 $I(X;Y)=H(X)-H(X\|Y)$ |
109
- | 忽视信道容量极限 | $R>C$ 时无论何种编码都不能可靠通信 | 计算容量 $C=\max I(X;Y)$,确保 $R<C$ |
110
- | 混淆熵与方差 | 熵度量概率结构的"扩散度",方差度量数值"展开度",两者不等价 | 概率不确定性用熵,数值偏差用方差;连续熵可为负 |
111
- | 过度压缩低于熵限 | 最优压缩 $\ge H(X)$ bits/symbol,低于此限必然丢信息 | 接受熵限并据此设计编码 |
112
- | 忽视 KL 散度不对称性 | $D(P\|Q)\ne D(Q\|P)$,方向不同含义不同 | 明确方向:$D(P\|Q)$ 用于"用 $Q$ 编码 $P$ 的额外代价" |
113
- | 把相关性等同于信息 | 相关 $\rho$ 仅衡量线性关联;$I(X;Y)=0 \Leftrightarrow$ 独立,但 $\rho=0 \not\Rightarrow$ 独立 | 用互信息 $I(X;Y)$ 评估依赖关系 |
114
- | 把定性判断强行量化 | 信息论量化概率不确定性,非语义歧义或主观感受 | 区分概率不确定性与语义歧义,不对定性问题套熵公式 |
115
- | 全局精确熵/互信息不可算 | 在完整分布上精确估计 $I(X;Y)$ 需 $O(n^2)$ 显存与高精度,GPU 不可行 | 用局部/采样/低秩估计,过 GPU 八维门 |
116
-
117
- ## 操作规程 / Operating Procedure
118
-
119
- 当本 skill 被触发时,输出必须包含:
120
-
121
- 1. **[信息源]:[描述]** $H(X)=$ [值]——定义随机变量 $X$,计算其熵,量化当前不确定性。
122
- 2. **[信息增益]:[描述]** $I(X;Y)=$ [值]——计算互信息,识别最有价值的观察 $Y$。
123
- 3. **[编码策略]:[选择]**——信源编码(压缩)或信道编码(纠错),说明逼近哪种极限。
124
- 4. **[信道容量]:[描述]** $C=$ [值]——计算信道容量,比较传输速率 $R$ 与 $C$。
125
- 5. **[信息准则]:[AIC/BIC/KL/MDL]**——说明选择的信息准则及理由。
126
- 6. **[最优决策]:[说明]**——基于信息增益最大化或 KL 散度最小化的决策建议。
127
- 7. **[GPU 可行性]**(若用于压缩/KV 压缩/量化/路由)——熵/KL/互信息估计是局部可融合还是全局精确?过八维门,标注友好/可改造/不友好 + 改造建议。
128
-
129
- **输出不得只给分析而无结论。**
130
-
131
- ## 与其他 skill 的关系 / Relations to Other Skills
132
-
133
- - **概率与统计**:熵与信息增益补充概率推理——$H(X)$ 度量分布不确定性,$I(X;Y)$ 是贝叶斯更新的信息论表达。
134
- - **优化思想**:信道容量最大化是优化问题——$C=\max_{p(x)} I(X;Y)$ 是输入分布上的最优化。
135
- - **变换思想**:编码是信息空间的变换——信源编码变换为高效表示,信道编码变换为抗干扰表示。
136
- - **建模思想**:信息准则指导模型选择——AIC/BIC/MDL 从信息论角度量化拟合与复杂度权衡。
137
- - **算法思想**:压缩算法是计算实现——Huffman/LZ/LDPC 等算法是信息论极限的逼近实现。
138
- - **现代数学激活**:`../../references/books/matrix-analysis.md`(低秩压缩)、`../../references/books/abstract-algebra.md`(编码/有限域)、`../../references/books/algebraic-geometry-rising-sea.md`(Plücker KV 压缩)。
@@ -1,127 +0,0 @@
1
- # 数学出处与经典文献 / Mathematical Sources and Classic Texts
2
-
3
- ## Shannon 信息论 / Shannon's Information Theory (1948)
4
-
5
- > H(X) = −Σ p(x) log p(x) —— 熵,信息源的平均不确定性
6
- > I(X;Y) = H(X) − H(X|Y) —— 互信息,观察 Y 对 X 的信息贡献
7
- > C = max_{p(x)} I(X;Y) —— 信道容量,可靠通信的速率上限
8
- >
9
- > 信源编码定理:最优压缩 ≥ H(X) bits/symbol
10
- > 信道编码定理:R < C 时存在编码方案使误码率趋零
11
-
12
- **含义**:信息可以被精确量化;压缩与通信存在不可逾越的数学极限,而非仅受工程水平限制。熵度量"平均惊奇"——低概率事件发生时带来的信息量更大。互信息度量"不确定性减少"——观察 Y 使我们对 X 的不确定降低了多少。
13
-
14
- **数学背景**:Claude Shannon 在《A Mathematical Theory of Communication》(1948) 中创立信息论。核心贡献:(1) 定义熵 H(X) = −Σ p(x) log p(x),对数基底选择决定单位(基底 2 → bits,基底 e → nats);(2) 信源编码定理证明最优前缀码平均长度 L ≥ H(X),等号当且仅当所有概率为 2 的幂次时成立;(3) 信道编码定理证明 R < C 时存在编码序列使 P(error) → 0,R > C 时 P(error) > 0 不可避免。Shannon 的证明是随机编码论证——构造随机码本后证明"典型"码的误码率趋零,再指出至少存在一个这样的码。
15
-
16
- ## Huffman 编码 / Huffman Coding (1952)
17
-
18
- > 贪心构造最优前缀码:每次合并概率最小的两个符号,自底向上建树。
19
- > 平均编码长度 L(Huffman) ≤ H(X) + 1,当概率为 2 的幂次时 L = H(X)。
20
-
21
- **含义**:最优前缀码(无歧义解码)可通过贪心算法精确构造,平均长度接近熵限。
22
-
23
- **数学背景**:David Huffman 在 1952 年作为 MIT 学生发表此算法,证明其最优性。Huffman 编码是变长前缀码——较频繁的符号用较短的码字,保证任何码字不是另一码字的前缀(前缀条件),从而可即时解码(instantaneous decoding)。当符号概率不全是 2 的幂次时,Huffman 编码平均长度严格大于 H(X);算术编码将整个消息编码为一个区间,可更接近熵限。
24
-
25
- ## Hamming 码 / Hamming Codes (1950)
26
-
27
- > [7,4] Hamming 码:4 位信息 + 3 位校验 = 7 位码字,最小 Hamming 距离 d_min = 3
28
- > 可纠正 1 位错误或检测 2 位错误
29
- > 一般 [2^r−1, 2^r−1−r] Hamming 码:r 位校验,最小距离 3
30
-
31
- **含义**:纠错编码的第一个系统构造——少量冗余即可保护信息免受噪声损坏。
32
-
33
- **数学背景**:Richard Hamming 在 Bell 实验室工作时,因早期计算机的硬件错误导致程序崩溃,于是设计了第一个系统化的纠错码。Hamming 距离 d(x,y) = 两个二进制串不同位置的个数;最小距离 d_min ≥ 2t+1 时可纠正 t 位错误。Hamming 码是完美码(perfect code)——球 packing 恰好填满整个空间。后续发展:Reed-Solomon 码(1960)用于突发纠错和 CD/DVD;LDPC 码(Gallager 1962)和 Turbo 码(1993)逼近 Shannon 极限。
34
-
35
- ## Kolmogorov 复杂度 / Kolmogorov Complexity (1965)
36
-
37
- > K(x) = 输出 x 的最短程序长度(在通用 Turing 机上)
38
- > Kolmogorov 复杂度是信息的算法度量——与 Shannon 熵互补
39
- >
40
- > 不可计算性:K(x) 不可一般计算(Chaitin 不完备定理)
41
-
42
- **含义**:最短程序描述长度是对象的内在信息量——比 Shannon 熵更本质的信息度量,不依赖概率分布。
43
-
44
- **数学背景**:Andrey Kolmogorov 在 1965 年提出算法信息论,定义 K(x) 为在通用 Turing 机 U 上输出 x 的最短程序 |p| 的长度:K_U(x) = min{|p| : U(p) = x}。关键性质:(1) 不可计算性——不存在算法一般地计算 K(x);(2) 不变定理——不同通用 Turing 机上的 K_U(x) 差异至多为常数 c(依赖于机器选择);(3) 与熵的关系——对 i.i.d. 序列,E[K(x)] ≈ nH(X)(Shannon 熵的算法版本);(4) Chaitin 不完备定理——形式系统不能证明 K(x) > c 对大多数 x 成立。Kolmogorov 复杂度是 MDL 原则的理论根基。
45
-
46
- ## KL 散度 / KL Divergence (Kullback-Leibler, 1951)
47
-
48
- > D(P||Q) = Σ p(x) log(p(x)/q(x)) = E_P[log(p(X)/q(X))]
49
- >
50
- > D(P||Q) ≥ 0,等号当且仅当 P = Q
51
- > D(P||Q) ≠ D(Q||P)——不对称
52
- > D(P||Q) 不是距离(不对称、不满足三角不等式)
53
-
54
- **含义**:KL 散度度量"用 Q 分布编码 P 分布的数据所需的额外比特数"——信息损失的单向度量。
55
-
56
- **数学背景**:Solomon Kullback 与 Richard Leibler 在 1951 年提出相对熵(relative entropy),定义为 D(P||Q) = Σ p(x) log(p(x)/q(x))。核心性质:(1) 非负性 D(P||Q) ≥ 0(由 Gibbs 不等式证明);(2) 不对称性 D(P||Q) ≠ D(Q||P)——D(P||Q) 的解释是"用 Q 编码 P 的数据的期望额外长度",方向不可互换;(3) 与互信息的关系 I(X;Y) = D(p(x,y)||p(x)p(y))——互信息是联合分布与独立假设分布间的 KL 散度;(4) 与熵的关系 H(P) + D(P||Q) = Σ p(x)(−log q(x))——交叉熵 = 熵 + KL 散度。交叉熵损失函数是深度学习的核心:min H(P) + D(P||Q) = min Σ p(x)(−log q(x))。
57
-
58
- ## 码率-失真理论 / Rate-Distortion Theory (Shannon, 1959)
59
-
60
- > R(D) = min_{p(z|x): E[d(x,z)]≤D} I(X;Z)
61
- >
62
- > 在允许失真 D 的条件下,所需的最小码率 R(D)
63
- > R(0) = H(X)(无损压缩),R(D_max) = 0(最大允许失真)
64
-
65
- **含义**:有损压缩存在码率-失真函数 R(D) 的基本极限——更低的码率需要接受更大的失真。
66
-
67
- **数学背景**:Shannon 在 1959 年扩展信源编码定理到有损压缩情形。码率-失真函数 R(D) 定义为在期望失真 E[d(x,z)] ≤ D 的约束下最小化互信息 I(X;Z)。失真度量 d(x,z) 可选 Hamming 失真(二元)、平方误差(连续)等。R(D) 单调递减、凸函数——失真容忍越大,所需码率越低。逆函数 D(R) 给出给定码率下的最小可达失真。实际应用:JPEG/MPEG 压缩、语音编码等遵循此理论框架。
68
-
69
- ## Fisher 信息 / Fisher Information (1925)
70
-
71
- > I(θ) = E[(∂log f(X;θ)/∂θ)²] = −E[∂²log f(X;θ)/∂θ²]
72
- >
73
- > Cramér-Rao 下界:Var(θ̂) ≥ 1/I(θ),对任何无偏估计量 θ̂
74
- > Fisher 信息度量数据对参数 θ 的信息含量
75
-
76
- **含义**:Fisher 信息是统计推断的信息论度量——它连接了信息论与参数估计的理论极限。
77
-
78
- **数学背景**:R.A. Fisher 在 1925 年提出信息量概念 I(θ),度量一个观测对参数 θ 的区分能力。Cramér (1946) 与 Rao (1945) 分别独立证明了 Cramér-Rao 下界 Var(θ̂) ≥ 1/nI(θ)。关键联系:(1) Fisher 信息与 KL 散度——I(θ) = lim_{θ'→θ} 2D(f(x;θ)||f(x;θ'))/(θ−θ')²,KL 散度的局部二阶近似;(2) Fisher 信息与 Bayesian 信息——Jeffreys 先验 p(θ) ∝ |I(θ)|^(1/2) 使得参数空间中 Fisher 信息度量下的体积均匀;(3) 最大似然估计的大样本性质——θ̂_MLE 渐近正态 N(θ, 1/nI(θ)),达到 Cramér-Rao 下界。Fisher 信息是信息论与统计推断的桥梁。
79
-
80
- ## MDL 原则 / MDL Principle (Rissanen, 1978)
81
-
82
- > MDL(M, D) = L(D|M) + L(M)
83
- >
84
- > 选择使"数据给定模型的描述长度 + 模型本身的描述长度"最小的模型
85
- > L(D|M) = −log P(D|M)(数据的负对数似然)
86
- > L(M) = 模型编码长度(复杂度惩罚)
87
-
88
- **含义**:MDL 是信息论版本的奥卡姆剃刀——好模型既准确(数据描述短)又简约(模型描述短)。
89
-
90
- **数学背景**:Jorma Rissanen 在 1978 年提出最小描述长度原则,将模型选择转化为编码问题。MDL 与其他准则的关系:(1) MDL 与 BIC——两参数 MDL(L(D|M)+L(M))与 BIC (−2lnL+k·ln(n)) 在大样本下等价;(3) MDL 与 Kolmogorov 复杂度——理想 MDL 用 Kolmogorov 复杂度 K(M) 庡量模型复杂度,但 K(M) 不可计算;实际 MDL 用参数编码长度近似。先验 MDL(1996)用混合编码处理参数,避免任意精度问题。MDL 的核心洞见:模型选择本质上是数据压缩——最好的模型是压缩数据最好的模型。
91
-
92
- ## 互信息与信道容量 / Mutual Information and Channel Capacity
93
-
94
- > I(X;Y) = H(X) − H(X|Y) = H(Y) − H(Y|X) = H(X) + H(Y) − H(X,Y)
95
- >
96
- > 互信息的对称性:I(X;Y) = I(Y;X)
97
- > 互信息的非负性:I(X;Y) ≥ 0,等号当且仅当 X,Y 独立
98
- >
99
- > 信道容量 C = max_{p(x)} I(X;Y)
100
- > 典型集 A_ε^n:{x^n : |−log p(x^n)/n − H(X)| < ε}
101
-
102
- **含义**:互信息是两个随机变量间依赖关系的精确度量——为零等价于独立,为正则存在统计关联。信道容量是互信息在所有输入分布上的最大值,定义可靠通信的理论极限。
103
-
104
- **数学背景**:互信息 I(X;Y) = Σ p(x,y) log(p(x,y)/p(x)p(y)) = D(p(x,y)||p(x)p(y))——联合分布与独立假设分布间的 KL 散度。典型集是 Shannon 证明编码定理的关键工具:对 i.i.d. 信源 X^n,典型序列 x^n 满足 |−1/n log p(x^n) − H(X)| < ε;典型集的概率趋近 1(当 n→∞),但典型集的大小 ≈ 2^{nH(X)},远小于整个空间 2^n(当 H(X) < 1)。这解释了为何压缩到 nH(X) bits 即可覆盖几乎所有有效序列。
105
-
106
- ## 联合熵、条件熵与链式规则 / Joint Entropy, Conditional Entropy, and Chain Rules
107
-
108
- > H(X,Y) = H(X) + H(Y|X) —— 联合熵链式规则
109
- > H(Y|X) = Σ p(x) H(Y|X=x) —— 条件熵
110
- > I(X;Y) = H(X) − H(X|Y) = H(Y) − H(Y|X) —— 互信息
111
- > I(X;Y|Z) = H(X|Z) − H(X|Y,Z) —— 条件互信息
112
- > I(X₁;X₂;...;Xₙ) 的链式展开:I(X;Y,Z) = I(X;Y) + I(X;Z|Y)
113
-
114
- **含义**:熵的链式规则将联合不确定性拆解为逐个变量的贡献——理解多变量系统的信息结构。
115
-
116
- **数学背景**:联合熵 H(X,Y) = −Σ p(x,y) log p(x,y) 度量一对随机变量的总不确定性。链式规则 H(X,Y) = H(X) + H(Y|X) 说明:知道 X 后,Y 的额外不确定性是 H(Y|X)。推广到 n 个变量:H(X₁,...,Xₙ) = Σᵢ H(Xᵢ|X₁,...,Xᵢ₋₁)。条件互信息 I(X;Y|Z) 度量"在已知 Z 的条件下,Y 对 X 的额外信息量"——这是信息瓶颈和因果推断的关键工具。多变量互信息的链式展开:I(X;Y,Z) = I(X;Y) + I(X;Z|Y),说明 Y 和 Z 对 X 的联合信息等于 Y 的直接信息加上 Z 的条件信息。
117
-
118
- ## 信息论与编码理论的日常洞见
119
-
120
- > "信息论的核心不是计算精确的比特数,而是养成'不确定性可量化、信息有价值、极限不可逾越'的思维习惯。"
121
-
122
- - 不要忽视不确定性——熵 H(X) 量化它
123
- - 信息有方向和大小——互信息 I(X;Y) 度量它
124
- - 压缩有极限——信源编码定理限定它
125
- - 通信有极限——信道编码定理限定它
126
- - 模型选择有信息论标准——AIC/BIC/MDL 指导它
127
- - 概率分布间有信息距离——KL 散度衡量它
@@ -1,133 +0,0 @@
1
- ---
2
- name: logic-deduction
3
- description: |
4
- 触发:检查证明严谨性、形式逻辑分析、前提审查、谓词逻辑推理验证、量词结构分析、发现逻辑漏洞;或为算法正确性/不变量做形式推导与证明验证时调用。
5
- English: Trigger when checking proof rigor, formal logic analysis, premise auditing, predicate logic verification, quantifier structure analysis, discovering logical loopholes; or doing formal derivation and proof verification for algorithm correctness or invariants.
6
- ---
7
-
8
- # 🧠 逻辑演绎 / Logic Deduction
9
-
10
- > "逻辑是数学的家规——一切推理必须在形式规则的监督下进行。"
11
- > "Logic is the house rule of mathematics — all reasoning must proceed under the supervision of formal rules."
12
- >
13
- > —— 哥德尔完备性定理 (1929),一阶逻辑
14
- > —— Gödel's Completeness Theorem (1929), First-Order Logic
15
-
16
- ## 核心原则 / Core Principle
17
-
18
- 从真前提严格推理新真命题——推理链条的每一步都必须合法。推理类型:演绎(前提真+规则有效→结论必然真,最可靠)、归纳(实例→一般,或然性)、溯因(观察+理论→最佳解释,假设性)。
19
-
20
- > **数学形式化 / Mathematical Formalization**
21
- >
22
- > 逻辑演绎具有两层结构:命题逻辑处理真值函数连接词(¬, ∧, ∨, →, ↔),谓词逻辑在此基础上添加量词(∀, ∃)与个体变元。数学证明生活在谓词逻辑之中——仅靠命题逻辑无法表达 "对所有 x,若 P(x) 则 Q(x)" 这类陈述,因此也无法对实际数学论证进行证明检验。
23
- >
24
- > 哥德尔完备性定理(Gödel's Completeness Theorem, 1929):一阶谓词逻辑中,所有有效论证都是可证明的——若 φ 是一阶逻辑的有效公式,则存在一个形式证明序列从空前提集推导出 φ。这保证了一阶逻辑的演绎能力与语义有效性完全吻合(可靠性+完备性),但仅限一阶逻辑;二阶逻辑不具备此性质。
25
- >
26
- > 详细数学依据见 `original-texts.md`
27
-
28
- ## GPU 友好性 / GPU-Friendliness(横切检查)
29
-
30
- 逻辑/形式验证结构映射 GPU 时需警惕:**符号推理常「美但不可算」**——证明搜索、归结(Resolution)回溯本质串行,难以张量化。当逻辑用于算法/不变量设计时,过 `../../references/gpu-friendly-math.md` 八维门:
31
-
32
- - **SAT/SMT 批量求解**:独立子句可批量并行(友好),但 CDCL 回溯串行。
33
- - **定理证明(Coq/Lean)**:tactic 求解器高度串行、依赖图复杂——不可训练,应**离线验证**产物后仅部署结论。
34
- - **模型检查(Model Checking)**:状态空间爆炸→符号 BDD 可压缩;GPU 上可改用并行 SAT / 局部可达性(可改造)。
35
- - **类型/不变量检查**:作为编译期/离线静态检查,运行期零开销(友好)。
36
- - **反模式**:把归结/自然演绎证明搜索塞进训练循环——不可微分、不可并行;应松弛为可微近似(概率/神经符号逻辑)或离线证毕后仅部署结论。
37
-
38
- 八维最低判定(正式术语):**张量化**通常不友好,除非子句/状态可批量编码;**GEMM 可映射**只适合可微逻辑、SAT 打分或布尔半环近似;**复杂度**必须标注证明搜索/模型检查的指数或不可判定边界;**显存与 KV-Cache**看状态空间、证明树、BDD 是否爆炸;**低精度稳定**看松弛逻辑在 fp16/bf16 下是否保持语义边界;**并行与通信**看分支搜索能否批量或离线;**稀疏结构**看约束图是否规则;**算子融合**看逻辑 loss/mask 是否能融合,证明搜索本身不应进 kernel。
39
-
40
- > 配合 `../../references/books/abstract-algebra.md`(形式系统)、`../../references/books/algebraic-geometry-rising-sea.md`(范畴论推理)。
41
-
42
- ## 不适用场景 / When NOT to Use
43
-
44
- - **前提本身不确定**——先确定前提真假,再进行演绎。
45
- - **需要创造性突破而非逻辑验证**——演绎只能发现已有信息蕴含的结论,不能产生新信息。
46
- - **二阶逻辑问题**——哥德尔完备性仅覆盖一阶逻辑;二阶有效性不可完全公理化。
47
-
48
- ## 何时使用 / When to Use
49
-
50
- - 阅读论文或代码时,检查其证明/推导/不变量的严谨性。
51
- - 发现论证中可能存在逻辑跳跃或漏洞,需形式化定位。
52
- - 验证某个结论是否真的能从前提推导出来(Γ ⊢ φ 是否成立)。
53
- - 分析含 ∀ / ∃ 的数学陈述时,验证量词推理的正确性。
54
- - 检查二阶逻辑论证的有效性边界。
55
- - 为算法正确性、循环不变量、程序性质做形式推导与证明验证。
56
-
57
- ## 方法流程 / Method
58
-
59
- ### 第一步:识别前提 / Identify the Premises
60
- 列出论证中所有前提(假设、已知条件、引用定理),标注状态:**已证定理**(如"素数无穷")、**公理**(如 ZF 集合论公理)、**假设**(如"黎曼猜想")、**经验事实**。同时标注逻辑层次:纯命题前提(不含量词)还是谓词前提(含 ∀ / ∃)。前提质量决定推理质量——前提不成立则结论必然不可靠。
61
-
62
- ### 第二步:检查推理规则 / Check the Rules of Inference
63
- 验证每一步是否使用有效推理规则。
64
-
65
- **命题逻辑规则**:假言推理(Modus Ponens)P→Q, P ⊢ Q;拒取式(Modus Tollens)P→Q, ¬Q ⊢ ¬P;假言三段论 P→Q, Q→R ⊢ P→R;析取三段论 P∨Q, ¬P ⊢ Q;合取引入 P, Q ⊢ P∧Q;双重否定消除 ¬¬P ⊢ P。
66
-
67
- **谓词逻辑规则**:全称实例化(UI)∀x P(x) ⊢ P(a);全称泛化(UG)P(a) 对任意 a 成立 ⊢ ∀x P(x)(a 必须任意,不能是特定常元);存在实例化(EI)∃x P(x) ⊢ P(c)(c 必须为新名称,不与已有常元冲突);存在泛化(EG)P(a) ⊢ ∃x P(x)。
68
-
69
- **其他框架**:消解原理(Resolution)从 (P∨Q) 与 (¬P∨R) 消解出 (Q∨R),适于自动化证明;自然演绎系统(Natural Deduction)以引入/消除规则对称组织,更贴近人类推理习惯。
70
-
71
- ### 第三步:检查常见逻辑谬误 / Check for Common Fallacies
72
- **命题逻辑谬误**:肯定后件 P→Q, Q ⊢ P(无效);否定前件 P→Q, ¬P ⊢ ¬Q(无效);混淆充分与必要条件;循环论证(结论隐含用作前提);稻草人谬误。
73
-
74
- **谓词逻辑谬误**:量词移位谬误 ∀x∃y R(x,y) ≠ ∃y∀x R(x,y)(前者"每人各有其所爱",后者"有人被所有人所爱");非法全称泛化(从特定 a 的 P(a) 推 ∀x P(x),违反 UG 任意性);混淆自由与约束变量;混淆 ∀ 与 ∃ 强度;偷换概念(Equivocation);虚假二分(False Dilemma,将 P∨Q 呈现为仅有选择,隐含排除 ¬P∧¬Q)。
75
-
76
- ### 第四步:分析量词结构 / Analyze Quantifier Structure
77
- ∀ 与 ∃ 的嵌套顺序决定逻辑强度:
78
- - **∀∃ 结构**(较弱):∀x∃y R(x,y)——对每个 x 可构造各自的 y,构造性可满足。
79
- - **∃∀ 结构**(较强):∃y∀x R(x,y)——存在统一 y 对所有 x 成立,往往需选择公理(Axiom of Choice)。
80
-
81
- 要点:嵌套层数越多推理越需谨慎;相邻同类型量词可交换(∀x∀y = ∀y∀x,∃x∃y = ∃y∃x),不同类型不可交换;量词否定等值 ¬∀x P(x) ≡ ∃x ¬P(x),¬∃x P(x) ≡ ∀x ¬P(x)。
82
-
83
- ### 第五步:验证推理链完备性 / Verify Completeness of the Inference Chain
84
- 检查前提集 Γ 能否形式推导出结论 φ:是否存在有限序列 φ₁, φ₂, ..., φₙ = φ,其中每个 φᵢ 或属于 Γ,或由前面公式通过有效规则得出?若链不完整,标注缺失的中间步骤及其所需规则。缺失一步,整条链断裂。
85
-
86
- ### 第六步:评估结论强度 / Assess the Strength of the Conclusion
87
- 逻辑强度分类:**必然的**(演绎有效,前提真则结论必然真)、**或然的**(归纳支持,概率性证据)、**假设性的**(溯因,最佳解释但未验证)。同时评估适用范围:全称(∀)还是存在(∃)?条件性(→)还是无条件?不要把"可能"夸大为"必然"。
88
-
89
- ### 第七步:证明策略选择 / Select Proof Strategy
90
- - **直接证明**:从前提逐步推导至结论,最自然。
91
- - **反证法**:假设 ¬φ 推导出矛盾从而证明 φ,适于否定性结论或难以直接构造的论证。
92
- - **逆否证明**:证明 ¬Q → ¬P 以建立 P → Q,当逆否方向更易推理时使用。
93
- - **穷举证明**:将所有情况逐一验证,适于有限可枚举情形。
94
- - **构造性证明**:直接构造满足条件的对象,比纯存在性证明(仅证 ∃x P(x) 不给出 x)更有信息量。
95
-
96
- ## 常见错误 / Common Errors
97
-
98
- | 错误 / Error | 批评 / Critique | 正确做法 / Correct Approach |
99
- |---|---|---|
100
- | 混淆充分与必要条件 | P → Q 成立不代表 Q → P 成立 | 明确区分充分、必要、充要条件 |
101
- | 肯定后件谬误 | P → Q, Q ⊬ P;只有 Modus Ponens/Tollens 有效 | 拒绝 P→Q, Q ⊢ P 这类无效推理 |
102
- | 隐藏前提 | 推理中使用了未声明的前提 | 暴露所有前提,逐一检验 |
103
- | 无限倒退 | 每个前提都需要另一个前提来证明 | 找到不需要证明的起点(公理/经验事实)|
104
- | 量词移位谬误 | ∀x∃y R(x,y) ≠ ∃y∀x R(x,y),前者弱后者强 | 严格遵守量词顺序,不可交换不同类型量词 |
105
- | 非法全称泛化 | 从特定 a 的 P(a) 推 ∀x P(x),违反 UG 任意性 | UG 仅适用于任意个体 a,不适用于特定常元 |
106
- | 混淆自由与约束变量 | x 在 ∀x P(x) 中约束、在 P(x) 中自由,含义不同 | 明确标注变元约束/自由状态,避免混用 |
107
- | 混淆 ∀ 与 ∃ | "所有元素满足 P" 远强于 "存在元素满足 P" | 严格区分全称断言与存在断言的逻辑强度 |
108
- | 符号推理塞进训练循环 | 证明搜索/归结本质串行、不可微分,"美但不可算" | 松弛为可微近似(概率/神经符号)或离线证毕后仅部署结论 |
109
-
110
- ## 操作规程 / Operating Procedure
111
-
112
- 当本 skill 被触发时,输出必须包含:
113
-
114
- 1. **[前提清单]** — 列出所有前提,标注 `[已证]` / `[公理]` / `[假设]` / `[经验]`,并标注逻辑层次 `[命题]` / `[谓词]`
115
- 2. **[推理链重构]** — 用形式逻辑语言重述推理过程,每一步标注使用的推理规则(含 UI/UG/EI/EG 等谓词规则)
116
- 3. **[谬误检查]** — 逐一检查命题逻辑与谓词逻辑谬误,标注 `✅ 无此谬误` 或 `❌ 发现 [具体谬误]`
117
- 4. **[量词结构分析]** — 若有 ∀ / ∃ 嵌套,标注量词顺序与逻辑强度 `∀∃(弱)` / `∃∀(强)`
118
- 5. **[完整性评估]** — 推理链是否完整?标注 `✅ 完整` 或 `⚠️ 跳跃:[说明]`
119
- 6. **[结论强度]** — 标注 `[必然]` / `[或然]` / `[假设性]`,并标注适用范围 `[全称]` / `[存在]` / `[条件]`
120
- 7. **[证明策略评估]** — 当前论证使用了何种证明策略?是否有更优策略?标注 `✅ 策略适当` 或 `💡 建议:[更优策略]`
121
- 8. **[GPU 可行性]**(若用于算法/不变量验证)— 形式验证是否离线进行、结论可否部署;证明搜索是否需松弛为可微近似,过八维门。
122
-
123
- **输出不得只给分析而无结论。**
124
-
125
- ## 与其他 skill 的关系 / Relations to Other Skills
126
-
127
- - **公理化思想**:逻辑演绎是公理体系的推理引擎;公理提供前提,演绎提供推导机制,二者共同构成形式系统。
128
- - **抽象化思想**:形式逻辑本身就是高度抽象的结构——将具体内容剥离后只保留推理形式。
129
- - **归纳与类比**:演绎与归纳互补——演绎保证正确性,归纳提供新前提。
130
- - **概率与统计**:在不确定性下,经典逻辑需扩展为概率逻辑。
131
- - **算法思想**:逻辑演绎为算法正确性证明提供形式框架——程序性质验证本质上是一阶谓词推理。
132
- - **反例思想**:反例是证伪 ∀ 断言的直接手段,与演绎证真构成双重验证体系。
133
- - **现代数学激活**:`../../references/books/abstract-algebra.md`(形式系统)、`../../references/books/algebraic-geometry-rising-sea.md`(范畴论推理)。