math-skill 1.0.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (55) hide show
  1. package/LICENSE +21 -0
  2. package/README.md +278 -0
  3. package/agents/math-critic.md +203 -0
  4. package/commands/abstraction.md +34 -0
  5. package/commands/algorithmic-thinking.md +34 -0
  6. package/commands/ask.md +21 -0
  7. package/commands/axiomatization.md +34 -0
  8. package/commands/causal-inference.md +34 -0
  9. package/commands/discrete-combinatorial.md +34 -0
  10. package/commands/game-theory.md +34 -0
  11. package/commands/induction-analogy.md +34 -0
  12. package/commands/information-theory.md +34 -0
  13. package/commands/logic-deduction.md +34 -0
  14. package/commands/modeling.md +37 -0
  15. package/commands/optimization.md +33 -0
  16. package/commands/probability-statistics.md +36 -0
  17. package/commands/symmetry-invariance.md +34 -0
  18. package/commands/topological-thinking.md +33 -0
  19. package/commands/transformation.md +33 -0
  20. package/docs/CLAUDE.md +187 -0
  21. package/docs/inspiration.md +113 -0
  22. package/knowledge-base/overview.md +230 -0
  23. package/package.json +60 -0
  24. package/skills/abstraction/SKILL.md +264 -0
  25. package/skills/abstraction/original-texts.md +175 -0
  26. package/skills/algorithmic-thinking/SKILL.md +371 -0
  27. package/skills/algorithmic-thinking/original-texts.md +256 -0
  28. package/skills/axiomatization/SKILL.md +213 -0
  29. package/skills/axiomatization/original-texts.md +160 -0
  30. package/skills/causal-inference/SKILL.md +374 -0
  31. package/skills/causal-inference/original-texts.md +167 -0
  32. package/skills/discrete-combinatorial/SKILL.md +286 -0
  33. package/skills/discrete-combinatorial/original-texts.md +185 -0
  34. package/skills/game-theory/SKILL.md +318 -0
  35. package/skills/game-theory/original-texts.md +131 -0
  36. package/skills/induction-analogy/SKILL.md +310 -0
  37. package/skills/induction-analogy/original-texts.md +154 -0
  38. package/skills/information-theory/SKILL.md +242 -0
  39. package/skills/information-theory/original-texts.md +127 -0
  40. package/skills/logic-deduction/SKILL.md +280 -0
  41. package/skills/logic-deduction/original-texts.md +173 -0
  42. package/skills/meta-selector/SKILL.md +188 -0
  43. package/skills/meta-selector/original-texts.md +105 -0
  44. package/skills/modeling/SKILL.md +318 -0
  45. package/skills/modeling/original-texts.md +165 -0
  46. package/skills/optimization/SKILL.md +292 -0
  47. package/skills/optimization/original-texts.md +168 -0
  48. package/skills/probability-statistics/SKILL.md +312 -0
  49. package/skills/probability-statistics/original-texts.md +193 -0
  50. package/skills/symmetry-invariance/SKILL.md +358 -0
  51. package/skills/symmetry-invariance/original-texts.md +221 -0
  52. package/skills/topological-thinking/SKILL.md +273 -0
  53. package/skills/topological-thinking/original-texts.md +164 -0
  54. package/skills/transformation/SKILL.md +264 -0
  55. package/skills/transformation/original-texts.md +216 -0
@@ -0,0 +1,242 @@
1
+ ---
2
+ name: information-theory
3
+ description: |
4
+ 科研模式触发:熵计算、信道容量、编码理论、模型选择等信息论数学形式化问题。
5
+ 生活模式触发:评估信息价值、减少冗余、判断该获取哪些信息等日常信息决策问题。
6
+ English (Research mode): Trigger for entropy computation, channel capacity, coding theory, model selection.
7
+ English (Life mode): Trigger for assessing information value, reducing redundancy, evaluating what information to seek.
8
+ ---
9
+
10
+ # 📡 信息论思想
11
+
12
+ > "信息是不确定性的减少——知道更多意味着怀疑更少。"
13
+ > "Information is reduction of uncertainty — knowing more means doubting less."
14
+ >
15
+ > —— 信息论、编码理论、统计推断
16
+ > —— Information Theory, Coding Theory, Statistical Inference
17
+
18
+ ## 核心原则 / Core Principle
19
+
20
+ 三个核心洞见:
21
+ 1. **不确定性是可量化的**——熵 H(X) 给出不确定性的精确度量,而非主观感受
22
+ **Uncertainty is quantifiable** — entropy H(X) gives a precise measure of uncertainty, not a subjective feeling
23
+ 2. **压缩与通信存在基本极限**——信源编码定理与信道编码定理揭示了信息处理的数学边界,不可逾越
24
+ **Compression and communication have fundamental limits** — source coding and channel coding theorems reveal mathematical boundaries of information processing, unbreakable
25
+ 3. **信息增益连接不确定性与决策**——观察 Y 对 X 的信息增益 I(X;Y) = H(X) − H(X|Y) 指导在不确定性下应优先获取何种信息
26
+ **Information gain connects uncertainty and decision-making** — I(X;Y) = H(X) − H(X|Y) guides which information to prioritize under uncertainty
27
+
28
+ > **数学形式化 / Mathematical Formalization**(科研模式参考)
29
+ >
30
+ > Shannon 熵 H(X) = −Σ p(x) log p(x) 量化随机变量的平均"惊奇度"——概率越低的事件发生时带来的惊奇越大,熵是所有事件惊奇度的期望。
31
+ >
32
+ > 信息增益 I(X;Y) = H(X) − H(X|Y) 量化观察 Y 之后对 X 不确定性的减少——这正是"信息"的数学定义。
33
+ >
34
+ > 信源编码定理:最优压缩的平均编码长度 ≥ H(X) bits/symbol,低于熵限则必然丢失信息。
35
+ >
36
+ > 信道编码定理:可靠通信的速率上限为信道容量 C = max I(X;Y),当传输速率 R < C 时存在编码方案使误码率趋零,R > C 时可靠通信不可能。
37
+ >
38
+ > 详细数学依据见 `original-texts.md`
39
+
40
+ ## 不适用场景 / When NOT to Use
41
+
42
+ - **问题无概率结构**(如纯粹符号推理、逻辑演绎)——熵与信息增益需要概率分布,无概率则无信息论 `[科研]`
43
+ **No probabilistic structure** (e.g., pure symbolic reasoning, logical deduction) — entropy and information gain require probability distributions `[科研]`
44
+ - **纯确定性场景无不确定性**(如已知精确答案的数学问题)——熵为零时信息论退化为平凡结论 `[科研]`
45
+ **Purely deterministic scenarios with no uncertainty** (e.g., math problems with exact known answers) — when entropy is zero, information theory degenerates to trivial conclusions `[科研]`
46
+ - **定性判断无需量化**(如美学评价、情感判断)——信息论量化的是概率意义上的不确定性,非语义歧义 `[通用]`
47
+ **Qualitative judgments need no quantification** (e.g., aesthetic evaluation, emotional judgment) — information theory quantifies uncertainty in the probabilistic sense, not semantic ambiguity `[通用]`
48
+ - **被噪音信息淹没而忽略关键信息**——在信息过载的环境中迷失于无关细节 `[生活]`
49
+ **Overwhelmed by noise information while ignoring key information** — lost in irrelevant details in an information-overloaded environment `[生活]`
50
+ - **追求更多信息而不评估其价值**——数量不等于质量,未经筛选的信息可能是噪音 `[生活]`
51
+ **Seeking more information without evaluating its value** — quantity ≠ quality; unfiltered information may be noise `[生活]`
52
+ - **信息过载导致决策瘫痪**——信息量超过处理能力时反而降低决策质量 `[生活]`
53
+ **Decision paralysis from information overload** — when information volume exceeds processing capacity, decision quality actually declines `[生活]`
54
+
55
+ ## 何时使用 / When to Use
56
+
57
+ ### 科研触发条件 / Research Trigger Conditions
58
+
59
+ - 需要度量不确定性的大小(熵 H(X) 量化随机变量的"混乱程度")
60
+ Need to measure the magnitude of uncertainty (entropy H(X) quantifies the "disorder" of a random variable)
61
+ - 需要比较不同信息源的价值(互信息 I(X;Y) 衡量哪个观察 Y 最能减少关于 X 的不确定性)
62
+ Need to compare the value of different information sources (mutual information I(X;Y) measures which observation Y best reduces uncertainty about X)
63
+ - 需要最优数据压缩(信源编码定理保证最优压缩极限为 H(X) bits/symbol)
64
+ Need optimal data compression (source coding theorem guarantees the optimal compression limit is H(X) bits/symbol)
65
+ - 需要在噪声环境下可靠通信(信道编码定理保证速率低于容量 C 时可靠传输可行)
66
+ Need reliable communication under noise (channel coding theorem guarantees reliable transmission when rate is below capacity C)
67
+ - 需要特征选择或模型选择(互信息筛选特征,AIC/BIC/MDL 作为信息准则选择模型)
68
+ Need feature selection or model selection (mutual information filters features, AIC/BIC/MDL as information criteria for model selection)
69
+ - 需要贝叶斯模型比较(KL 散度 D(P||Q) 衡量分布间信息距离,贝叶斯因子量化模型间证据比)
70
+ Need Bayesian model comparison (KL divergence D(P||Q) measures information distance between distributions, Bayes factor quantifies evidence ratio between models)
71
+
72
+ ### 生活触发条件 / Life Trigger Conditions
73
+
74
+ - 需要评估某条信息是否值得获取——不是所有信息都有同等价值
75
+ Need to assess whether a piece of information is worth acquiring — not all information has equal value
76
+ - 需要在信息过载中筛选关键信息——去除冗余、聚焦核心
77
+ Need to filter key information from overload — remove redundancy, focus on the core
78
+ - 需要判断哪个解释更合理——最简洁且最有解释力的解释优于复杂但增量解释力很小的解释
79
+ Need to judge which explanation is more reasonable — the simplest yet most explanatory beats complex ones with marginal explanatory gain
80
+ - 需要决定是先收集更多信息还是果断行动——信息不足时先收集关键信息,信息足够时果断行动
81
+ Need to decide whether to gather more information or act decisively — collect key info when insufficient, act decisively when sufficient
82
+ - 需要提高沟通效率——识别信息传递的瓶颈,用最精炼的方式传达关键内容
83
+ Need to improve communication efficiency — identify bottlenecks, convey key content in the most concise way
84
+
85
+ ## 方法流程 / Method
86
+
87
+ ### 第一步:识别信息源与不确定度 / Step 1: Identify Source and Uncertainty
88
+
89
+ **科研模式 / Research Mode:**
90
+ - **随机变量 X** 是什么?——定义信息源,明确要研究的不确定性对象
91
+ - **概率分布 p(x)**——离散分布用概率表,连续分布用密度函数
92
+ - **计算 H(X) = −Σ p(x) log p(x)**——量化当前不确定性水平
93
+ - **识别要减少的不确定性**——明确"知道什么之后不确定性会降低?"
94
+
95
+ **生活模式 / Life Mode:**
96
+ - 你面对的不确定性是什么?你最想搞清楚哪件事?——明确"知道什么之后不确定性会降低"是关键
97
+ What uncertainty are you facing? What do you most want to figure out? — clarifying "what knowledge would reduce uncertainty" is the key
98
+
99
+ **共通要点 / Common Point:**
100
+ - 核心都是明确不确定性对象——科研用数学定义 X 和 p(x),生活用问题描述
101
+ The core is clarifying the object of uncertainty — research uses mathematical definitions of X and p(x), life uses problem description
102
+
103
+ ### 第二步:量化信息增益 / Step 2: Quantify Information Gain
104
+
105
+ **科研模式 / Research Mode:**
106
+ - **计算条件熵 H(X|Y)**——观察 Y 之后 X 的剩余不确定性
107
+ - **计算互信息 I(X;Y) = H(X) − H(X|Y)**——Y 对 X 提供的信息量
108
+ - **识别最优观察**——哪个 Y 使 I(X;Y) 最大?该观察最值得获取
109
+ - **链式规则**——H(X₁,...,Xₙ) = H(X₁) + H(X₂|X₁) + ... + H(Xₙ|X₁,...,Xₙ₋₁),逐个变量拆解联合不确定性
110
+
111
+ **生活模式 / Life Mode:**
112
+ - 这条信息能减少多少不确定性?——不是所有信息都有同等价值,有的信息一针见血,有的信息只是噪音
113
+ How much uncertainty can this information reduce? — not all information has equal value; some is incisive, some is just noise
114
+
115
+ **共通要点 / Common Point:**
116
+ - 核心都是评估信息的价值——科研用 I(X;Y) 精确量化,生活用直觉判断哪条信息最能减少不确定性
117
+ The core is evaluating information value — research uses I(X;Y) for precise quantification, life uses intuitive judgment of which info best reduces uncertainty
118
+
119
+ ### 第三步:选择编码策略 / Step 3: Choose Coding Strategy
120
+
121
+ **科研模式 / Research Mode:**
122
+ - **信源编码(压缩)**:Huffman 编码(贪心最优前缀码,平均长度接近 H(X))、算术编码(更接近熵限)、通用编码(LZ77/LZ78/LZW,无需已知分布)
123
+ - **信道编码(纠错)**:Hamming 码(最小距离 3,纠正 1 位错)、Reed-Solomon 码(突发纠错)、LDPC/Turbo 码(逼近 Shannon 极限)
124
+ - **编码选择原则**:压缩需求用信源编码→逼近 H(X);噪声防护用信道编码→逼近 Shannon 极限 (R→C)
125
+
126
+ **生活模式 / Life Mode:**
127
+ - 如何用最精炼的方式传递关键信息?——去除冗余、聚焦核心、避免信息过载
128
+ How to convey key information in the most concise way? — remove redundancy, focus on the core, avoid information overload
129
+
130
+ **共通要点 / Common Point:**
131
+ - 核心都是压缩与传递的效率——科研用编码定理逼近数学极限,生活用精炼表达逼近沟通极限
132
+ The core is efficiency of compression and transmission — research uses coding theorems to approach mathematical limits, life uses concise expression to approach communication limits
133
+
134
+ ### 第四步:评估信道容量 / Step 4: Evaluate Channel Capacity
135
+
136
+ **科研模式 / Research Mode:**
137
+ - **计算信道容量 C = max_{p(x)} I(X;Y)**——在所有输入分布 p(x) 上最大化互信息
138
+ - **比较传输速率 R 与容量 C**:R < C → 可靠通信可行;R > C → 必定出错
139
+ - **噪声模型**:BSC(二元对称信道,翻转概率 p)、BEC(二元擦除信道,擦除概率 ε)、AWGN(加性白高斯噪声信道)
140
+ - **容量公式示例**:BSC 容量 C = 1 − H(p);AWGN 容量 C = ½ log(1 + S/N)
141
+
142
+ **生活模式 / Life Mode:**
143
+ - 信息传递的瓶颈在哪?——不是所有信息都能有效传达,识别沟通的限制条件
144
+ Where is the bottleneck in information transmission? — not all information can be effectively conveyed; identify communication constraints
145
+
146
+ **共通要点 / Common Point:**
147
+ - 核心都是识别信息传递的限制——科研用信道容量 C 量化数学极限,生活用沟通瓶颈识别实际限制
148
+ The core is identifying limits of information transmission — research uses channel capacity C to quantify mathematical limits, life uses communication bottlenecks to identify practical limits
149
+
150
+ ### 第五步:应用信息准则 / Step 5: Apply Information Criteria
151
+
152
+ **科研模式 / Research Mode:**
153
+ - **AIC(赤池信息准则)**:AIC = −2lnL + 2k——偏重拟合,适合预测目标
154
+ - **BIC(贝叶斯信息准则)**:BIC = −2lnL + k·ln(n)——偏重简约,适合解释目标
155
+ - **KL 散度 D(P||Q) = Σ p(x) log(p(x)/q(x))**——衡量用 Q 替代 P 的信息损失,注意不对称性 D(P||Q) ≠ D(Q||P)
156
+ - **MDL 原则(最小描述长度)**:选择使"数据描述长度 + 模型描述长度"最小的模型——信息论版本的奥卡姆剃刀
157
+
158
+ **生活模式 / Life Mode:**
159
+ - 如何判断哪个解释更好?——最简洁且最解释力的解释优于复杂但增量解释力很小的解释(奥卡姆剃刀的信息论版本)
160
+ How to judge which explanation is better? — the simplest yet most explanatory explanation beats complex ones with marginal explanatory gain (the information-theoretic version of Occam's razor)
161
+
162
+ **共通要点 / Common Point:**
163
+ - 核心都是简洁性与解释力的权衡——科研用 AIC/BIC/KL/MDL 精确量化,生活用"简洁且有解释力"直觉判断
164
+ The core is balancing simplicity and explanatory power — research uses AIC/BIC/KL/MDL for precise quantification, life uses "simple yet explanatory" intuitive judgment
165
+
166
+ ### 第六步:做出信息最优决策 / Step 6: Make Information-Optimal Decision
167
+
168
+ **科研模式 / Research Mode:**
169
+ - **贝叶斯实验设计**:选择使期望信息增益 max E[I(θ;Y)] 最大的实验——优先获取最能减少不确定性的数据
170
+ - **最小化 KL 散度**:决策输出分布 Q 应尽量接近目标分布 P,即 min D(P||Q)
171
+ - **最大熵原则**:在已知约束下选择使 H(X) 最大的分布——最少假设,最保守推断
172
+ - **信息瓶颈**:min I(X;T) − βI(T;Y)——在压缩 X 为 T 时保留关于 Y 的最大相关信息
173
+
174
+ **生活模式 / Life Mode:**
175
+ - 在当前信息水平下做最优决策——信息不足时先收集关键信息,信息足够时果断行动
176
+ Make the optimal decision at the current information level — collect key info when insufficient, act decisively when sufficient
177
+
178
+ **共通要点 / Common Point:**
179
+ - 核心都是信息与行动的平衡——科研用信息增益最大化设计实验,生活用"信息不足先收集、信息足够果断行动"策略
180
+ The core is balancing information and action — research uses information gain maximization to design experiments, life uses "collect when insufficient, act when sufficient" strategy
181
+
182
+ ## 常见错误 / Common Errors
183
+
184
+ | 错误 / Error | 数学批评 / Mathematical Critique | 正确做法 / Correct Approach | 标签 / Tag |
185
+ |---|---|---|---|
186
+ | 把信息等同于比特而非概率减少 | 熵 H(X) 是概率分布的函数,不是比特的物理量;信息增益 I(X;Y) 是不确定性的减少量 | 理解信息为不确定性的减少:I(X;Y) = H(X) − H(X|Y),比特只是量化单位 | `[科研]` |
187
+ | 忽视信道容量极限 | R > C 时无论何种编码都不能实现可靠通信;信道容量是数学极限而非工程限制 | 计算信道容量 C = max I(X;Y),确保 R < C | `[科研]` |
188
+ | 混淆熵与方差 | 熵 H(X) 度量分布的"扩散度"(概率意义上),方差 Var(X) 度量分布的"展开度"(距离意义上);两者不等价 | 熵量化概率结构的不确定性,方差量化数值偏差;连续分布熵可为负 | `[科研]` |
189
+ | 过度压缩低于熵限 | 信源编码定理保证最优压缩 ≥ H(X) bits/symbol;低于此限必然丢失信息 | 最优压缩极限为 H(X),接受此极限并据此设计编码 | `[科研]` |
190
+ | 忽视 KL 散度不对称性 | D(P||Q) ≠ D(Q||P);D(P||Q) 衡量"用 Q 近似 P 的信息损失",D(Q||P) 衡量"用 P 近似 Q 的信息损失" | 明确 KL 散度的方向性:D(P||Q) 用于编码(用 Q 编码 P 的额外代价) | `[科研]` |
191
+ | 把相关性等同于信息 | 相关 ρ(X,Y) 仅衡量线性关联;互信息 I(X;Y) 衡量所有依赖关系(含非线性);I(X;Y)=0 ⇔ X,Y 独立,但 ρ=0 ≠ X,Y 独立 | 用互信息 I(X;Y) 代替相关系数 ρ 评估变量间依赖关系 | `[科研]` |
192
+ | 把定性判断强行量化 | 信息论量化的是概率意义上的不确定性,非语义歧义或主观感受 | 区分概率不确定性与语义歧义,不要对定性问题强行套用熵公式 | `[通用]` |
193
+ | 被噪音信息淹没而忽略关键信息 | 信息过载时,大量低价值信息掩盖了少量高价值信息 | 先评估每条信息的不确定性减少能力,优先关注高信息增益的信息 | `[生活]` |
194
+ | 追求更多信息而不评估其价值 | 数量 ≠ 质量;未经筛选的信息可能是噪音而非信息 | 每获取一条信息前先问"这条信息能减少多少不确定性?" | `[生活]` |
195
+ | 信息过载导致决策瘫痪 | 信息量超过处理能力时,决策质量反而下降 | 设定信息收集的止损点——信息足够时果断行动,不再追求完美信息 | `[生活]` |
196
+
197
+ ## 操作规程 / Operating Procedure
198
+
199
+ 当本 skill 被触发时,首先判断模式:
200
+
201
+ - **科研模式**:问题涉及熵计算、信道容量、编码理论、模型选择等数学形式化
202
+ - **生活模式**:问题涉及评估信息价值、减少冗余、判断该获取哪些信息等日常决策
203
+
204
+ ---
205
+
206
+ ### 科研模式输出格式 / Research Mode Output Format
207
+
208
+ 1. **[信息源]:[描述]** H(X) = [值]——定义随机变量 X,计算其熵,量化当前不确定性
209
+ 2. **[信息增益]:[描述]** I(X;Y) = [值]——计算互信息,识别最有价值的观察 Y
210
+ 3. **[编码策略]:[选择]**——信源编码(压缩)或信道编码(纠错),说明逼近哪种极限
211
+ 4. **[信道容量]:[描述]** C = [值]——计算信道容量,比较传输速率 R 与 C
212
+ 5. **[信息准则]:[AIC/BIC/KL/MDL]**——说明选择的信息准则及理由
213
+ 6. **[最优决策]:[说明]**——基于信息增益最大化或 KL 散度最小化的决策建议
214
+
215
+ **科研模式输出必须包含以上 6 项,不得只输出分析性文字而不给出结论。**
216
+
217
+ ---
218
+
219
+ ### 生活模式输出格式 / Life Mode Output Format
220
+
221
+ 1. **[核心不确定性]:[描述]** — 你最想搞清楚什么
222
+ **[Core Uncertainty]:[description]** — What you most want to figure out
223
+ 2. **[信息价值排序]:[列表]** — 哪些信息最能减少不确定性,价值高低排序
224
+ **[Information Value Ranking]:[list]** — Which information best reduces uncertainty, ranked by value
225
+ 3. **[信息瓶颈]:[识别]** — 信息传递或获取的限制在哪
226
+ **[Information Bottleneck]:[identification]** — Where are the limits on information transmission or acquisition
227
+ 4. **[精炼传递]:[建议]** — 如何用最精炼的方式聚焦关键信息
228
+ **[Concise Transmission]:[suggestion]** — How to focus key information in the most concise way
229
+ 5. **[最优解释]:[判断]** — 哪个解释最简洁且最有力
230
+ **[Optimal Explanation]:[judgment]** — Which explanation is simplest yet most powerful
231
+ 6. **[行动建议]:[步骤]** — 在当前信息水平下最务实的行动方案
232
+ **[Action Advice]:[steps]** — The most pragmatic action plan at the current information level
233
+
234
+ **生活模式输出必须包含以上 6 项,不得只输出分析性文字而不给出结论。**
235
+
236
+ ## 与其他 skill 的关系 / Relations to Other Skills
237
+
238
+ - **概率与统计**(熵与信息增益补充概率推理)——熵 H(X) 度量概率分布的不确定性,信息增益 I(X;Y) 是贝叶斯更新的信息论表达
239
+ - **优化思想**(信道容量最大化是优化问题)——C = max_{p(x)} I(X;Y) 是在输入分布上的最优化问题
240
+ - **变换思想**(编码是信息空间的变换)——编码将信息从原始空间映射到压缩/纠错空间,是信息空间的变换
241
+ - **建模思想**(信息准则指导模型选择)——AIC/BIC/MDL 从信息论角度量化模型的拟合与复杂度权衡
242
+ - **算法思想**(压缩算法是计算实现)——Huffman/LZ/LDPC 等算法是信息论极限的逼近实现
@@ -0,0 +1,127 @@
1
+ # 数学出处与经典文献 / Mathematical Sources and Classic Texts
2
+
3
+ ## Shannon 信息论 / Shannon's Information Theory (1948)
4
+
5
+ > H(X) = −Σ p(x) log p(x) —— 熵,信息源的平均不确定性
6
+ > I(X;Y) = H(X) − H(X|Y) —— 互信息,观察 Y 对 X 的信息贡献
7
+ > C = max_{p(x)} I(X;Y) —— 信道容量,可靠通信的速率上限
8
+ >
9
+ > 信源编码定理:最优压缩 ≥ H(X) bits/symbol
10
+ > 信道编码定理:R < C 时存在编码方案使误码率趋零
11
+
12
+ **含义**:信息可以被精确量化;压缩与通信存在不可逾越的数学极限,而非仅受工程水平限制。熵度量"平均惊奇"——低概率事件发生时带来的信息量更大。互信息度量"不确定性减少"——观察 Y 使我们对 X 的不确定降低了多少。
13
+
14
+ **数学背景**:Claude Shannon 在《A Mathematical Theory of Communication》(1948) 中创立信息论。核心贡献:(1) 定义熵 H(X) = −Σ p(x) log p(x),对数基底选择决定单位(基底 2 → bits,基底 e → nats);(2) 信源编码定理证明最优前缀码平均长度 L ≥ H(X),等号当且仅当所有概率为 2 的幂次时成立;(3) 信道编码定理证明 R < C 时存在编码序列使 P(error) → 0,R > C 时 P(error) > 0 不可避免。Shannon 的证明是随机编码论证——构造随机码本后证明"典型"码的误码率趋零,再指出至少存在一个这样的码。
15
+
16
+ ## Huffman 编码 / Huffman Coding (1952)
17
+
18
+ > 贪心构造最优前缀码:每次合并概率最小的两个符号,自底向上建树。
19
+ > 平均编码长度 L(Huffman) ≤ H(X) + 1,当概率为 2 的幂次时 L = H(X)。
20
+
21
+ **含义**:最优前缀码(无歧义解码)可通过贪心算法精确构造,平均长度接近熵限。
22
+
23
+ **数学背景**:David Huffman 在 1952 年作为 MIT 学生发表此算法,证明其最优性。Huffman 编码是变长前缀码——较频繁的符号用较短的码字,保证任何码字不是另一码字的前缀(前缀条件),从而可即时解码(instantaneous decoding)。当符号概率不全是 2 的幂次时,Huffman 编码平均长度严格大于 H(X);算术编码将整个消息编码为一个区间,可更接近熵限。
24
+
25
+ ## Hamming 码 / Hamming Codes (1950)
26
+
27
+ > [7,4] Hamming 码:4 位信息 + 3 位校验 = 7 位码字,最小 Hamming 距离 d_min = 3
28
+ > 可纠正 1 位错误或检测 2 位错误
29
+ > 一般 [2^r−1, 2^r−1−r] Hamming 码:r 位校验,最小距离 3
30
+
31
+ **含义**:纠错编码的第一个系统构造——少量冗余即可保护信息免受噪声损坏。
32
+
33
+ **数学背景**:Richard Hamming 在 Bell 实验室工作时,因早期计算机的硬件错误导致程序崩溃,于是设计了第一个系统化的纠错码。Hamming 距离 d(x,y) = 两个二进制串不同位置的个数;最小距离 d_min ≥ 2t+1 时可纠正 t 位错误。Hamming 码是完美码(perfect code)——球 packing 恰好填满整个空间。后续发展:Reed-Solomon 码(1960)用于突发纠错和 CD/DVD;LDPC 码(Gallager 1962)和 Turbo 码(1993)逼近 Shannon 极限。
34
+
35
+ ## Kolmogorov 复杂度 / Kolmogorov Complexity (1965)
36
+
37
+ > K(x) = 输出 x 的最短程序长度(在通用 Turing 机上)
38
+ > Kolmogorov 复杂度是信息的算法度量——与 Shannon 熵互补
39
+ >
40
+ > 不可计算性:K(x) 不可一般计算(Chaitin 不完备定理)
41
+
42
+ **含义**:最短程序描述长度是对象的内在信息量——比 Shannon 熵更本质的信息度量,不依赖概率分布。
43
+
44
+ **数学背景**:Andrey Kolmogorov 在 1965 年提出算法信息论,定义 K(x) 为在通用 Turing 机 U 上输出 x 的最短程序 |p| 的长度:K_U(x) = min{|p| : U(p) = x}。关键性质:(1) 不可计算性——不存在算法一般地计算 K(x);(2) 不变定理——不同通用 Turing 机上的 K_U(x) 差异至多为常数 c(依赖于机器选择);(3) 与熵的关系——对 i.i.d. 序列,E[K(x)] ≈ nH(X)(Shannon 熵的算法版本);(4) Chaitin 不完备定理——形式系统不能证明 K(x) > c 对大多数 x 成立。Kolmogorov 复杂度是 MDL 原则的理论根基。
45
+
46
+ ## KL 散度 / KL Divergence (Kullback-Leibler, 1951)
47
+
48
+ > D(P||Q) = Σ p(x) log(p(x)/q(x)) = E_P[log(p(X)/q(X))]
49
+ >
50
+ > D(P||Q) ≥ 0,等号当且仅当 P = Q
51
+ > D(P||Q) ≠ D(Q||P)——不对称
52
+ > D(P||Q) 不是距离(不对称、不满足三角不等式)
53
+
54
+ **含义**:KL 散度度量"用 Q 分布编码 P 分布的数据所需的额外比特数"——信息损失的单向度量。
55
+
56
+ **数学背景**:Solomon Kullback 与 Richard Leibler 在 1951 年提出相对熵(relative entropy),定义为 D(P||Q) = Σ p(x) log(p(x)/q(x))。核心性质:(1) 非负性 D(P||Q) ≥ 0(由 Gibbs 不等式证明);(2) 不对称性 D(P||Q) ≠ D(Q||P)——D(P||Q) 的解释是"用 Q 编码 P 的数据的期望额外长度",方向不可互换;(3) 与互信息的关系 I(X;Y) = D(p(x,y)||p(x)p(y))——互信息是联合分布与独立假设分布间的 KL 散度;(4) 与熵的关系 H(P) + D(P||Q) = Σ p(x)(−log q(x))——交叉熵 = 熵 + KL 散度。交叉熵损失函数是深度学习的核心:min H(P) + D(P||Q) = min Σ p(x)(−log q(x))。
57
+
58
+ ## 码率-失真理论 / Rate-Distortion Theory (Shannon, 1959)
59
+
60
+ > R(D) = min_{p(z|x): E[d(x,z)]≤D} I(X;Z)
61
+ >
62
+ > 在允许失真 D 的条件下,所需的最小码率 R(D)
63
+ > R(0) = H(X)(无损压缩),R(D_max) = 0(最大允许失真)
64
+
65
+ **含义**:有损压缩存在码率-失真函数 R(D) 的基本极限——更低的码率需要接受更大的失真。
66
+
67
+ **数学背景**:Shannon 在 1959 年扩展信源编码定理到有损压缩情形。码率-失真函数 R(D) 定义为在期望失真 E[d(x,z)] ≤ D 的约束下最小化互信息 I(X;Z)。失真度量 d(x,z) 可选 Hamming 失真(二元)、平方误差(连续)等。R(D) 单调递减、凸函数——失真容忍越大,所需码率越低。逆函数 D(R) 给出给定码率下的最小可达失真。实际应用:JPEG/MPEG 压缩、语音编码等遵循此理论框架。
68
+
69
+ ## Fisher 信息 / Fisher Information (1925)
70
+
71
+ > I(θ) = E[(∂log f(X;θ)/∂θ)²] = −E[∂²log f(X;θ)/∂θ²]
72
+ >
73
+ > Cramér-Rao 下界:Var(θ̂) ≥ 1/I(θ),对任何无偏估计量 θ̂
74
+ > Fisher 信息度量数据对参数 θ 的信息含量
75
+
76
+ **含义**:Fisher 信息是统计推断的信息论度量——它连接了信息论与参数估计的理论极限。
77
+
78
+ **数学背景**:R.A. Fisher 在 1925 年提出信息量概念 I(θ),度量一个观测对参数 θ 的区分能力。Cramér (1946) 与 Rao (1945) 分别独立证明了 Cramér-Rao 下界 Var(θ̂) ≥ 1/nI(θ)。关键联系:(1) Fisher 信息与 KL 散度——I(θ) = lim_{θ'→θ} 2D(f(x;θ)||f(x;θ'))/(θ−θ')²,KL 散度的局部二阶近似;(2) Fisher 信息与 Bayesian 信息——Jeffreys 先验 p(θ) ∝ |I(θ)|^(1/2) 使得参数空间中 Fisher 信息度量下的体积均匀;(3) 最大似然估计的大样本性质——θ̂_MLE 渐近正态 N(θ, 1/nI(θ)),达到 Cramér-Rao 下界。Fisher 信息是信息论与统计推断的桥梁。
79
+
80
+ ## MDL 原则 / MDL Principle (Rissanen, 1978)
81
+
82
+ > MDL(M, D) = L(D|M) + L(M)
83
+ >
84
+ > 选择使"数据给定模型的描述长度 + 模型本身的描述长度"最小的模型
85
+ > L(D|M) = −log P(D|M)(数据的负对数似然)
86
+ > L(M) = 模型编码长度(复杂度惩罚)
87
+
88
+ **含义**:MDL 是信息论版本的奥卡姆剃刀——好模型既准确(数据描述短)又简约(模型描述短)。
89
+
90
+ **数学背景**:Jorma Rissanen 在 1978 年提出最小描述长度原则,将模型选择转化为编码问题。MDL 与其他准则的关系:(1) MDL 与 BIC——两参数 MDL(L(D|M)+L(M))与 BIC (−2lnL+k·ln(n)) 在大样本下等价;(3) MDL 与 Kolmogorov 复杂度——理想 MDL 用 Kolmogorov 复杂度 K(M) 庡量模型复杂度,但 K(M) 不可计算;实际 MDL 用参数编码长度近似。先验 MDL(1996)用混合编码处理参数,避免任意精度问题。MDL 的核心洞见:模型选择本质上是数据压缩——最好的模型是压缩数据最好的模型。
91
+
92
+ ## 互信息与信道容量 / Mutual Information and Channel Capacity
93
+
94
+ > I(X;Y) = H(X) − H(X|Y) = H(Y) − H(Y|X) = H(X) + H(Y) − H(X,Y)
95
+ >
96
+ > 互信息的对称性:I(X;Y) = I(Y;X)
97
+ > 互信息的非负性:I(X;Y) ≥ 0,等号当且仅当 X,Y 独立
98
+ >
99
+ > 信道容量 C = max_{p(x)} I(X;Y)
100
+ > 典型集 A_ε^n:{x^n : |−log p(x^n)/n − H(X)| < ε}
101
+
102
+ **含义**:互信息是两个随机变量间依赖关系的精确度量——为零等价于独立,为正则存在统计关联。信道容量是互信息在所有输入分布上的最大值,定义可靠通信的理论极限。
103
+
104
+ **数学背景**:互信息 I(X;Y) = Σ p(x,y) log(p(x,y)/p(x)p(y)) = D(p(x,y)||p(x)p(y))——联合分布与独立假设分布间的 KL 散度。典型集是 Shannon 证明编码定理的关键工具:对 i.i.d. 信源 X^n,典型序列 x^n 满足 |−1/n log p(x^n) − H(X)| < ε;典型集的概率趋近 1(当 n→∞),但典型集的大小 ≈ 2^{nH(X)},远小于整个空间 2^n(当 H(X) < 1)。这解释了为何压缩到 nH(X) bits 即可覆盖几乎所有有效序列。
105
+
106
+ ## 联合熵、条件熵与链式规则 / Joint Entropy, Conditional Entropy, and Chain Rules
107
+
108
+ > H(X,Y) = H(X) + H(Y|X) —— 联合熵链式规则
109
+ > H(Y|X) = Σ p(x) H(Y|X=x) —— 条件熵
110
+ > I(X;Y) = H(X) − H(X|Y) = H(Y) − H(Y|X) —— 互信息
111
+ > I(X;Y|Z) = H(X|Z) − H(X|Y,Z) —— 条件互信息
112
+ > I(X₁;X₂;...;Xₙ) 的链式展开:I(X;Y,Z) = I(X;Y) + I(X;Z|Y)
113
+
114
+ **含义**:熵的链式规则将联合不确定性拆解为逐个变量的贡献——理解多变量系统的信息结构。
115
+
116
+ **数学背景**:联合熵 H(X,Y) = −Σ p(x,y) log p(x,y) 度量一对随机变量的总不确定性。链式规则 H(X,Y) = H(X) + H(Y|X) 说明:知道 X 后,Y 的额外不确定性是 H(Y|X)。推广到 n 个变量:H(X₁,...,Xₙ) = Σᵢ H(Xᵢ|X₁,...,Xᵢ₋₁)。条件互信息 I(X;Y|Z) 度量"在已知 Z 的条件下,Y 对 X 的额外信息量"——这是信息瓶颈和因果推断的关键工具。多变量互信息的链式展开:I(X;Y,Z) = I(X;Y) + I(X;Z|Y),说明 Y 和 Z 对 X 的联合信息等于 Y 的直接信息加上 Z 的条件信息。
117
+
118
+ ## 信息论与编码理论的日常洞见
119
+
120
+ > "信息论的核心不是计算精确的比特数,而是养成'不确定性可量化、信息有价值、极限不可逾越'的思维习惯。"
121
+
122
+ - 不要忽视不确定性——熵 H(X) 量化它
123
+ - 信息有方向和大小——互信息 I(X;Y) 度量它
124
+ - 压缩有极限——信源编码定理限定它
125
+ - 通信有极限——信道编码定理限定它
126
+ - 模型选择有信息论标准——AIC/BIC/MDL 指导它
127
+ - 概率分布间有信息距离——KL 散度衡量它