math-skill 1.0.0 → 2.1.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (87) hide show
  1. package/README.en-US.md +313 -0
  2. package/README.md +313 -278
  3. package/agents/math-critic.en.md +235 -0
  4. package/agents/math-critic.md +237 -203
  5. package/commands/abstraction.md +11 -34
  6. package/commands/algorithmic-thinking.md +11 -34
  7. package/commands/ask.md +18 -21
  8. package/commands/axiomatization.md +11 -34
  9. package/commands/causal-inference.md +11 -34
  10. package/commands/discrete-combinatorial.md +11 -34
  11. package/commands/game-theory.md +11 -34
  12. package/commands/induction-analogy.md +11 -34
  13. package/commands/information-theory.md +11 -34
  14. package/commands/logic-deduction.md +11 -34
  15. package/commands/modeling.md +11 -37
  16. package/commands/optimization.md +11 -33
  17. package/commands/probability-statistics.md +11 -36
  18. package/commands/symmetry-invariance.md +11 -34
  19. package/commands/topological-thinking.md +11 -33
  20. package/commands/transformation.md +11 -33
  21. package/knowledge-base/overview.en.md +228 -0
  22. package/knowledge-base/overview.md +230 -230
  23. package/package.json +73 -59
  24. package/references/agentic-workflow.en.md +53 -0
  25. package/references/agentic-workflow.md +55 -0
  26. package/references/books/abstract-algebra.md +124 -0
  27. package/references/books/algebraic-geometry-rising-sea.md +171 -0
  28. package/references/books/differential-geometry.md +140 -0
  29. package/references/books/matrix-analysis.md +146 -0
  30. package/references/books/micro-lie-theory.md +116 -0
  31. package/references/books/optimization-ml.md +164 -0
  32. package/references/books/smooth-manifolds.md +105 -0
  33. package/references/gpu-friendly-math.en.md +65 -0
  34. package/references/gpu-friendly-math.md +67 -0
  35. package/references/inspiration.en.md +113 -0
  36. package/{docs → references}/inspiration.md +2 -0
  37. package/skills/abstraction/SKILL.en.md +117 -0
  38. package/skills/abstraction/SKILL.md +121 -264
  39. package/skills/abstraction/original-texts.en.md +163 -0
  40. package/skills/algorithmic-thinking/SKILL.en.md +132 -0
  41. package/skills/algorithmic-thinking/SKILL.md +138 -371
  42. package/skills/algorithmic-thinking/original-texts.en.md +253 -0
  43. package/skills/axiomatization/SKILL.en.md +144 -0
  44. package/skills/axiomatization/SKILL.md +151 -213
  45. package/skills/axiomatization/original-texts.en.md +154 -0
  46. package/skills/causal-inference/SKILL.en.md +147 -0
  47. package/skills/causal-inference/SKILL.md +151 -374
  48. package/skills/causal-inference/original-texts.en.md +136 -0
  49. package/skills/discrete-combinatorial/SKILL.en.md +124 -0
  50. package/skills/discrete-combinatorial/SKILL.md +131 -286
  51. package/skills/discrete-combinatorial/original-texts.en.md +184 -0
  52. package/skills/game-theory/SKILL.en.md +117 -0
  53. package/skills/game-theory/SKILL.md +123 -318
  54. package/skills/game-theory/original-texts.en.md +131 -0
  55. package/skills/induction-analogy/SKILL.en.md +145 -0
  56. package/skills/induction-analogy/SKILL.md +152 -310
  57. package/skills/induction-analogy/original-texts.en.md +140 -0
  58. package/skills/information-theory/SKILL.en.md +134 -0
  59. package/skills/information-theory/SKILL.md +140 -242
  60. package/skills/information-theory/original-texts.en.md +127 -0
  61. package/skills/logic-deduction/SKILL.en.md +130 -0
  62. package/skills/logic-deduction/SKILL.md +135 -280
  63. package/skills/logic-deduction/original-texts.en.md +160 -0
  64. package/skills/math-research-activator/SKILL.en.md +132 -0
  65. package/skills/math-research-activator/SKILL.md +136 -0
  66. package/skills/math-research-activator/original-texts.en.md +105 -0
  67. package/skills/{meta-selector → math-research-activator}/original-texts.md +104 -104
  68. package/skills/modeling/SKILL.en.md +135 -0
  69. package/skills/modeling/SKILL.md +139 -318
  70. package/skills/modeling/original-texts.en.md +162 -0
  71. package/skills/optimization/SKILL.en.md +129 -0
  72. package/skills/optimization/SKILL.md +135 -292
  73. package/skills/optimization/original-texts.en.md +167 -0
  74. package/skills/probability-statistics/SKILL.en.md +146 -0
  75. package/skills/probability-statistics/SKILL.md +151 -312
  76. package/skills/probability-statistics/original-texts.en.md +191 -0
  77. package/skills/symmetry-invariance/SKILL.en.md +135 -0
  78. package/skills/symmetry-invariance/SKILL.md +139 -358
  79. package/skills/symmetry-invariance/original-texts.en.md +206 -0
  80. package/skills/topological-thinking/SKILL.en.md +124 -0
  81. package/skills/topological-thinking/SKILL.md +128 -273
  82. package/skills/topological-thinking/original-texts.en.md +134 -0
  83. package/skills/transformation/SKILL.en.md +120 -0
  84. package/skills/transformation/SKILL.md +124 -264
  85. package/skills/transformation/original-texts.en.md +204 -0
  86. package/docs/CLAUDE.md +0 -187
  87. package/skills/meta-selector/SKILL.md +0 -188
@@ -0,0 +1,146 @@
1
+ # 🧮 矩阵分析 / Matrix Analysis
2
+
3
+ > Roger A. Horn & Charles R. Johnson, *Matrix Analysis*, 2nd Edition, Cambridge University Press, 2013(ISBN 978-0-521-83940-2)。以**标准型(canonical forms)作为统一主题**的研究生级矩阵理论经典。
4
+
5
+ ## 概要
6
+
7
+ 这是把"线性代数"升级为"矩阵分析"的权威参考:不只算矩阵,而是研究矩阵在**相似 / 酉等价 / 合同**等变换下的不变量、标准型、谱的位置与扰动、范数几何、以及正定/非负结构。对 AI/ML/GPU 而言,它是 v2 书单里**最贴近底层算子的骨干**——GEMM、数值稳定、低秩压缩、二阶优化全都从这里取根。
8
+
9
+ 真实章节地图(来自实际目录):
10
+
11
+ - **Ch 0 Review and Miscellanea**:秩、非奇异、内积、分块矩阵——速查底座。
12
+ - **Ch 1 Eigenvalues, Eigenvectors, and Similarity**:特征方程、特征多项式、代数/几何重数、相似(§1.1–1.4)。
13
+ - **Ch 2 Unitary Similarity and Unitary Equivalence**:QR 分解(§2.1)、Schur 三角化(§2.4)、正规矩阵(§2.5)、**SVD(§2.6)**、CS 分解(§2.7)。
14
+ - **Ch 3 Canonical Forms for Similarity and Triangular Factorizations**:Jordan 标准型(§3.1)、最小多项式与友矩阵(§3.3)、实 Jordan 与 Weyr 型(§3.4)、三角分解 LU(§3.5)。
15
+ - **Ch 4 Hermitian, Symmetric Matrices, and Congruences**:变分刻画 Courant–Fischer(§4.2)、特征值不等式 Weyl/交错(§4.3)、合同与惯性定律(§4.5)。
16
+ - **Ch 5 Norms for Vectors and Matrices**:范数与内积、对偶范数(§5.5)、**矩阵范数(§5.6–5.7)**、**条件数(§5.8)**。
17
+ - **Ch 6 Location and Perturbation of Eigenvalues**:Geršgorin 圆盘(§6.1–6.2)、特征值扰动定理(§6.3)。
18
+ - **Ch 7 Positive Definite and Semidefinite Matrices**:极分解与 SVD(§7.3–7.4)、**Schur 积定理(§7.5)**、同时对角化(§7.6)、Loewner 偏序与分块矩阵(§7.7)、正定不等式(§7.8)。
19
+ - **Ch 8 Positive and Nonnegative Matrices**:Perron–Frobenius(§8.2–8.5)、随机与双随机矩阵(§8.7)。
20
+ - 附录 A–F:复数、**凸集与凸函数(B)**、代数基本定理、特征值连续性、紧致性、典范对(F)。
21
+
22
+ **激活时的边界提醒**:本书是**理论优先**的——讲存在性、刻画、不等式、标准型,而**不是数值算法食谱**。具体的算法实现、收敛常数、稳定性细节(如 blocked QR 的通信下界、SVD 的实际复杂度系数)需配数值线性代数教材(Golub–Van Loan / Trefethen–Bau)。这里给的是"该用哪个结构 + 为什么 + GPU 能不能算"的**激活索引**,落地实现回查那一类书。
23
+
24
+ ## 可迁移到 AI/Infra 的核心结构
25
+
26
+ | 数学结构(章节) | 迁移到 ML / 算法 / Infra |
27
+ |---|---|
28
+ | **SVD / 低秩(§2.6, §7.4)** | 一切低秩压缩的根基:LoRA、PCA/白化、Eckart–Young 最优低秩逼近、KV-Cache 低秩化、权重压缩 |
29
+ | **谱与相似不变量(Ch 1)** | Hessian/梯度协方差谱、谱半径决定线性 attention / SSM / RNN 的稳定性、迹=参数计数/正则 |
30
+ | **Schur 三角化 + 正规矩阵(§2.4–2.5)** | 数值 EVD 算法(QR algorithm)地基;正规⇔可酉对角化,是"良态谱"的判据 |
31
+ | **变分刻画 Courant–Fischer(§4.2)** | Rayleigh 商、谱归一化、谱聚类、PCA 即 min–max;最大奇异值=算子范数 |
32
+ | **特征值扰动 Weyl/Bauer–Fike(§4.3, §6.3)** | 量化/低精度/剪枝下的谱漂移界、训练扰动鲁棒性、稳定性证书 |
33
+ | **矩阵范数 + 对偶(§5.5–5.7)** | 谱范数(梯度裁剪/Lipschitz)、Frobenius(权重衰减)、**核范数=谱范数对偶**(低秩正则) |
34
+ | **条件数(§5.8)** | 数值稳定诊断、预条件、为什么 bf16 训练会发散 |
35
+ | **极分解 + Newton–Schulz(§7.3)** | 把梯度/权重正交化(Muon 优化器、正交初始化),纯 GEMM 可算 |
36
+ | **正定性 / PSD(Ch 7)** | 核方法、协方差、attention Gram 矩阵、二阶法预条件子、Loewner 偏序写矩阵不等式 |
37
+ | **Schur 积定理(§7.5)** | Hadamard 积保 PSD——可学习核工程、门控不破坏正定结构 |
38
+ | **Perron–Frobenius / 随机矩阵(Ch 8)** | attention 行随机矩阵的混合与坍缩(over-smoothing)、PageRank、图传播、谱 gap=表达力 |
39
+
40
+ 把上表收成四个**激活家族**,方便检索:
41
+
42
+ - **谱系(Ch 1–3)**:特征值/相似/标准型——回答"动力学稳不稳、谱长什么样"。注意 Jordan/Weyr 是理论工具,数值上转向 Schur/SVD。
43
+ - **范数系(Ch 5–6)**:范数/对偶/条件数/扰动——回答"误差怎么传、低精度稳不稳、该不该预条件"。
44
+ - **正定系(Ch 4, 7)**:Hermitian/PSD/极分解/Loewner——回答"二阶结构、核、协方差、最近正交矩阵"。
45
+ - **非负系(Ch 8)**:Perron–Frobenius/随机矩阵——回答"传播、混合、坍缩、平稳分布"。
46
+
47
+ ## 关键桥接事实(激活速记)
48
+
49
+ 把这本书"激活"成算法时,最常用到的连接性事实——记住这些就能在结构间快速跳转:
50
+
51
+ - **条件数 κ₂(A) = σ_max / σ_min(§5.8)**:直接预测 bf16/fp8 下误差放大几个数量级。
52
+ - **SVD ⇔ AᴴA 与 AAᴴ 的特征分解,σ = √λ(§2.6, §7.4)**:奇异值就是 Gram 矩阵的特征值开方。
53
+ - **谱范数 = σ_max,Frobenius = √Σσ²,核范数 = Σσ(§5.6)**:三大矩阵范数全由奇异值决定,谱范数与核范数互为对偶。
54
+ - **正规矩阵 ⇔ 可酉对角化(§2.5)**:唯一"特征值=奇异值结构良态"的类;非正规就要看 pseudospectra。
55
+ - **正定 ⇔ 所有特征值 > 0 ⇔ 所有顺序主子式 > 0(§7.1)**:后者是可算的正定判据(Sylvester 准则)。
56
+ - **极分解 A = UP,P = (AᴴA)^½(§7.3)**:Newton–Schulz 迭代收敛到正交因子 U。
57
+ - **Weyl 扰动界 |λ_i(A+E) − λ_i(A)| ≤ ‖E‖₂(§4.3)**:一行给出量化/剪枝的谱漂移上界。
58
+ - **行随机矩阵谱半径 = 1(§8.7)**:attention 的 Perron 根恒为 1,谱 gap 决定坍缩速度。
59
+
60
+ ## 适合激活的问题类型
61
+
62
+ - **低秩 / 压缩**:注意力、KV-Cache、权重、梯度里哪里有冗余?能压到多少秩?截断的最优逼近误差怎么估(Eckart–Young)?低秩正则该用核范数还是直接参数化?
63
+ - **数值稳定性**:低精度(bf16/fp8)训练为何发散?条件数与谱半径如何在线监控?量化/剪枝的谱漂移有没有界(Weyl、Bauer–Fike)?哪些算子需要重参数化才稳?
64
+ - **谱设计**:归一化(谱归一化 / BatchNorm)背后的算子范数;谱半径约束的循环 / 状态空间模型(SSM);谱 gap 决定表达力与可分性。
65
+ - **二阶优化**:Hessian / Fisher 的 PSD 结构与负曲率(惯性定律检测鞍点);预条件子的条件数改善;Kronecker 因子近似(K-FAC / Shampoo)。
66
+ - **图 / 传播**:消息传递的稳定性与 over-smoothing;行随机算子的混合时间;Markov 链平稳分布与谱 gap。
67
+
68
+ ## 可能的算法启发
69
+
70
+ > 每条标注**八维落点**(对应 `../gpu-friendly-math.md` 维度编号),方便直接进 GPU 验收门。
71
+
72
+ 1. **随机化数值线代(randomized NLA)**:用随机投影 + QR(§2.1)做随机 SVD,把 O(n³) 完整分解降到亚二次,对超大权重/激活做低秩草图(sketching)。*落点:维度 2/3——全 GEMM、复杂度可控。*
73
+ 2. **低秩注意力 / KV 压缩**:以 Eckart–Young(§7.4)保证截断 SVD 是最优低秩逼近;用**核范数(谱范数对偶,§5.5)**作低秩正则,把 KV-Cache 投影到低维子空间。*落点:维度 2/4——GEMM 链 + 显存压缩。*
74
+ 3. **谱归一化(spectral normalization)**:power iteration 估最大奇异值(算子范数 §5.6),约束每层 Lipschitz——GAN/扩散/稳定训练。*落点:维度 1/6——matvec,但迭代串行需块化。*
75
+ 4. **Newton–Schulz 正交化(Muon 式)**:极分解(§7.3)把梯度矩阵投到最近正交矩阵,迭代只含矩阵乘——当前最 GPU 友好的"二阶味"更新。*落点:维度 2/6/8——纯 GEMM、可融合、bf16 稳。*
76
+ 5. **预条件 / Shampoo / K-FAC**:条件数(§5.8)诊断病态,用 PSD Kronecker 因子(Ch 7)近似 Hessian 做预条件,把病态损失面拉圆。*落点:维度 2/5——小矩阵 GEMM,注意逆运算的精度。*
77
+ 6. **Geršgorin 廉价谱半径门(§6.1)**:训练循环里用圆盘界 O(n²) 快速估谱半径,做低成本稳定性 gate,不必跑完整 EVD。*落点:维度 1/3——逐行求和,极廉价。*
78
+ 7. **PSD 核工程(Schur 积定理 §7.5)**:用 Hadamard 积组合多个 PSD 核,保证可学习相似度矩阵始终半正定。*落点:维度 1——逐元素张量积,天然友好。*
79
+ 8. **Perron–Frobenius 诊断(§8.2–8.5)**:把行随机 attention 当 Markov 算子,用谱 gap 量化 over-smoothing / rank collapse,指导残差与温度设计。*落点:维度 1/3——谱估计廉价,避免深层坍缩。*
80
+ 9. **块化 / communication-avoiding 分解**:把 QR、Cholesky(§3.5)写成分块版本,用 GEMM 替代逐列消元,跨设备减少通信轮次。*落点:维度 2/6——串行递推改造成并行 + overlap。*
81
+
82
+ ## GPU 友好性警告
83
+
84
+ > 评分维度引用 `../gpu-friendly-math.md` 的**八维检查**(张量化 / GEMM 可映射 / 复杂度 / 显存 / 低精度 / 并行 / 稀疏 / 算子融合),此处不重复定义。
85
+
86
+ **天然友好(math beautiful × GPU friendly):**
87
+ - **SVD 截断 / 低秩**:写成 GEMM 链(维度 2),压缩 KV-Cache/权重(维度 4)。
88
+ - **Frobenius / 谱范数、Gram 矩阵、Hadamard 积**:批量张量代数(维度 1、2)。
89
+ - **极分解 Newton–Schulz**:纯矩阵乘迭代(维度 2、6、8 可融合),bf16 下稳健。
90
+ - **Geršgorin 圆盘**:O(n²) 逐行求和(维度 1),廉价稳定性估计。
91
+ - **良态 PSD 的 blocked Cholesky / Gram 构造**:分块后是 GEMM 链(维度 2),核方法与协方差预条件常用。
92
+
93
+ **美但不可算(beautiful, not computable):**
94
+ - **Jordan 标准型(§3.1)**——经典反例:特征值重数对扰动极度敏感,浮点下根本无法可靠计算,**永远不要当数值工具**(违反维度 5 低精度稳定)。Weyr 型同理。
95
+ - **完整 EVD / SVD 的 O(n³)**——大矩阵直接爆(违反维度 3),必须换随机化/迭代法。
96
+ - **非正规矩阵(non-normal,§2.5 之外)**——特征值不能反映真实行为,需 pseudospectra;低精度下谱失真(维度 5)。
97
+ - **病态 / 高条件数(§5.8)**——会出现灾难性抵消,要 fp64 才对,与 bf16/fp8 训练冲突(维度 5)。
98
+ - **QR / Cholesky 的串行依赖(§2.1, §3.5)**——朴素实现是长串行递推(违反维度 6),需 blocked / communication-avoiding 变体。
99
+ - **power iteration 的串行迭代**——单向量迭代并行度低;需块化(block / subspace iteration)才吃满 SM(维度 6)。
100
+
101
+ **改造手法(呼应 `../gpu-friendly-math.md` 的 Make-It-Computable Toolkit):**
102
+ - 完整 EVD/SVD → **随机化 + 截断**降复杂度(维度 3);
103
+ - 精确分解 → **块化 / GEMM 化**消除串行(维度 2/6);
104
+ - 病态/非正规 → **重参数化 + 谱归一化**稳低精度(维度 5);
105
+ - Jordan 等不可算标准型 → 只留作**理论证明**,数值上换 Schur/SVD。
106
+
107
+ ## 该调用哪个思想武器
108
+
109
+ 配合 `skills/` 下的现有武器使用:
110
+
111
+ - **`transformation`(变换)**:相似 / 酉等价 / 合同、SVD、对角化——本书的灵魂就是"换坐标让结构显形"。
112
+ - **`algorithmic-thinking`(算法与计算)**:power iteration、Newton–Schulz、QR algorithm、随机化 NLA——把定理变成可跑的 kernel。
113
+ - **`optimization`(优化)**:变分刻画(§4.2)、条件数与预条件、二阶法、Loewner 偏序下的矩阵不等式。
114
+ - **`symmetry-invariance`(对称与不变性)**:酉不变性、相似不变量(特征值/迹/行列式)、正规矩阵的良态谱。
115
+ - **`abstraction`(抽象化)**:标准型即"等价类的代表元"——用最简形态抓住本质、忽略坐标细节。
116
+ - **`probability-statistics`(概率与统计)**:随机化 NLA、随机矩阵谱、Perron–Frobenius/Markov 链平稳分布。
117
+
118
+ ## 反模式
119
+
120
+ - **把 Jordan 型当数值算法**:它在浮点下不可算,只用于理论分析,不要写进 kernel。
121
+ - **默认上完整 SVD/EVD**:大规模场景该用随机化/截断/迭代,否则 O(n³) 直接拖垮。
122
+ - **只看特征值忽略非正规性**:非正规矩阵的特征值不预测瞬态行为,要看奇异值 / pseudospectra。
123
+ - **假设矩阵都良态**:不监控条件数就上 bf16/fp8,发散后才找原因。
124
+ - **用核范数却忘了它要 SVD**:核范数是优雅的低秩正则,但计算依赖 SVD,需配近端/随机化技巧。
125
+ - **数值上假设精确正定**:浮点下 Gram/协方差可能丢正定性,要加 jitter(对角抖动)或用 Cholesky 带 pivot。
126
+ - **用 Frobenius 范数当低秩正则**:Frobenius / 权重衰减压的是"能量"不是"秩";要低秩得用核范数或显式低秩参数化(如 LoRA)。
127
+ - **对非对称矩阵谈"特征值大小"**:度量能量/范数/稳定裕度该看**奇异值**;非正规矩阵的特征值模长会严重误导(瞬态增长远超谱半径预测)。
128
+ - **把 O(n²) Gram 矩阵全量物化**:attention/核矩阵不分块就直接撑爆显存;应走 FlashAttention 式融合 + 分块(呼应 GPU 八维维度 4/8)。
129
+ - **堆定理而不诊断瓶颈**:先问"算法瓶颈是谱、低秩还是稳定性",再选结构,别一上来灌矩阵理论。
130
+
131
+ ## 深挖入口
132
+
133
+ > **📖 书目信息**:Roger A. Horn & Charles R. Johnson, *Matrix Analysis*, 2nd Edition, Cambridge University Press, 2013. ISBN 978-0-521-83940-2.
134
+ >
135
+ > **启用方式**:将 `Matrix Analysis.pdf` 放入项目根目录的 `math_book/` 文件夹,Agent 即可自动搜索原文。PDF 不随 npm/git 分发(版权原因),需自行获取。
136
+
137
+ **全保真回查 = 让 Agent 自动搜索本地 PDF `math_book/Matrix Analysis.pdf`**:用 `pdftotext` 抽取 → `grep` 定位关键词/定理名 → `Read` 命中页精读。本文件是"激活索引",不是替代品;需要精确陈述、证明或常数时,回原书核对。
138
+
139
+ 值得深读的真实章节:
140
+
141
+ - **§2.6 The singular value decomposition**——所有低秩压缩 / LoRA / PCA 的源头。
142
+ - **§4.2–4.3 Variational characterizations & eigenvalue inequalities**——Courant–Fischer min–max 与 Weyl 不等式,谱归一化与扰动界的理论根。
143
+ - **§5.6–5.8 Matrix norms & condition numbers**——数值稳定、梯度裁剪、预条件的判据全在这。
144
+ - **§7.3–7.5 Polar/SVD & the Schur product theorem**——Muon 正交化、PSD 核工程的直接出处。
145
+ - **§6.1–6.3 Geršgorin discs & perturbation theorems**——廉价谱定位与扰动鲁棒性。
146
+ - **§8.2–8.5 Perron–Frobenius theory**——行随机 attention、图传播、over-smoothing 分析。
@@ -0,0 +1,116 @@
1
+ # 🌀 李理论速成 / A micro Lie theory
2
+
3
+ > **A micro Lie theory for state estimation in robotics** — Joan Solà, Jeremie Deray, Dinesh Atchuthan.
4
+ > arXiv:1812.01537v9 [cs.RO],2021-12-08,正文约 17 页 + 附录公式手册。配套开源 C++ 头文件库 **manif**(<https://github.com/artivis/manif>,实现 SO(2)/SO(3)/SE(2)/SE(3) 及解析雅可比)。
5
+ > 本文件是「激活」蒸馏,**不复述原文**;全保真请回查本地 PDF(见〈深挖入口〉)。
6
+
7
+ ## 概要
8
+
9
+ 这篇文章把庞大的李理论(Lie theory)**蓄意"截肢"**到机器人状态估计够用的最小子集:它甚至不引入李括号(Lie bracket),而是把李代数(Lie algebra)直接降格为同构的向量空间 Rⁿ,让"曲的、非线性的"李群在切空间里变成"平的、线性的"向量代数。一句话主旨:**群上(曲)的几乎所有操作,在李代数(平)上都有精确对应**(Fig. 1)——这正是 inspiration.md 里 Sophus Lie "屠龙刀"的现代用法:屠龙(解微分方程)没成,却成了切菜(线性化非线性)、雕刻(描述对称性)、盖房子(机器人状态估计)的神兵。
10
+
11
+ 真实结构地图:
12
+ - **II. A micro Lie theory(核心)**:A 李群(群公理 + 流形)→ B 群作用 → C 切空间与李代数(hat `^∧` / vee `^∨` 算子)→ D **指数映射** exp/log 与大写 Exp/Log(式 23–24)→ E **加减算子** ⊕/⊖(式 25–28,分左右版本)→ F **伴随** Ad_X 与伴随矩阵(式 30–35)→ G **李群上的导数**:右雅可比(式 41a–c)/左雅可比(式 44)→ H **流形上的不确定性与协方差传播**(式 52)→ I 流形上的离散积分。
13
+ - **III. 流形微分法则**:A 链式法则、B 基本雅可比块、C 派生雅可比块。
14
+ - **IV. 复合流形(composite manifolds / bundles)**:把异构大状态拼成非交互流形块,逐块求导(式 84–90,Ex. 7 对比 SE(n) vs T(n)×SO(n) vs ⟨Rⁿ,SO(n)⟩)。
15
+ - **V. 应用**:基于路标的定位与建图——流形上误差状态卡尔曼滤波(式 92–96)、图优化 SLAM、传感器自标定。
16
+ - **VI. 结论 + 附录**:S¹/SO(2)/SE(2)、S³/SO(3)、SE(3) 的全套闭式公式(含右/左雅可比,如 SO(3) 式 143–145)。
17
+
18
+ ## 可迁移到 AI/Infra 的核心结构
19
+
20
+ 论文把"曲的非线性群"和"平的线性向量空间"用五件工具焊在一起,每件都能原样搬进可微算法。
21
+
22
+ ### 1. exp/log 映射 → 流形参数化(式 23–24,Fig. 1)
23
+
24
+ `Exp: Rⁿ → M`、`Log: M → Rⁿ` 是流形与其切空间(同构于线性 Rⁿ)之间的双射桥梁。迁移用法:**让网络在无约束的切空间 Rⁿ 里自由预测,再经 Exp 投回合法流形**。旋转、位姿、单位四元数因此天然满足约束(正交、单位范数),免去对回归出的矩阵/四元数做事后正交化或归一化的各种 ad-hoc 修补。
25
+
26
+ ### 2. ⊕/⊖ 加减算子 → 流形上的"向量代数"(式 25–28)
27
+
28
+ `⊕`(一次 Exp + 一次群合成)让"给流形状态加一个增量"写得像普通向量加法;`⊖` 求两元素之差(测地残差)。**关键陷阱**:因群合成不可交换,⊕/⊖ 分**右版本**(增量在局部坐标系/切于 X)与**左版本**(增量在全局坐标系/切于单位元 E),论文默认用右版本——工程里必须全程统一,混用即出错。
29
+
30
+ ### 3. 右/左雅可比 → 反向传播的几何正确版(式 41a–c、44)
31
+
32
+ 流形函数对切空间扰动的线性化即雅可比;流形上的链式法则形如 `D(g∘f)/DX = J_g · J_f`(§III-A),与欧式链式法则同构,故可直接接进自动微分。**右雅可比**(式 41)与**左雅可比**(式 44)描述的是局部 vs 全局切空间的同一导数,二者由伴随 Ad 互相转换。
33
+
34
+ ### 4. 伴随矩阵 Ad_X → 跨坐标系搬运切向量(式 30–35)
35
+
36
+ `Ad_X` 把同一切向量在不同点、左右坐标系之间搬运(式 32:`X ⊕ τ = (Ad_X τ) ⊕ X`)。它是**等变性的代数实现**,也是扰动/协方差跨坐标系传播的转换矩阵;Ex. 6 给出 SE(3) 的闭式伴随矩阵。
37
+
38
+ ### 5. 协方差传播 → 流形上的不确定性(式 52)
39
+
40
+ `Σ = E[(X⊖X̄)(X⊖X̄)ᵀ] ∈ Rᵐˣᵐ` —— **协方差活在切空间 Rⁿ 而非群上**。直接在群上定义方差是病态的;切空间表示让卡尔曼滤波/因子图的不确定性运算回到熟悉的线性代数。
41
+
42
+ 此外两件直接可用的"零件":
43
+ - **SE(3) / SO(3)**:刚体运动群 / 旋转群——位姿(pose)= 旋转 + 平移的统一可微表示,是相机、点云、机械臂关节的标准语言。
44
+ - **复合流形(composite manifolds / bundles,式 84–90)**:把多位姿 + 特征 + 标定等异构大状态拼成非交互流形块,雅可比**逐块组装**(式 89 为块结构化稀疏),即工程上"按块拼雅可比矩阵"。
45
+
46
+ ## 适合激活的问题类型
47
+
48
+ - 预测/回归量带**几何约束**:旋转、位姿、单位向量、SPD 矩阵——硬塞进欧式 MLP 会破坏约束。
49
+ - 需要**等变性 / 不变性**:输入做刚体变换,输出应协变或不变(点云、分子、多视几何)。
50
+ - 需要**显式不确定性**:位姿估计、传感器融合、SLAM、视觉里程计的协方差传播。
51
+ - **迭代式几何优化**:相机/点云配准(registration)、BA、IK,要在流形上做梯度/高斯牛顿而非欧式空间。
52
+ - 状态在**李群上演化**:惯性预积分、运动模型、可微物理/控制。
53
+
54
+ ## 可能的算法启发
55
+
56
+ - **SE(3)/SO(3) 等变网络**:以群元素为隐状态,层间用 Exp/⊕ 更新、用 Ad 搬运特征;等变性来自群作用而非数据增强。
57
+ - **流形损失(manifold loss)做位姿回归**:用 ⊖(测地误差)当 loss,而非对旋转矩阵/四元数做欧式 MSE;天然处理流形拓扑(如四元数双覆盖)。
58
+ - **李群优化器**:把 Adam/高斯牛顿改写成"切空间求梯度 → Exp 回投"的 retraction 形式(误差状态 error-state 思路,对应论文 §V-A 的流形 EKF)。
59
+ - **可微配准 / 对齐**:相机位姿、点云 ICP、多视 BA 写成 SE(3) 上的可微优化层,端到端训练。
60
+ - **流形参数化输出头**:网络出 Rⁿ 切向量,Exp 投回 SO(3)/SE(3),替代 6D/9D 旋转表示的各种 ad-hoc 正交化。
61
+ - **不确定性感知融合**:用式 52 的切空间协方差 + Ad 传播,做可学习的卡尔曼/因子图层。
62
+
63
+ ## GPU 友好性警告
64
+
65
+ > 验收门唯一权威:[`../gpu-friendly-math.md`](../gpu-friendly-math.md)(八维:①张量化 ②GEMM 可映射 ③复杂度 ④显存/KV ⑤低精度稳定 ⑥并行与通信 ⑦稀疏结构 ⑧算子融合)。逐维打分如下。
66
+
67
+ | # | 维度 | 评级 | 说明 |
68
+ |---|---|---|---|
69
+ | ① | 张量化 | ✅ | SO(3)/SE(3) 的 exp/log 有**闭式**(Rodrigues),3×3/4×4 小矩阵,批量化为 `[B,3,3]` / `[B,4,4]` 张量逐样本独立 |
70
+ | ② | GEMM 可映射 | ⚠️ | 3×3/4×4 太小,**吃不满 Tensor Core**,bmm/批量小 GEMM 利用率低、易受访存带宽限制;改造:把 batch 维堆大、用专用小核或 einsum 融合 |
71
+ | ③ | 复杂度 | ✅ | 每元素 O(1),随 batch 线性 |
72
+ | ④ | 显存 | ✅ | 元素极小;但高自由度复合状态的雅可比/协方差矩阵会变大(块结构,仍可控) |
73
+ | ⑤ | 低精度稳定 | ❌ **重点** | exp/log 含 `sinθ/θ`、`(1−cosθ)/θ²` 等项,在 **θ→0**(除零)与 **θ→π**(log 奇异)处灾难性抵消;fp16/bf16 极易 NaN。**必须**对小角做 Taylor 展开切换——而分支会带来 warp divergence(伤①⑧) |
74
+ | ⑥ | 并行与通信 | ⚠️ | 逐样本 exp/log 是 embarrassingly parallel ✅;但**流形上的离散积分/运动链**(§II-I,连乘 Exp)是**串行递推**,长序列需写成并行扫描(parallel scan)才能并行 |
75
+ | ⑦ | 稀疏结构 | ✅ | 复合流形的雅可比是**块结构化稀疏**(式 89),对 GPU 友好 |
76
+ | ⑧ | 算子融合 | ✅ | 闭式 exp/log/雅可比可融进**单 kernel**,避免物化中间小矩阵 |
77
+
78
+ **展开说明(闭式 vs 级数 / 批量化 / 小矩阵指数能否张量化)**:
79
+
80
+ 李理论里 `exp/log` 的 GPU 命运,完全取决于"是否落在有闭式的低维群上"。
81
+
82
+ - **闭式 vs 级数(结论 1)**:SO(3) 的指数映射就是 **Rodrigues 公式** `exp([θ]×) = I + (sinθ/θ)[θ]× + ((1−cosθ)/θ²)[θ]ײ`(Ex. 4),SE(3) 类似带一个左雅可比因子 V(θ)——都是**有限项闭式**,纯张量代数、逐样本独立、无数据相关循环。反面是**通用矩阵指数**:任意李群没有 Rodrigues 式闭式,只能 Taylor 级数 + scaling-and-squaring **迭代**逼近,步数数据相关、控制流发散、难张量化,是典型"美但不可算"。闭式只属于 SO(3)/SE(3)/SE(2)/S¹/S³ 这一小撮,**别把通用 matrix exp 当成廉价 O(1) 算子**。
83
+ - **批量化(结论 2)**:把 N 个旋转/位姿堆成 `[B,3,3]` / `[B,4,4]` 做批量 Exp/Log,是干净的 element-wise + 小 bmm,可与下游算子**融合进单 kernel**。小矩阵指数**能**张量化——批量堆叠即逐样本并行;但 3×3/4×4 太小,bmm 吃不满 Tensor Core,价值在"可批量、可融合"而非"打满算力",想提利用率就把 batch 堆大或用专用小核。
84
+ - **低精度奇异点(结论 3,头号风险)**:θ→0(`sinθ/θ` 除零)与 θ→π(log 不唯一)会灾难性抵消,fp16/bf16 直接 NaN。低精度训练前**必须**对小角做 Taylor 兜底并做确定性复现测试;兜底分支又会引入 warp divergence,需用 `where`/掩码而非数据相关跳转实现。
85
+ - **串行递推**:流形上的运动链/离散积分(§II-I)是连乘 Exp 的串行递推,长序列要改写成并行扫描(parallel scan)才能喂满 GPU。
86
+
87
+ ## 该调用哪个思想武器
88
+
89
+ - **⚛️ symmetry-invariance(首选)**:李群本就是**连续对称变换群**,本文是"对称/不变性→等变网络"最直接的数学弹药。
90
+ - **🔄 transformation(首选)**:exp/log 把"曲的非线性流形"等价变换到"平的线性切空间"——把难问题变换成易问题的范式样板(屠龙刀"切菜")。
91
+ - **⚖️ optimization**:流形上的优化、retraction、误差状态滤波(§V-A)。
92
+ - **🌉 modeling**:现实(机器人/相机状态+噪声)→数学(流形+协方差)→解释的建模闭环。
93
+ - **🧩 abstraction**:从具体矩阵/四元数抽象出"群"的统一接口(论文正文泛型 + 例子接地的写法本身就是抽象示范)。
94
+
95
+ ## 反模式
96
+
97
+ - **在欧式空间直接加减旋转/位姿**:对旋转矩阵/四元数做欧式 MSE 或线性插值——破坏流形约束,应改用 ⊕/⊖ 与测地误差。
98
+ - **左右扰动混用**:右雅可比/左雅可比、局部/全局坐标系约定不统一,导致协方差与梯度错位(论文反复强调默认用右版本)。
99
+ - **误以为 matrix exp 处处廉价闭式**:闭式只属于 SO(3)/SE(3) 等少数群;一般群得迭代级数,不可当作 O(1) 算子。
100
+ - **低精度下不处理奇异点**:θ→0/π 不做 Taylor 兜底,fp16 训练直接 NaN。
101
+ - **把 SE(3) 当成 T(3)×SO(3)**:二者切空间参数化不同(Ex. 7),平移-旋转是否耦合会改变雅可比,误用导致系统性偏差。
102
+ - **过度套用**:不需要不确定性传播/几何约束的任务硬上李理论,徒增复杂度与奇异点风险——数学美 ≠ 该用。
103
+
104
+ ## 深挖入口
105
+
106
+ > **📖 书目信息**:Joan Solà, Jérémie Deray, Dinesh Atchuthan, *A micro Lie theory for state estimation in robotics*, arXiv:1812.01537v9, 2021. 配套开源 C++ 库 [manif](https://github.com/artivis/manif)。
107
+ >
108
+ > **启用方式**:将 `A micro Lie theory.pdf` 放入项目根目录的 `math_book/` 文件夹,Agent 即可自动搜索原文。PDF 不随 npm/git 分发(版权原因),需自行获取。
109
+
110
+ > 全保真回查 = 让 Agent 自动检索本地 PDF:`math_book/A micro Lie theory.pdf`(用 `pdftotext` 或 Read PDF pages)。下列为该 PDF 内的真实章节/公式块定位:
111
+
112
+ 1. **§II-D 指数映射 + Fig. 1**:exp/log 与大写 Exp/Log 算子(式 23–24)——流形↔切空间桥梁与闭式来源;配 Ex. 3(SO(3) 的李代数 `[ω]×`)、Ex. 4(SO(3) 的 exp = Rodrigues)。
113
+ 2. **§II-E 加减算子(式 25–28)+ §II-F 伴随 Ad_X(式 30–35)**:流形上的"加/减"与左右扰动互转;Ex. 6(SE(3) 的伴随矩阵)。
114
+ 3. **§II-G 李群上的导数 + §III-A 链式法则**:右雅可比(式 41a–c)、左雅可比(式 44),二者由伴随相联——反传/梯度的几何正确形式。
115
+ 4. **§II-H 流形上的不确定性与协方差传播(式 52)**:Σ 定义在切空间;§V-A 流形误差状态 EKF(式 92–96)是落地范例。
116
+ 5. **附录公式手册**:SO(3) 右/左雅可比闭式(式 143–145)、SE(3) 雅可比(引 Barfoot),以及 §IV 复合流形逐块雅可比(式 84–90,Ex. 7)——工程实现直接查表,对照 manif 库。
@@ -0,0 +1,164 @@
1
+ # ⚙️ 最优化(含 ML 应用)/ Optimization with ML
2
+
3
+ > **An Introduction to Optimization, With Applications to Machine Learning** (5th Edition, 2024)
4
+ > Edwin K. P. Chong, Wu-Sheng Lu, Stanisław H. Żak — John Wiley & Sons(Hardback ISBN 9781119877639)
5
+ >
6
+ > 本文件是「激活参考」:综合提炼、面向工程,不逐字摘录。
7
+ > 目标——把这本经典优化教材里**能落到算法 / GPU / 训练 Infra** 的结构抽出来。
8
+
9
+ ## 概要
10
+
11
+ 经典连续优化教材的第五版。相较旧版,最大增量是新增完整的 **Part V「机器学习中的优化」**,把一阶/二阶最优性、对偶、KKT、收敛性与 SGD/SVM/PCA 等训练实践彻底打通。全书 31 章,分五部分。
12
+
13
+ 真实章节地图:
14
+
15
+ - **Part I — 数学复习(Ch 1–5)**
16
+ - Ch 1 证明方法与记号;Ch 2 向量空间与矩阵(秩、内积与范数)。
17
+ - Ch 3 变换:特征值/特征向量、正交投影、二次型 §3.4、矩阵范数 §3.5。
18
+ - Ch 4 几何:超平面、**凸集 §4.3**、多胞形与多面体。
19
+ - Ch 5 微积分:导数矩阵 §5.3、**水平集与梯度 §5.5**、Taylor 级数 §5.6。
20
+ - **Part II — 无约束优化(Ch 6–14)**
21
+ - Ch 6 局部极小的一阶/二阶必要与充分条件。
22
+ - Ch 7 一维搜索:黄金分割、Fibonacci、二分、Newton、割线、线搜索。
23
+ - **Ch 8 梯度法**(最速下降 §8.2、收敛分析 §8.3)。
24
+ - **Ch 9 Newton 法**(Levenberg–Marquardt §9.3、非线性最小二乘)。
25
+ - Ch 10 共轭方向/共轭梯度;**Ch 11 拟牛顿**(逆 Hessian 近似、DFP §11.4、**BFGS §11.5**)。
26
+ - Ch 12 解线性方程(最小二乘、RLS、Kaczmarz、最小范数解)。
27
+ - **Ch 13 神经网络与反向传播**(单神经元训练 §13.2、Backprop §13.3)。
28
+ - Ch 14 全局搜索:Nelder–Mead、模拟退火、PSO、遗传算法。
29
+ - **Part III — 线性规划(Ch 15–19)**
30
+ - Ch 15 LP 基础与几何;Ch 16 单纯形法。
31
+ - **Ch 17 LP 对偶**(对偶 LP、矩阵博弈)。
32
+ - Ch 18 非单纯形/内点法(Khachiyan、仿射尺度、Karmarkar);Ch 19 整数规划。
33
+ - **Part IV — 非线性约束优化(Ch 20–25)**
34
+ - Ch 20 等式约束:切空间/法空间 §20.3、**Lagrange 条件 §20.4**、二阶条件。
35
+ - **Ch 21 不等式约束与 KKT**(KKT §21.1、二阶条件 §21.2)。
36
+ - **Ch 22 凸优化**(凸函数 §22.2、凸问题 §22.3、SDP/LMI §22.4)。
37
+ - **Ch 23 Lagrange 对偶**(弱/强对偶、对偶间隙 §23.4.6、Slater §23.6.3、鞍点)。
38
+ - Ch 24 约束算法(投影 §24.2、**投影梯度 §24.3**、Armijo §24.4.4、增广 Lagrange §24.5、惩罚法 §24.6)。
39
+ - Ch 25 多目标 / 鲁棒 LP(Pareto、不确定性)。
40
+ - **Part V — ML 中的优化(Ch 26–31)**
41
+ - Ch 26 特征工程、PCA、SVD、线性自编码器。
42
+ - **Ch 27 SGD 算法**(SGD §27.1、方差缩减 **SVRG §27.2**、**分布式 SVRG 与通信/计算权衡 §27.3**)。
43
+ - Ch 28 线性回归(正则化 §28.3、交叉验证);Ch 29 逻辑回归 / Softmax。
44
+ - **Ch 30 SVM**(hinge loss、硬/软间隔);**Ch 31 核技巧与 K-Means**。
45
+
46
+ ## 可迁移到 AI/Infra 的核心结构
47
+
48
+ - **一阶最优性 + 梯度几何(Ch 6, §5.5)**
49
+ - 梯度 ⊥ 水平集、是最速上升方向——所有训练优化器的公理根。
50
+ - `∇f = 0` 是停机判据;鞍点 / 非凸是现代深度学习的核心痛点。
51
+ - **收敛性分析框架(Ch 8 §8.3)**
52
+ - 用条件数 κ = λ_max/λ_min 刻画最速下降的收敛速率。
53
+ - 解释"为什么病态网络难训、为什么要归一化 / 预条件"。
54
+ - **二阶曲率与阻尼(Ch 9)**
55
+ - Newton 用 Hessian 给出仿射不变的步长与方向。
56
+ - Levenberg–Marquardt 的 `(H+μI)` 阻尼 = 信赖域思想,是 Adam 的 `ε`、二阶优化器的祖先。
57
+ - **拟牛顿低秩更新(Ch 11)**
58
+ - BFGS/DFP 只用梯度差,以 rank-1/rank-2 更新维护逆 Hessian 近似。
59
+ - 是 L-BFGS、K-FAC、Shampoo 的直接思想源。
60
+ - **无矩阵二阶(Ch 10)**
61
+ - 共轭梯度只需 Hessian-向量积,不存全 Hessian;对应 autodiff 的 HVP(Hessian-free)。
62
+ - **约束几何(Ch 20–21, 24)**
63
+ - 切/法空间 → Lagrange/KKT → 投影梯度 + 惩罚 / 增广 Lagrange。
64
+ - 构成"带约束训练"的完整工具链。
65
+ - **对偶与鞍点(Ch 17, 23)**
66
+ - 强对偶 ⇔ minimax = maximin;KKT、互补松弛、Slater 条件。
67
+ - min-max 训练(GAN / 对抗鲁棒)、SVM 对偶都落在这里。
68
+ - **随机与分布式(Ch 27)**
69
+ - SGD 的无偏梯度估计、SVRG 方差缩减。
70
+ - **分布式下"通信 vs 计算"的显式权衡**——数据并行训练的理论根。
71
+ - **低秩 / 谱(Ch 26, §3.4)**
72
+ - SVD/PCA/线性自编码器、二次型与谱——LoRA、KV 压缩、谱归一化的数学底座。
73
+
74
+ ## 适合激活的问题类型
75
+
76
+ - 选型 / 设计优化器,或解释训练动力学(为什么发散、震荡、停滞在鞍点)。
77
+ - 诊断病态与慢收敛:用条件数 κ 把"难训"量化。
78
+ - 带约束训练:权重范数球、谱范数、安全 / 预算约束,需要投影或惩罚。
79
+ - min-max / 对抗 / 对偶视角:把难解 primal 换成易解 dual(如核 Gram 矩阵)。
80
+ - 分布式训练的通信-计算权衡、梯度压缩、方差缩减。
81
+ - 需要二阶信息却不能算全 Hessian 的场景(曲率自适应预条件)。
82
+
83
+ ## 可能的算法启发
84
+
85
+ - **自适应优化器**
86
+ - Levenberg–Marquardt 的 `(H+μI)` 阻尼 → Adam 的 `ε`、信赖域、自适应学习率。
87
+ - 把"曲率 / 阻尼"显式化,而非停留在纯启发式调参。
88
+ - **大模型可行的二阶**
89
+ - L-BFGS:只存最近 m 步梯度对(低秩历史,显存 O(md))。
90
+ - Hessian-free:autodiff 的 HVP + CG(matrix-free,无需物化 Hessian)。
91
+ - K-FAC / Shampoo:把 Hessian 近似成**块对角 / Kronecker 因子**,每块退化为小 GEMM。
92
+ - **对偶视角高效求解**
93
+ - SVM 把高维 primal 转成只依赖核 Gram 矩阵的对偶(Ch 30–31),样本数 ≪ 维度时大赚。
94
+ - 约束问题的对偶分解天然可并行。
95
+ - **约束训练**
96
+ - 投影梯度(§24.3)做 norm-ball / spectral-norm 约束(weight clipping、谱归一化)。
97
+ - 增广 Lagrange / 惩罚法(§24.5–24.6)把硬约束软化成可微正则。
98
+ - **方差缩减 / 大 batch**
99
+ - SVRG(§27.2)的控制变量思想 → 梯度累积、大 batch 训练的稳定性分析。
100
+ - **分布式**
101
+ - §27.3「通信 vs 计算」直接对应 all-reduce 与计算的 overlap、梯度压缩、联邦 / 数据安全。
102
+
103
+ ## GPU 友好性警告
104
+
105
+ > 以下逐项对照 `../gpu-friendly-math.md` 的**八维记分卡**(先读它)。
106
+ > 结论:本书的一阶 / 随机 / 低秩部分天然友好;二阶法与搜索类方法需重度改造或淘汰。
107
+
108
+ - **二阶法的全 Hessian(Ch 9, 11)**
109
+ - 违反**维度 4(显存)**:稠密 Hessian 是 O(d²),亿级参数无法物化。
110
+ - 违反**维度 2(GEMM 可映射)**:求逆 / 分解非 batched-GEMM 友好。
111
+ - 违反**维度 5(低精度稳定)**:病态求逆在 bf16/fp16 灾难性抵消。
112
+ - 改造:matrix-free HVP + CG、L-BFGS 低秩、K-FAC 块对角 → 重回**维度 2/4** 友好。
113
+ - **线搜索(Ch 7 黄金分割 / Armijo §24.4.4)**
114
+ - 违反**维度 1(张量化)**:本质是标量循环 + 数据相关分支(逐步比较函数值)。
115
+ - 违反**维度 8(算子融合)**:频繁小 kernel、控制流发散。
116
+ - 改造:大模型几乎都用调度式步长(warmup + cosine)替代逐步线搜索。
117
+ - **一阶 / SGD(Ch 8, 27)**
118
+ - **维度 1/2 友好**:梯度 = 张量代数、可写成 GEMM。
119
+ - **维度 6(并行与通信)**良好:数据并行 all-reduce 可与反向 overlap——大模型默认路线的根本原因。
120
+ - **全局搜索(Ch 14:GA/SA/PSO)**
121
+ - 违反**维度 1**:不可微、离散随机搜索,阻断端到端梯度训练。
122
+ - **维度 6** 也差:种群间依赖、难并行映射。仅适合黑盒超参搜索,不进训练内环。
123
+ - **LP 单纯形 / 内点法(Ch 16, 18)**
124
+ - 单纯形的行运算尚可;内点法每步要解线性系统,**维度 2/6** 受限于分解与通信。
125
+ - 适合中等规模约束子问题,不适合放进每个训练 step。
126
+ - **投影(§24.2)**
127
+ - norm-ball / box 投影是廉价 elementwise(**维度 1/8** 友好)。
128
+ - 一般多面体投影要解 QP(**维度 2** 退化)。
129
+ - **收敛依赖条件数 κ**
130
+ - κ 大 → **维度 5** 在低精度下被进一步放大(病态梯度)。
131
+ - 必须配归一化 / 预条件,否则 bf16 训练发散。
132
+
133
+ ## 该调用哪个思想武器
134
+
135
+ - **optimization**(主):目标-约束-最优性-收敛的完整框架,本书是其核心出处。
136
+ - **algorithmic-thinking**:迭代算法的收敛性、复杂度、步长 / 停机判据。
137
+ - **transformation**:对偶、核技巧、变量替换、SVD/PCA——"等价转换简化问题"。
138
+ - **modeling**:把现实任务(分类 / 回归 / 约束)翻译成可解的优化问题。
139
+ - **probability-statistics**:SGD 随机梯度、SVRG 方差缩减、交叉验证 / 正则化。
140
+
141
+ ## 反模式
142
+
143
+ - 把**全 Hessian Newton** 直接上大模型——O(d²) 显存与求逆当场爆炸(必须 matrix-free / 低秩 / 块对角)。
144
+ - 在大模型每步用**线搜索**调步长——标量串行、控制流发散,吃光算力;应改调度式学习率。
145
+ - 用 **GA/SA/PSO 训练神经网络**——不可微、无法并行、样本效率极低;仅限黑盒超参搜索。
146
+ - 谈收敛却**忽略条件数 κ**——不归一化 / 不预条件就期望低精度收敛是幻觉。
147
+ - 把 **LP 单纯形思维**硬套连续可微问题。
148
+ - 把**对偶 / KKT 当万能**——非凸通常无强对偶、存在对偶间隙(§23.4.6),KKT 只是必要条件。
149
+ - 把这份「激活参考」当严格证明来源——细节与定理条件必须回查原书。
150
+
151
+ ## 深挖入口
152
+
153
+ > **📖 书目信息**:Edwin K. P. Chong, Wu-Sheng Lu, Stanisław H. Żak, *An Introduction to Optimization, With Applications to Machine Learning*, 5th Edition, John Wiley & Sons, 2024. ISBN 978-1-119-87763-9.
154
+ >
155
+ > **启用方式**:将 `An Introduction to Optimization With Applications to Machine Learning.pdf` 放入项目根目录的 `math_book/` 文件夹,Agent 即可自动搜索原文。PDF 不随 npm/git 分发(版权原因),需自行获取。
156
+
157
+ 全保真回查 = 让 Agent 直接搜索本地 PDF
158
+ `math_book/An Introduction to Optimization With Applications to Machine Learning.pdf`,按真实章号定位:
159
+
160
+ - **Ch 8 Gradient Methods**(§8.3 收敛分析、条件数)+ **Ch 11 Quasi-Newton Methods**(§11.5 BFGS)——优化器与可行二阶。
161
+ - **Ch 22 Convex Optimization Problems**(§22.2 凸函数、§22.4 SDP/LMI)——凸性判据与半定规划。
162
+ - **Ch 23 Lagrangian Duality**(§23.5 强对偶、§23.6.3 Slater 条件)+ **Ch 21 KKT Condition**——对偶 / KKT / 鞍点。
163
+ - **Ch 24 Algorithms for Constrained Optimization**(§24.3 投影梯度、§24.5 增广 Lagrange、§24.6 惩罚法)——约束训练算法。
164
+ - **Ch 27 Stochastic Gradient Descent Algorithms**(§27.1 SGD、§27.2 SVRG、§27.3 分布式与通信 / 计算)——大规模训练核心。
@@ -0,0 +1,105 @@
1
+ # 🌐 光滑流形 / Smooth Manifolds
2
+
3
+ > **书目**:John M. Lee, *Introduction to Smooth Manifolds*, 2nd Edition. Graduate Texts in Mathematics 218, Springer, 2013. ISBN 978-1-4419-9981-8 / DOI 10.1007/978-1-4419-9982-5. MSC 53-01 / 58-01 / 57-01.
4
+ > **定位**:把"局部像欧氏空间、整体可弯曲"的对象(manifold)配上微积分(切空间、向量场、微分形式、流、李导数),是 **流形优化、隐空间几何、可微结构** 的数学母体。
5
+
6
+ ## 概要
7
+
8
+ 光滑流形 = 局部能用坐标卡(chart)线性化、卡与卡之间用光滑转移映射(transition map)粘合的空间。全书主线:**先把欧氏微积分搬到弯曲空间上,再研究其上的几何与拓扑不变量**。对 AI 最值钱的是前半部分那套"可微机器"——切/余切空间、向量场、流、黎曼度量。
9
+
10
+ 真实章节地图(2nd ed.,章号与本书一致):
11
+
12
+ - **Ch 1–2 Smooth Manifolds / Smooth Maps**:拓扑流形、光滑结构(atlas)、光滑映射、单位分解(partition of unity)。→ 局部线性化 + 全局拼接的语言。
13
+ - **Ch 3 Tangent Vectors**:切空间 T_pM、微分(differential / pushforward)df_p、切丛 TM。→ **局部线性化的核心**,反向传播的几何原型。
14
+ - **Ch 4–5 Submersions, Immersions, Embeddings / Submanifolds**:常秩定理、嵌入、正则水平集 → 子流形。→ 约束集 = 子流形。
15
+ - **Ch 6 Sard's Theorem**:临界值测度为零、Whitney 嵌入定理(n 维流形可嵌入 R^{2n})。→ 嵌入维数 / 流形假设。
16
+ - **Ch 7 Lie Groups**:既是群又是流形(SO(n), U(n), GL(n), Stiefel…),李代数 = 单位元处切空间。→ 正交/酉权重约束、等变。
17
+ - **Ch 8–9 Vector Fields / Integral Curves and Flows**:向量场、积分曲线、流(flow,单参数微分同胚群)、李导数与李括号 [X,Y]。→ **Neural ODE / 扩散 / 连续归一化流** 的母结构。
18
+ - **Ch 10–12 Vector Bundles / Cotangent Bundle / Tensors**:丛、余向量场(1-form)、拉回(pullback)、张量。→ 梯度的真身是余向量。
19
+ - **Ch 13 Riemannian Metrics**:每点内积、长度/距离/体积、切-余切同构(musical ♯/♭,升降指标)。→ **自然梯度 / 黎曼优化的度量来源**。
20
+ - **Ch 14–16 Differential Forms / Orientations / Integration**:k-形式、楔积、外微分 d(d²=0)、定向、体积形式、流形上积分与变量替换。→ 归一化流的 log-det-Jacobian = 体积形式拉回。
21
+ - **Ch 17–18 De Rham Cohomology / de Rham Theorem**:闭形式模去恰当形式 = 从微分数据读出的拓扑不变量。→ 全局障碍 / 上同调正则。
22
+ - **Ch 19–22 Distributions & Foliations / Exponential Map / Quotient Manifolds / Symplectic Manifolds**:可积分布(Frobenius)、指数映射(retraction 原型)、商流形(Grassmann 等)、辛形式与 Hamilton 流。→ retraction、商空间约束、辛积分器 / HMC。
23
+
24
+ **作者明示的边界(preface)**:本书止步于"建立工具",**刻意不讲** connection、geodesic、curvature、纤维丛、Hodge 理论——这些在 Lee 的 *Riemannian Manifolds* 续作里。所以若问题真正需要曲率/平行移动的深层几何,本书只给到度量与指数映射的入口,需另取黎曼几何书续接。
25
+
26
+ ## 可迁移到 AI/Infra 的核心结构
27
+
28
+ - **切空间 = 参数/隐空间的局部线性化(local linearization)**。`df_p: T_pM → T_{f(p)}N` 就是 Jacobian / pushforward;反向传播 = 沿复合映射做 pushforward(链式法则的几何版)。一切一阶方法都活在切空间里。
29
+ - **梯度是余向量(covector),不是向量**。autodiff 给出的是 1-form(余切空间元素);要变成可下降的方向(切向量)必须用 **度量升指标**(♯)。欧氏度量 → 普通梯度;Fisher 度量 → 自然梯度(natural gradient)。**这是自然梯度 / 镜像下降的流形根因**。
30
+ - **约束集 = 子流形(submanifold)**。正则水平集定理:当 g 是 submersion 时 `g(x)=c` 的解集是光滑子流形;约束优化 = 在子流形上做无约束优化。
31
+ - **李群 = 可微的对称群**。SO(n)/U(n)/Stiefel/Grassmann 都是流形;其李代数(如反对称矩阵 so(n))是线性空间,用 `exp` 映射回群 → **把"约束权重"重参数化为"无约束李代数 + exp"**。
32
+ - **流(flow)= 时间参数化的微分同胚族**。学一个向量场 + 沿它积分 = Neural ODE / 连续归一化流 / 扩散采样。流的可逆性、保体积性直接对应模型性质。
33
+ - **黎曼度量 = 可设计/可学习的"局部几何"**。它决定距离、夹角、体积、谁与谁正交;改度量就改了优化轨迹与采样测度。
34
+ - **微分形式 + 体积形式 = 变量替换的语言**。归一化流里的 `log|det J|` 项就是体积形式在映射下的拉回;选对结构(三角/耦合 Jacobian)能让它廉价。
35
+
36
+ ## 适合激活的问题类型
37
+
38
+ - 参数本应满足 **几何约束**:正交、单位范数、单位行列式、SPD、低秩流形、双曲/球面隐空间。
39
+ - 优化在 **弯曲空间** 上更自然:Stiefel/Grassmann 上的子空间学习、旋转/姿态估计、超球面表征。
40
+ - 需要 **保结构动力学**:可逆生成模型、保体积流、Hamilton 系统、能量守恒的长程模拟。
41
+ - **隐空间几何**:插值、测地线、度量学习、流形上的聚类/最近邻。
42
+ - 需要从相关性升级到 **拓扑不变量**:检测隐空间的"洞"、全局障碍、用上同调做一致性正则。
43
+
44
+ ## 可能的算法启发
45
+
46
+ - **黎曼/流形优化器(Riemannian optimizers)**:把 Adam/SGD 搬到 Stiefel、Grassmann、SPD、双曲空间——梯度投影到切空间 + retraction 回流形。
47
+ - **正交/Stiefel 约束权重**:用 Cayley 变换或 QR-retraction 维持 `WᵀW=I`,缓解 RNN/深网的梯度爆炸/消失;或用 so(n) 李代数 + matrix-exp 重参数化旋转。
48
+ - **测地线插值(geodesic interpolation)**:在球面/双曲/SPD 隐空间用闭式测地线做插值与混合,替代欧氏线性插值。
49
+ - **流形上的归一化**:把 LayerNorm/特征归一化理解为投影到球面/单位流形;超球面 softmax、谱归一化都是此类。
50
+ - **Neural ODE / 连续归一化流 / 扩散**:学向量场 X_θ,用流求解;结构化 Jacobian 让 `log-det` 廉价。
51
+ - **辛积分器(symplectic integrator)/ HMC**:用 leapfrog 这种保辛、保体积的显式更新做采样与"带动量的优化",长程稳定。
52
+ - **等变网络(equivariant nets)**:用李群作用 + 商流形把对称性写进结构(geometric deep learning)。
53
+
54
+ ## GPU 友好性警告
55
+
56
+ > 验收门唯一权威:`../gpu-friendly-math.md` 的 **八维**。流形方法的成败几乎全卡在一个点上:**retraction / 指数映射能不能张量化并 GEMM 化,还是必须迭代求解。**
57
+
58
+ 逐维对照:
59
+
60
+ - **维度 1–2 张量化 / GEMM**:切空间运算(pushforward/pullback、Jacobian-向量积、把梯度投影到切空间)**天然是 batched GEMM** ✅——反向传播本就是 pushforward,这部分对 GPU 极友好。**但** retraction/exp 多半要 QR、特征分解、矩阵指数或小矩阵求逆:QR/eig **不是干净的 GEMM**,是带串行依赖的分解(cuSOLVER 批量小矩阵尚可,大矩阵 O(n³) 且并行差)→ **可改造** 而非天然友好。
61
+ - **维度 3 复杂度**:测地线距离、平行移动、一般 `log|det J|` 都是 O(n³) 起。**改造**:限定有闭式测地线的流形(球面/双曲/SO(3));归一化流用三角/耦合层让 log-det 退化成对角和(O(n))。
62
+ - **维度 5 低精度**:⚠️ **最大坑**。矩阵 `exp / log / sqrt`、特征分解、SPD 的仿射不变度量在 bf16/fp16 下 **灾难性不稳定**,常静默地需要 fp32/fp64。流形原语经常"表面能跑、数值早已发散"。
63
+ - **维度 6 并行与通信**:scaling-and-squaring 的平方链、ODE 积分步、Householder/QR 都有 **串行递推**,难跨 SM/设备 overlap。反例向好:显式辛积分器(leapfrog)高并行 ✅。
64
+ - **维度 4/7/8 显存 / 稀疏 / 融合**:李代数/旋转参数化若限制在 **小矩阵或块对角**(如逐头旋转、SO(3) 的 Rodrigues 闭式),可融进 kernel、走 Tensor Core;大稠密流形算子则要物化大中间张量。
65
+
66
+ **结论与改造手法(呼应 gpu-friendly-math.md 工具箱)**:
67
+
68
+ 1. **优先选有闭式 retraction 的流形**(球面、Stiefel-QR、SO(3)、双曲)。
69
+ 2. **能软化就软化**:把硬约束换成纯 GEMM 的正则项(如 `λ‖WᵀW−I‖²` 替代严格正交流形)——多数训练这就够。
70
+ 3. **小矩阵 / 块化**:把 exp/Cayley/QR 限制在小块或逐头,批量化为 batched GEMM。
71
+ 4. **结构化 Jacobian**:归一化流坚持三角/耦合结构,杜绝通用 LU 求 det。
72
+ 5. **精度护栏**:凡矩阵 exp/log/eig,强制 fp32 累加并做数值稳定(log-sum-exp 式)。
73
+
74
+ ## 该调用哪个思想武器
75
+
76
+ - **optimization(⚖️ 优化思想)**:主武器——约束下寻最优、黎曼/流形优化、retraction 选型。
77
+ - **symmetry-invariance(⚛️ 对称与不变性)**:李群、等变、商流形、群作用下的不变量。
78
+ - **transformation(🔄 变换思想)**:坐标卡变换、pushforward/pullback、归一化流的变量替换、微分同胚。
79
+ - **topological-thinking(🌀 拓扑思想)**:de Rham 上同调、全局障碍、隐空间的"洞"与连通性。
80
+ - **abstraction(🧩 抽象化思想)**:从高维杂乱的环境数据中抽出"局部线性 + 光滑拼接"的流形骨架(流形假设)。
81
+
82
+ ## 反模式
83
+
84
+ - **把 ML 的 "tensor"(数组)当数学 tensor(多线性、有协变/逆变变换律)**,误以为自动获得坐标无关的不变性。
85
+ - **把 exp / 测地线 / matrix-log 放进 bf16 热训练循环**:既慢(串行分解)又静默发散。先问"有没有闭式 retraction / 能不能软化"。
86
+ - **该软不软**:用严格流形约束换来微小收益,却付出 QR/eig 的吞吐与稳定性代价;很多任务一个正交正则项就够。
87
+ - **混淆梯度(余向量)与下降方向(向量)**:忘了度量、把 raw autodiff 输出直接当自然梯度。
88
+ - **单一全局坐标卡的幻觉**:用一套全局参数化覆盖整个流形必有奇点(如欧拉角的 gimbal lock);流形本质需要 atlas / 冗余参数化。
89
+ - **流形假设滥用**:参数空间本是平坦欧氏时硬套黎曼机器,纯属过度工程(违反 simplicity-first)。
90
+
91
+ ## 深挖入口
92
+
93
+ > **📖 书目信息**:John M. Lee, *Introduction to Smooth Manifolds*, 2nd Edition, Graduate Texts in Mathematics 218, Springer, 2013. ISBN 978-1-4419-9981-8.
94
+ >
95
+ > **启用方式**:将 `Introduction to Smooth Manifolds.pdf` 放入项目根目录的 `math_book/` 文件夹,Agent 即可自动搜索原文。PDF 不随 npm/git 分发(版权原因),需自行获取。
96
+
97
+ > **全保真回查**:需要原文定义/定理/证明时,让 Agent **自动搜索本地 PDF** `math_book/Introduction to Smooth Manifolds.pdf`(按章号/关键词定位,勿凭记忆复述)。下列为真实章号(2nd ed.):
98
+
99
+ - **Ch 3 Tangent Vectors** — 切空间、微分/pushforward、切丛:局部线性化与反传的几何原型。
100
+ - **Ch 11 The Cotangent Bundle** — 余向量场(1-form)、`df` 作为余向量、pullback:梯度真身 = 余向量。
101
+ - **Ch 13 Riemannian Metrics** — 度量、切-余切同构(♯/♭)、距离:自然梯度 / 黎曼优化的根。
102
+ - **Ch 9 Integral Curves and Flows** — 流、积分曲线、李导数/李括号:Neural ODE / 扩散 / 保结构动力学。
103
+ - **Ch 20 The Exponential Map** — 指数映射:retraction 原型,也是 GPU 可行性的主瓶颈。
104
+
105
+ (延伸:Ch 7 Lie Groups → 正交/酉约束与等变;Ch 14 Differential Forms → 体积形式与 log-det-Jacobian;Ch 22 Symplectic Manifolds → 辛积分器 / HMC。)