math-skill 1.0.0 → 2.0.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (50) hide show
  1. package/README.en-US.md +280 -0
  2. package/README.md +280 -278
  3. package/agents/math-critic.md +235 -203
  4. package/commands/abstraction.md +13 -34
  5. package/commands/algorithmic-thinking.md +13 -34
  6. package/commands/ask.md +20 -21
  7. package/commands/axiomatization.md +13 -34
  8. package/commands/causal-inference.md +13 -34
  9. package/commands/discrete-combinatorial.md +13 -34
  10. package/commands/game-theory.md +13 -34
  11. package/commands/induction-analogy.md +13 -34
  12. package/commands/information-theory.md +13 -34
  13. package/commands/logic-deduction.md +13 -34
  14. package/commands/modeling.md +13 -37
  15. package/commands/optimization.md +13 -33
  16. package/commands/probability-statistics.md +13 -36
  17. package/commands/symmetry-invariance.md +13 -34
  18. package/commands/topological-thinking.md +13 -33
  19. package/commands/transformation.md +13 -33
  20. package/knowledge-base/overview.md +228 -230
  21. package/package.json +71 -59
  22. package/references/agentic-workflow.md +53 -0
  23. package/references/books/abstract-algebra.md +120 -0
  24. package/references/books/algebraic-geometry-rising-sea.md +167 -0
  25. package/references/books/differential-geometry.md +136 -0
  26. package/references/books/matrix-analysis.md +142 -0
  27. package/references/books/micro-lie-theory.md +112 -0
  28. package/references/books/optimization-ml.md +160 -0
  29. package/references/books/smooth-manifolds.md +101 -0
  30. package/references/gpu-friendly-math.md +65 -0
  31. package/skills/abstraction/SKILL.md +119 -264
  32. package/skills/algorithmic-thinking/SKILL.md +136 -371
  33. package/skills/axiomatization/SKILL.md +149 -213
  34. package/skills/causal-inference/SKILL.md +149 -374
  35. package/skills/discrete-combinatorial/SKILL.md +129 -286
  36. package/skills/game-theory/SKILL.md +121 -318
  37. package/skills/induction-analogy/SKILL.md +150 -310
  38. package/skills/information-theory/SKILL.md +138 -242
  39. package/skills/logic-deduction/SKILL.md +133 -280
  40. package/skills/math-research-activator/SKILL.md +134 -0
  41. package/skills/{meta-selector → math-research-activator}/original-texts.md +104 -104
  42. package/skills/modeling/SKILL.md +137 -318
  43. package/skills/optimization/SKILL.md +133 -292
  44. package/skills/probability-statistics/SKILL.md +149 -312
  45. package/skills/symmetry-invariance/SKILL.md +137 -358
  46. package/skills/topological-thinking/SKILL.md +126 -273
  47. package/skills/transformation/SKILL.md +122 -264
  48. package/docs/CLAUDE.md +0 -187
  49. package/skills/meta-selector/SKILL.md +0 -188
  50. /package/{docs → references}/inspiration.md +0 -0
@@ -0,0 +1,120 @@
1
+ # 🔢 抽象代数 / Abstract Algebra
2
+
3
+ > **Contemporary Abstract Algebra**, Eighth Edition · Joseph A. Gallian · Brooks/Cole, Cengage Learning.
4
+ > 本文件是「激活」参考:把书里的群/环/域结构映射到 ML/算法/Infra,不复述原文。全保真回查见文末「深挖入口」。
5
+
6
+ ## 概要
7
+
8
+ 本书是标准本科抽象代数教材,主线三段:**群 → 环 → 域**,从公理出发,重点讲**对称、结构守恒的映射(同态/同构)、商结构、有限对象的分类与计数**。对 AI 的价值不在定理本身,而在它给出的**「在某种变换下保持不变」的语言**——这正是等变网络、置换不变聚合、编码与哈希的代数底座。
9
+
10
+ 一句话激活观点:**对称性是一种免费的归纳偏置(inductive bias)**。与其让模型从数据里硬学"旋转后还是同一只猫",不如把对称群 G 的作用直接编进网络结构,让参数沿轨道共享——既省参数又给出泛化保证。群(变换本身)→ 环(带两种运算的代数,松弛后给出广义矩阵乘)→ 域(算术封闭且精确,给出编码与哈希)这条主线,恰好覆盖了"等变 / 广义 GEMM / 容错计算"三类 Infra 需求。
11
+
12
+ **本书的边界(避免误用)**:Gallian 是初等本科教材,**只讲环、不讲半环**(热带半环要自行做公理松弛);表示论只到有限阿贝尔群的层面,**不展开非阿贝尔表示论与字符理论**;不涉及范畴论、模、同调代数。需要这些更现代的工具时,本书只作"激活起点",深入要转到表示论/代数几何专著。
13
+
14
+ 真实章节地图(按主题归并,章号取自本书目录):
15
+
16
+ - **群的基础**:1 Introduction to Groups(二面体群 Dₙ 即对称群范例)、2 Groups、3 Finite Groups; Subgroups、4 Cyclic Groups。
17
+ - **对称与作用**:5 Permutation Groups(轨道 orbit / 稳定子 stabilizer)、6 Isomorphisms、7 Cosets and Lagrange's Theorem、8 External Direct Products。
18
+ - **商与同态**:9 Normal Subgroups and Factor Groups、10 Group Homomorphisms、11 Fundamental Theorem of Finite Abelian Groups。
19
+ - **环**:12 Introduction to Rings、13 Integral Domains、14 Ideals and Factor Rings、15 Ring Homomorphisms、16 Polynomial Rings、17 Factorization of Polynomials、18 Divisibility in Integral Domains。
20
+ - **域与扩张**:19 Vector Spaces、20 Extension Fields、21 Algebraic Extensions、**22 Finite Fields**、23 Geometric Constructions。
21
+ - **进阶群论**:24 Sylow Theorems、25 Finite Simple Groups、26 Generators and Relations。
22
+ - **对称的应用**:27 Symmetry Groups、28 Frieze and Crystallographic Groups、**29 Symmetry and Counting**(Burnside 计数)、30 Cayley Digraphs of Groups。
23
+ - **编码与 Galois**:**31 Introduction to Algebraic Coding Theory**(Hamming 码、有限域上的线性码)、**32 An Introduction to Galois Theory**、33 Cyclotomic Extensions。
24
+
25
+ ## 可迁移到 AI/Infra 的核心结构
26
+
27
+ | 代数结构(章号) | 一句话本质 | ML/Infra 对应 |
28
+ |---|---|---|
29
+ | **群作用 group action**(5, 29)| G 作用在输入空间上,轨道-稳定子定理 \|orbit\|=\|G\|/\|stab\| | 等变层 + **权重共享**:参数在一条轨道上复用 |
30
+ | **同态 homomorphism**(10, 15)| 保运算的映射 φ(ab)=φ(a)φ(b) | **表示 representation** = 同态 G→GL(V)(书中即 GL(2,F));可学习线性作用 |
31
+ | **商/因子结构 quotient**(9, 14)| 对正规子群/理想取商 = "遗忘"一个对称方向 | 池化 / 粗化 / 等变下采样:对 Sₙ 取商 = 置换不变聚合 |
32
+ | **循环 & 有限阿贝尔群**(4, 11)| Zₙ 的周期结构,任意有限阿贝尔群 ≅ 循环群直积 | DFT/FFT、循环卷积、RoPE(SO(2)/循环旋转的表示)|
33
+ | **环 ring**(12–14)→ 放松公理 | 去掉加法逆元公理 → **半环 semiring**(书本身只讲环,半环是公理松弛)| 广义矩阵乘:把 (×,+) 换成 (+, min/max) 的 **min-plus / 热带半环 tropical semiring** GEMM |
34
+ | **有限域 GF(pⁿ)**(22, 16, 17)| 元素有限、算术封闭精确的域 | 纠错码、哈希/LSH、CRC、Shamir 秘密共享、量化码本 |
35
+ | **线性码 linear code**(31)| 有限域 F 上的 k 维子空间,生成矩阵 G、Hamming 距离/权重 | 鲁棒存储/通信、梯度压缩、容错训练、安全聚合 |
36
+
37
+ ### 三个最值得激活的映射(展开)
38
+
39
+ - **群作用 → 等变 + 权重共享**:轨道-稳定子定理 \|orbit\|=\|G\|/\|stab\|(5 章)正是"权重共享"的代数解释——同一轨道上的输入共用一组参数,独立参数量按群阶被压缩 \|G\| 倍。等变约束 f(g·x)=ρ(g)·f(x) 串起一族真实模型:CNN(平移群)、Group Equivariant CNN(Dₙ 旋转/镜像 steerable filter)、DeepSets / Set Transformer(Sₙ 置换不变)、E(3)-等变 GNN(刚体群,分子/点云)。
40
+ - **环公理松弛 → 半环 → 广义 GEMM**:本书 12–14 章给出环的两条运算 (+,×) 与公理;**去掉加法逆元**(即不再要求减法可逆)就得到半环。把通用矩阵乘 C=A⊗B 里的 (×,+) 抽象成任意半环 (⊙,⊕),一套代码即可同时表达标准 GEMM、布尔可达性 (∧,∨)、最短路/Viterbi/DTW (+, min)。这是把"动态规划"装进矩阵乘的统一视角。
41
+ - **有限域 → 精确可重放算术**:GF(pⁿ)(22 章,由多项式环模不可约多项式构造,见 16–17 章)的算术封闭且**无浮点误差**,天然适合需要可重放、可验证、可纠错的场景:Reed-Solomon / Hamming 纠错码(31 章)、Shamir 秘密共享(GF(p) 多项式插值)、一致性哈希与 LSH。
42
+
43
+ ## 适合激活的问题类型
44
+
45
+ - 输入带**明确对称性**:平移、旋转、镜像(Dₙ)、置换(Sₙ)、周期(Zₙ)——想要等变/不变而非靠数据增强硬学。
46
+ - 需要**硬选择/离散路由**但要端到端可微(Top-K、最短路、对齐)——可用半环松弛。
47
+ - 需要**鲁棒压缩/通信/存储**:KV-Cache、梯度、checkpoint 的容错与压缩。
48
+ - 需要把**周期/循环结构**嵌进位置编码或 token 混合。
49
+ - 需要把一条**约束/守恒律**写成可学习的线性映射,天然落到 GEMM。
50
+
51
+ ## 可能的算法启发
52
+
53
+ 1. **群等变层 G-equivariant layer**(源:5, 6, 10):把对称群 G 的作用实现为置换/旋转矩阵 ρ(g),权重沿轨道共享,约束 f(g·x)=ρ(g)·f(x)。实现上对每个 g∈G 把输入用 ρ(g) 变换后过同一组权重,再聚合——相当于把卷积核扩成 [\|G\|, C_out, C_in] 的 batched GEMM,独立参数量 ↓\|G\| 倍。落地模型:CNN(平移)、G-CNN(Dₙ steerable filter)、DeepSets/Set Transformer(Sₙ)、E(3)-等变 GNN(点云/分子)。
54
+ 2. **热带 / min-plus 注意力与路由**(源:12–14 环公理松弛):把 softmax 的 (×,+)+exp 换成 (+, min/max) 的 min-plus matmul:score⊕=min_k(Q_ik+K_kj)。硬 Top-K 路由 → 热带半环**分段线性门控**(次可微——折点需 LogSumExp 软化,软化后退回标准 softmax;替代不可微的 argmax)。Viterbi、DTW、最短路本质都是这条 min-plus matmul——见 `../gpu-friendly-math.md` 的 Tropical Gating 范例(只在低维门控用、且**不上 Tensor Core**——max/min 落 CUDA core,主干仍走标准 (×,+) GEMM)。
55
+ 3. **置换不变聚合 permutation-invariant aggregation**(源:9, 29):对 Sₙ 作用取商即得 sum/max/mean pooling——天然 O(n) 且并行友好,是 DeepSets ρ(Σφ(xᵢ)) 与 GNN message passing 的代数基础。Burnside 计数(29)可在设计期估"本质不同的配置有多少",用于预测参数节省比与数据去重收益。
56
+ 4. **有限域编码做 Infra**(源:22, 31):线性码 c=mG(生成矩阵 G 在 GF(q) 上)做容错存储与梯度压缩,Hamming 距离给纠错能力下界;Shamir 秘密共享(GF(p) 多项式插值,t 个分片可恢复)做联邦学习安全聚合;有限域哈希/CRC 做去重与一致性校验。共性:纯 int/bitwise,放数据流前后处理。
57
+ 5. **循环群表示 → 频域 token mixing**(源:4, 11):Zₙ 的不可约表示即 DFT 基,催生 FFT 卷积(O(n log n) 取代 O(n²))、RoPE(把位置编成 SO(2) 旋转、即 Z 上的酉表示)、循环/相对位置编码。有限阿贝尔群分类定理(11)保证任意此类周期结构都可分解成循环分量做 FFT。
58
+ 6. **群上的傅里叶 / 谱方法**(源:10 同态 + 4/11):把表示论的不可约分解推广到一般有限群,得到群卷积定理——谱 GNN、球面 CNN(SO(3) 上的调和分析)即其特例;代价是非阿贝尔群的快速变换不一定存在,需评估复杂度。
59
+
60
+ ## GPU 友好性警告
61
+
62
+ > 八维标准与判分规则唯一来源:`../gpu-friendly-math.md`(张量化 / GEMM 可映射 / 复杂度 / 显存 / 低精度 / 并行 / 稀疏 / 算子融合)。此处只给本书结构的逐维裁决。
63
+
64
+ **焦点 A:半环 GEMM 能上 Tensor Core 吗?——默认不能。**
65
+
66
+ - **维度 2 GEMM 可映射(❌不友好)**:Tensor Core 硬件只做 (×,+) 的 MAC(fp16/bf16/fp8 累加到 fp32)。min-plus / max-plus 用的是 (+, min/max),**非原生**,朴素 tropical GEMM 退化到 CUDA core 标量比较,吃不到 Tensor Core。
67
+ - **维度 3 复杂度(❌)**:min-plus 矩阵乘没有 Strassen 式亚立方加速(等价于 APSP 难题),朴素 O(n³)。
68
+ - **维度 5 低精度(✅)**:tropical 用 max/min,无 exp 上溢,反而数值稳健。
69
+ - **维度 8 可微/融合(⚠️可改造)**:min/max 不可微,需松弛。
70
+ - **改造(→ 八维转友好)**:① log-sum-exp 软化 min/max 退回 (×,+) 稳定 softmax,重上 Tensor Core;② 把热带运算**只放在低维门控**,主干仍走标准 (×,+) GEMM(范例文件中 Tropical Gating = dim 1✅张量化 / 2❌非 Tensor Core GEMM / 3✅逐 token 门控亚二次,dim 8 需 LogSumExp 软化);③ 分块——块内标准 GEMM、块间 min-plus 归约。
71
+
72
+ **焦点 B:群操作能张量化吗?——小群能,大群和精确算术不能。**
73
+
74
+ - **有限群作用(维度 1/2 ✅)**:置换矩阵 / 稠密表示矩阵 → batched GEMM,G-CNN 已工程化。正交的旋转/置换矩阵在 bf16 下数值稳定(维度 5 ✅)。
75
+ - **大群枚举(维度 3/4 ❌)**:\|Sₙ\|=n! 爆炸,显式枚举群元素 → 显存与算力爆。**改造**:只用生成元(26 Generators and Relations)+ Cayley 图(30)做局部传播,不物化整群。
76
+ - **置换 = gather/scatter(维度 7/1/8 ❌)**:实现为不规则 gather/scatter 会 warp divergence。**改造**:固定置换模式预编译为结构化稀疏或 dense 索引。
77
+ - **有限域 / 模算术(维度 2 ❌、维度 1/6 ✅)**:mod p、GF(2ⁿ)、XOR、查表**不是浮点 MAC**,吃不到 Tensor Core,但在 int/bitwise kernel 上高并行。结论:**适合放编码/哈希的前后处理,绝不放进训练主干 GEMM**。Galois/精确域算术要求 int、不可微,违反维度 8。
78
+
79
+ **判分结论**:群等变(小群、稠密表示)与频域结构 = 数学美 × GPU 友好,可进主干;半环、有限域、精确 Galois = 需先松弛/隔离,否则只能当辅助算子或离线工具。
80
+
81
+ **范例对照(候选 × 八维裁决)**:
82
+
83
+ | 候选设计 | 代数来源(章) | 关键维度裁决 | 进主干? |
84
+ |---|---|---|---|
85
+ | 群等变层(小群 Dₙ/Sₙ,置换+旋转矩阵)| 5, 6, 10 | 1✅ 2✅ 5✅,群大时 3/4❌ | ✅(限小群/生成元)|
86
+ | 热带门控(低维 min-plus 取代硬 Top-K)| 12–14 松弛 | 1✅ 2✅ 8 需松弛,主干仍 (×,+) | ✅(仅门控)|
87
+ | 纯 min-plus 主干注意力 | 12–14 松弛 | 2❌ Tensor Core 不支持、3❌ O(n³) | ❌(先 log-sum-exp 软化)|
88
+ | 有限域编码压缩 KV/梯度 | 22, 31 | 2❌ 非浮点 MAC,1/6✅ int 并行 | ❌主干 / ✅前后处理 |
89
+ | 循环群表示(FFT/RoPE token mixing)| 4, 11 | 1✅ 2✅ 3✅(n log n)| ✅ |
90
+
91
+ ## 该调用哪个思想武器
92
+
93
+ - **主:`symmetry-invariance`(对称与不变性)**——群作用、等变/不变、轨道-稳定子是本书与 ML 的最大接口。
94
+ - **副:`abstraction`**——提取群/环/域的公共结构,看穿"不同模块其实是同一代数对象"。
95
+ - **副:`axiomatization`**——放松环公理得半环、逐条核对所设代数性质是否真成立(防伪对称)。
96
+ - **副:`transformation`**——同态/同构作等价转换、FFT/频域变换简化问题。
97
+ - **副:`discrete-combinatorial`**——有限群计数(Burnside, 29)、编码(31)、有限域枚举(22)。
98
+
99
+ 典型组合链:先 `symmetry-invariance` 识别问题里的群与不变量 → `abstraction` 抽出公共代数结构 → `axiomatization` 核对公理是否真成立(防伪对称、防误用减法)→ `transformation` 落成可学习线性映射 → 最后过 `../gpu-friendly-math.md` 八维门。
100
+
101
+ ## 反模式
102
+
103
+ - **把"群之美"硬塞进主干却吃不到 Tensor Core**:tropical / 有限域算术当 GEMM 用,实测全程 CUDA core 标量。
104
+ - **枚举整群**而非用生成元(\|Sₙ\|=n! / \|GL\| 爆显存)。
105
+ - **死磕精确 Galois / 有限域结构**:导致不可微、必须 int、阻断端到端梯度。
106
+ - **过度对称约束**:把"近似对称/伪对称"写成硬等变,扼杀表达力与模型探索(呼应 agentic-workflow 的"别把主观偏见写死")。
107
+ - **混淆环与半环**:默认有加法逆元做减法/求逆,到 min-plus 上不成立 → 正确性出错。
108
+ - **为"群之美"造一堆模块**:能用现成等变库/FFT 时不要新造 skill;先用足模型已有能力,再补结构(呼应 agentic-workflow "不要一来就造一堆 skill")。
109
+ - **把同态当同构**:同态可丢信息(有核 kernel),误当可逆双射会导致重构/解码错误。
110
+
111
+ ## 深挖入口
112
+
113
+ > **全保真回查 = Agent 自动搜索本地 PDF**:`math_book/Contemporary Abstract Algebra.pdf`。需要精确定义/定理/例子时,让 Agent 按下列真实章号定向略读,不要凭记忆;若安装环境没有 `math_book/`,停在本蒸馏稿层。
114
+
115
+ - **Ch 5 Permutation Groups**——轨道 orbit / 稳定子 stabilizer:等变权重共享的根。
116
+ - **Ch 22 Finite Fields**——GF(pⁿ) 构造与算术:编码/哈希/安全聚合的底座。
117
+ - **Ch 29 Symmetry and Counting**——Burnside 计数:估等价类数 / 参数节省。
118
+ - **Ch 31 Introduction to Algebraic Coding Theory**——Hamming 码、有限域上的线性码(生成矩阵、Hamming 距离/权重):压缩与容错。
119
+ - **Ch 32 An Introduction to Galois Theory**——域扩张的对称群:结构化变换的范例(落地需先过 GPU 门)。
120
+ - (半环松弛起点:Ch 12–14 环公理 → 去加法逆元 → 热带半环。)
@@ -0,0 +1,167 @@
1
+ # 🌊 代数几何(The Rising Sea)/ Algebraic Geometry
2
+
3
+ > 《The Rising Sea: Foundations of Algebraic Geometry》,Ravi Vakil 著,Princeton University Press,2025 年版(ISBN 978-0-691-26866-8)。
4
+ > 书名取自 Grothendieck 的"涨潮(la mer monte)"比喻:不正面强攻坚果般的难题,而是让抽象之水(范畴、层、上同调)缓缓上涨,悄无声息地淹没并瓦解问题。
5
+ > 本文件把这套"涨潮式抽象"蒸馏成 AI/GPU 的可激活算法结构——只取最能迁移的骨架,不复述原书证明。
6
+
7
+ ## 概要
8
+
9
+ 本书用约 30 章、从零搭起 Grothendieck 学派的现代代数几何(algebraic geometry):核心是把**几何对象翻译成交换代数(commutative algebra)**,再用**层(sheaf)+ 上同调(cohomology)**度量"局部数据能否黏成全局"。
10
+
11
+ 对 AI 而言,真正可迁移的不是椭圆曲线或除子,而是三件抽象机械:
12
+
13
+ - **层(sheaf)= 局部数据 + 一致黏合(gluing)**——图上几何感知聚合的本体。
14
+ - **上同调(cohomology)= 全局一致性的障碍度量(obstruction)**——幻觉/不一致的代数判据。
15
+ - **范畴(category)= 统一不同构造的接口**——把异构算子收拢为一套伴随(adjoint)关系。
16
+
17
+ 一句话:**层管"怎么把局部拼成全局",上同调管"拼不起来时差在哪",范畴管"用同一套语言说所有这些事"。**
18
+
19
+ ### 真实章节地图
20
+
21
+ 按本书章号(`*`/`**` 为进阶节):
22
+
23
+ - **Part I 预备(Preliminaries)**
24
+ - **§1 Just Enough Category Theory to Be Dangerous**:§1.1 范畴与函子,§1.2 泛性质(universal property),§1.3 极限与余极限(limits/colimits),§1.4 伴随(adjoints),§1.5 阿贝尔范畴(abelian categories),§1.6\* 谱序列(spectral sequences)。
25
+ - **§2 Sheaves**:§2.1 动机(光滑函数层),§2.2 层与预层定义,§2.3 态射,§2.4 茎与层化(stalks & sheafification),§2.5 sheaf on a base,§2.6 OX-模构成阿贝尔范畴,§2.7 逆像层(inverse image sheaf)。
26
+ - **Part II 概形(Schemes)**:§3 仿射概形的集合与拓扑空间(Zariski 拓扑、generic point),§4 结构层与概形定义,§5 概形的性质,§6 拟凝聚层(quasicoherent sheaves)。
27
+ - **Part III 概形的态射(Morphisms)**:§7 概形态射(§7.7 Grassmannian 第一构造),§8 各类有限性态射(§8.4 Chevalley 定理与消元理论),§9 闭嵌入,§10 纤维积与基变换(§10.6 Segre 嵌入),§11 分离与紧合态射、簇(varieties)。
28
+ - **Part IV 概形的"几何"性质**:§12 维数,§13 正则性与光滑性(§13.1 Zariski 切空间)。
29
+ - **Part V 概形上的拟凝聚层及其应用**:§14 向量丛"="局部自由层(vector bundles = locally free sheaves),§15 线丛、到射影空间的映射与除子(§15.4 线丛与 Weil 除子),§16 线丛性质(§16.2 充裕/极充裕,§16.4 Grassmannian 作为模空间),§17 射影态射与相对 Spec/Proj。
30
+ - **§18 拟凝聚层的 Čech 上同调(Čech Cohomology)**:§18.1 期望性质,§18.2 定义与证明,§18.3 射影空间上线丛的上同调,§18.4 Riemann–Roch 与算术亏格,§18.5 Serre 对偶(Serre duality)初窥。
31
+ - §19 应用:曲线,§20\* 交点理论一瞥,§21 微分(differentials),§22 Riemann–Hurwitz 公式。
32
+ - **Part VI 更多上同调工具**:**§23 导出函子(derived functors,§23.5 Čech 上同调与导出函子上同调一致)**,§24 平直性(flatness),§25 上同调与基变换。
33
+
34
+ > 注:**热带几何(tropical geometry)** 是代数几何在热带/min-plus 半环(tropical semiring)上的"骨架化",是 §15–17 射影簇的 tropicalization,本书未单列章节。下文"热带门控"以此为数学来源,引用时**不绑定具体章号**(避免编造)。
35
+
36
+ ## 可迁移到 AI/Infra 的核心结构
37
+
38
+ 先看总览映射,再逐条展开:
39
+
40
+ | 数学概念(本书章节) | AI/ML 对应 | 工程落地形态 |
41
+ |---|---|---|
42
+ | 层 sheaf(§2) | 图上几何感知信息聚合 | 节点=截面、边=变换的消息传递 |
43
+ | 限制映射 restriction map(§2.3, §14) | 边上的方向性特征变换 | 每边一个低秩线性映射 = 小 GEMM |
44
+ | 层拉普拉斯 sheaf Laplacian(§2, §14) | 几何注意力/扩散算子 | L = δᵀδ 上的传播 |
45
+ | 上同调 H⁰/H¹(§18, §23) | 全局一致性 / 幻觉判据 | Čech H¹ 正则项 |
46
+ | 范畴+伴随 adjoint(§1.3–1.4) | 统一算子接口 | pullback=对齐、pushforward=聚合 |
47
+ | Grassmannian+Plücker(§7.7, §16.4) | 子空间压缩编码 | Plücker 坐标块摘要压 KV-Cache |
48
+ | 平直性 flatness(§24) | 分布平滑迁移判据 | 纤维无跳变 → 无秩坍塌信号 |
49
+
50
+ **1. 层 → 图上几何感知的信息聚合(sheaf → geometry-aware aggregation)**(§2)
51
+
52
+ - **本体**:层把"每个开集/节点配一个数据空间(茎/截面 stalk/section)+ 沿包含关系的限制映射(restriction map)+ 局部一致即可黏合(gluing axiom)"系统化。
53
+ - **映射**:节点特征 = 截面,边 = 限制映射,消息传递 = 强制相邻截面在限制下一致。
54
+ - **落地**:这正是**胞腔层扩散(cellular sheaf diffusion)/ sheaf neural network** 的本体;普通 GNN 是其"平凡层(trivial sheaf)"特例——层结构给每条边注入了方向性几何归纳偏置。
55
+
56
+ **2. 限制映射 → 每条边一个低秩线性变换(restriction map → per-edge low-rank linear map)**(§2.3, §14)
57
+
58
+ - **本体**:每条边携带一个学习到的线性映射 F(U)→F(V)。
59
+ - **算子**:由此定义**层拉普拉斯(sheaf Laplacian)** L = δᵀδ(δ 为协边界算子),扩散/注意力即 L 上的传播;当所有限制映射为恒等时退化为标准图拉普拉斯。
60
+ - **落地**:每边映射取低秩 → 一串**小 GEMM**,天然落 Tensor Core;秩即可调的表达力旋钮。
61
+
62
+ **3. 上同调 → 全局一致性 / 幻觉判据(cohomology → global-consistency / hallucination criterion)**(§18, §23)
63
+
64
+ - **H⁰** = 全局截面(global sections):所有局部一致并真能黏成的全局解。
65
+ - **H¹** = **黏合障碍(obstruction)**:局部两两一致、却拼不出全局——即"自洽的矛盾"。形式上 H¹ = ker δ¹ / im δ⁰。
66
+ - **判据**:给幻觉一个**代数判据**——H¹≠0 ⇔ 模型局部自信但全局冲突。
67
+ - **可算性边界**:**Čech 上同调(§18.2)** 用覆盖(cover)的交叠(overlap)直接算,局部、廉价;§23.5 证明它在好情形下与昂贵的导出函子上同调一致——这条边界线决定"哪种上同调能上 GPU"。
68
+
69
+ **4. 范畴 + 泛性质 + 伴随 → 统一抽象接口(category → unified interface)**(§1)
70
+
71
+ - **本体**:pullback / pushforward(f\*, f\_\*)是一对伴随(adjoint,§1.4);积、和、纤维积统一为(余)极限(§1.3)。
72
+ - **落地**:用一个抽象接口统一不同算子——**pullback = 特征对齐/重采样,pushforward = 聚合/池化**,由伴随关系自动保证二者相容,少写超参、少出对不齐的 bug。
73
+
74
+ **5. Proj / 射影 + Plücker 坐标 → 子空间压缩编码(projective + Plücker → subspace compression)**(§7.7, §16.4, §15)
75
+
76
+ - **本体**:Grassmannian 把"k 维子空间"参数化,并经 **Plücker 嵌入(Plücker embedding,本书显式出现)** 用外积坐标(Plücker coordinates)塞进射影空间。
77
+ - **落地**:一组 KV 向量张成的子空间,可用少量 Plücker/外积坐标做**块摘要**,从而压缩 KV-Cache——存"子空间"而非逐个向量。
78
+
79
+ **6. 平直性 → 分布平滑过渡的几何判据(flatness → smooth deformation)**(§24)
80
+
81
+ - **本体**:平直态射的纤维(fiber)随基"无跳变"地连续变化。
82
+ - **落地**:可作为训练/微调中"分布平滑迁移、无秩坍塌(rank collapse)"的几何正确性信号(偏理论,落地需谨慎验证)。
83
+
84
+ ## 适合激活的问题类型
85
+
86
+ - **图/集合结构上的注意力与消息传递**:节点带异质特征空间、边带方向性变换 → 层扩散比朴素 GNN 表达力更强。
87
+ - **多源/多视图一致性**:多模态、多 agent、检索增强(RAG)的局部证据要黏成全局答案 → H⁰/H¹ 度量一致性。
88
+ - **幻觉 / 自洽性检测与正则**:需要一个"局部自洽但全局矛盾"的可微惩罚 → Čech H¹ 正则项。
89
+ - **长上下文推理的显存压缩**:KV 子空间冗余高 → Plücker 式块摘要。
90
+ - **稀疏路由 / 门控(MoE、Top-K)**:需要可微地逼近离散选择 → 热带半环分段线性门控。
91
+ - **需要统一异构算子的框架**:用 pullback/pushforward 伴随对统一对齐与聚合。
92
+
93
+ ## 可能的算法启发
94
+
95
+ **Tropical Sheaf Attention 三件套**(与 `../gpu-friendly-math.md` 的候选验证范例一致):
96
+
97
+ 1. **热带门控(Tropical Gating)**
98
+ - 把硬 Top-K 路由换成 max-plus 半环上的**分段线性**评分。
99
+ - 次可微(折点需 LogSumExp 软化,软化后退回标准 softmax)、可张量化但**非 Tensor Core GEMM**(max/min 落 CUDA core)—— 替代不可微的离散选择。
100
+ 2. **胞腔层扩散(Cellular Sheaf Diffusion)**
101
+ - 注意力 = 可学习层拉普拉斯上的扩散。
102
+ - 每条边一个**低秩限制映射(= 小 GEMM)**,给注意力注入边方向的几何归纳偏置。
103
+ 3. **Čech 上同调正则(Čech Cohomology Regularizer)**
104
+ - 在注意力图的**固定有限覆盖**上计算一阶 Čech H¹。
105
+ - 作为幻觉/不一致惩罚项;局部、廉价。可微性需用代理(如 H¹-分量投影范数 ‖(I−P_im δ⁰)c‖²,经 SVD/伪逆可微,秩跳变处非光滑),非精确 Betti 数。
106
+
107
+ **其他单点启发:**
108
+
109
+ - **低秩基底 KV 压缩(Grassmannian/Plücker 视角)**:把每块 KV 子空间用其**低秩基底**(低秩分解,kn 或 k(n−k) 参数)表示以压缩显存。注意:Plücker 坐标本身在低秩时共 C(n,k) 个、反而**扩张**,故真正起压缩作用的是低秩基底而非 Plücker 坐标——「Plücker」是借名。压缩率取决于块的原冗余度,需实测。
110
+ - **热带半环上的 MoE 路由(Tropical-Semiring MoE Routing)**:路由 logits 在 max-plus 上做分段线性,得到**结构化稀疏**且可微的专家选择。
111
+ - **伴随式 Pull/Push 算子对(Adjoint Pull/Push)**:把上/下采样、对齐/聚合实现为一对伴随,强制相容性、减少超参。
112
+
113
+ ## GPU 友好性警告
114
+
115
+ > **必读且唯一权威**:`../gpu-friendly-math.md`
116
+ > 八维记分卡:①张量化 ②GEMM 可映射 ③复杂度 ④显存/KV ⑤低精度稳定 ⑥并行通信 ⑦稀疏结构 ⑧算子融合。
117
+ > **数学美 ≠ 可算**;任一维"不友好且不可改造"即淘汰。
118
+
119
+ **可落 GEMM / 亚二次(友好 ✅):**
120
+
121
+ | 构造 | 命中维度 | 说明 |
122
+ |---|---|---|
123
+ | 低秩限制映射 restriction map | ①②④ | 批量小 GEMM,吃满 Tensor Core,低秩省显存 |
124
+ | 热带门控 tropical gating | ①③(非②) | 可张量化、逐 token 门控亚二次;**非 GEMM**(不落 Tensor Core);次可微,max 折点需 LogSumExp 软化 |
125
+ | Čech H¹ 正则(固定覆盖) | ③⑧ | 局部廉价,可与注意力 kernel 融合(FlashAttention 式)|
126
+ | 低秩基底块摘要(Plücker 视角) | ④ | 低秩分解压缩 KV,推理显存大降(压缩率需实测) |
127
+
128
+ **美但不可算(不友好 ❌,禁止塞进训练 forward):**
129
+
130
+ - **一般层上同调的导出函子计算(derived functor cohomology,§23)**
131
+ - 需内射分解(injective resolution)+ 谱序列(spectral sequence),属**符号代数**。
132
+ - 无张量化、无 GEMM、非亚二次、不可微 → 违反维度①②③⑤⑧。
133
+ - 只能离线、小规模、作分析;**只用与之一致的 Čech 版本(§23.5)且限定固定覆盖**。
134
+ - **Spec/Proj 的拓扑层(Zariski 拓扑、generic point,§3–4)**:离散非数值结构、不可微 → 违反维度①。仅作概念脚手架。
135
+ - **理想消元 / Gröbner 基(Chevalley 定理与消元理论,§8.4)**:组合爆炸、串行、非结构化 → 违反维度③⑥⑦。
136
+ - **动态 / 非结构化的 Čech 覆盖**:若覆盖随输入变化或交叠不规则,H¹ 计算退化为随机 gather/scatter → 违反维度⑦。**必须固定有限覆盖 + 结构化(块/带状)交叠。**
137
+
138
+ ## 该调用哪个思想武器
139
+
140
+ - **topological-thinking(🌀 拓扑思想)** — 主力:上同调、H¹ 障碍、连续变形下的不变量,正是层/上同调激活的母题。
141
+ - **abstraction(🧩 抽象化)**:用"层 = 局部数据 + 黏合"提取消息传递的本质,把工程算子抽象为限制映射。
142
+ - **transformation(🔄 变换思想)**:tropicalization、Plücker 嵌入、pullback/pushforward —— 用等价转换把难算问题搬到可算坐标系。
143
+ - **symmetry-invariance(⚛️ 对称与不变性)**:射影不变、规范(gauge)对称、层的协变性,约束模型的等变结构。
144
+ - **axiomatization(📐 公理化)**:把层公理(局部性 + 黏合)、上同调长正合列当作正确性约束,审查"该有的一致性是否被违反"。
145
+
146
+ ## 反模式
147
+
148
+ - **把抽象/导出函子上同调直接塞进训练 forward**:符号计算、无梯度、不可算 —— 经典"美但不可算",违反 GPU 八维。要用 Čech + 固定覆盖的可微替身。
149
+ - **为"显得高级"引入整套 Scheme/Proj 机械**,而任务其实只需要一个图拉普拉斯:过度工程,违反 CLAUDE.md「Simplicity First」。先问"是否只需平凡层(= 普通 GNN)?"
150
+ - **把 Zariski 拓扑 / generic point 等离散结构当可微对象**优化:类型错误。
151
+ - **让 Čech 覆盖动态化、交叠非结构化**:退化成随机访存,毁掉 GPU 并行(维度⑦)。
152
+ - **把 max-plus 半环当真半环做精确算术**而不在不可微点做松弛:梯度断裂,训练不动。
153
+ - **盲目相信 H¹=0 等于"没幻觉"**:它只保证所选覆盖下的局部黏合一致,不等于事实正确;它是结构一致性信号,不是真值判据。
154
+
155
+ ## 深挖入口
156
+
157
+ **全保真回查(full-fidelity lookup)**:当摘要不足以支撑设计时,让 Agent 自动检索本地 PDF
158
+ `math_book/The Rising Sea Foundations of Algebraic Geometry.pdf`
159
+ (用 `pdftotext -f <start> -l <end>` 取定向页,**不要 dump 整本**)。
160
+
161
+ 值得深读的真实章号:
162
+
163
+ 1. **§2 Sheaves**(重点 §2.2 定义、§2.4 茎与层化、§2.5 sheaf on a base、§2.7 逆像层)—— 胞腔层扩散与限制映射的数学地基。
164
+ 2. **§18 Čech Cohomology of Quasicoherent Sheaves**(§18.1 期望性质、§18.2 定义与证明、§18.4 Riemann–Roch、§18.5 Serre 对偶初窥)—— H¹ 幻觉正则的来源与可算性边界。
165
+ 3. **§23 Derived Functors**(§23.5 Čech 上同调与导出函子上同调一致)—— 划清"可算 Čech vs 不可算导出函子"的红线。
166
+ 4. **§7.7 + §16.4 Grassmannian**(配 §15 线丛与除子,Plücker 嵌入在此体系出现)—— Plücker KV 压缩的几何依据。
167
+ 5. **§1 Category Theory**(§1.3 极限/余极限、§1.4 伴随)—— pullback/pushforward 伴随对与统一算子接口。
@@ -0,0 +1,136 @@
1
+ # 📐 流形与微分几何 / Manifolds & Differential Geometry
2
+
3
+ > **Manifolds and Differential Geometry** — Jeffrey M. Lee
4
+ > American Mathematical Society, *Graduate Studies in Mathematics*, Volume 107 (2009), ISBN 978-0-8218-4815-9.
5
+ > MSC: 58A05, 53C05, 22E15, 53C20, 53B30, 55R10. 本文件是「激活」摘要,非原文转录;全保真回查见末尾「深挖入口」。
6
+
7
+ ## 概要
8
+
9
+ 本书是一部从零构建**光滑流形(smooth manifold)→ 张量 / 微分形式 → 联络与曲率 → 黎曼几何**的研究生教材。它的主线不是"在欧氏空间里算",而是**在弯曲空间上做微积分**:当没有全局坐标、没有"自然"的向量加法时,如何定义微分、如何比较不同点的向量、如何度量距离与弯曲程度。这恰好是把"参数空间是平坦欧氏的"这一默认假设打破后,深度学习需要的语言。
10
+
11
+ 前言里有一句对 AI 研究极关键的话:**纤维丛上的联络(connection on a fiber bundle)与物理学的规范场(gauge field)是数学家与物理学家各自独立发现的同一个概念**(前言脚注 2)。这正是本技能包反复强调的"跨域激活"原型——结构早就在那里,只差有人把它接到算法设计上(规范等变网络就是这次接驳的产物)。
12
+
13
+ 真实章节地图(按依赖排序,章号与节号经 PDF 目录核对):
14
+
15
+ | 章 | 标题 | 对 AI 的钩子 |
16
+ |----|------|-------------|
17
+ | 1–2 | Differentiable Manifolds / The Tangent Structure | 切空间(tangent space)= 局部线性化、梯度的归属空间 |
18
+ | 3 | Immersion and Submersion | 子流形、降维 / 嵌入 |
19
+ | 4 | Curves and Hypersurfaces in Euclidean Space | Gauss / mean curvature 的几何直觉来源 |
20
+ | 5 | Lie Groups | 连续对称群、指数映射、伴随表示 → 等变架构 |
21
+ | 6 | Fiber Bundles(§6.1 一般丛, §6.2 向量丛, §6.8 主丛与配丛)| **规范等变的几何骨架** |
22
+ | 7 | Tensors(§7.6 Metric Tensors)| 度量张量 g = 内积场 → Fisher 度量 |
23
+ | 8 | Differential Forms(§8.5 丛值形式)| 反对称张量、外微分、规范场强 |
24
+ | 9 | Integration and Stokes' Theorem(§9.8 Electromagnetism)| Maxwell = U(1) 联络曲率的实例 |
25
+ | 10 | De Rham Cohomology | 整体拓扑不变量(积分守恒量)|
26
+ | 11 | Distributions and Frobenius' Theorem | 可积性、约束分布 |
27
+ | 12 | Connections and Covariant Derivatives(§12.2 联络形式, §12.4 Ehresmann, §12.5/§12.10 曲率, §12.12 G-联络)| **平行移动 + 曲率** |
28
+ | 13 | Riemannian & Semi-Riemannian Geometry(§13.1 Levi-Civita, §13.2 Riemann 曲率, §13.4 测地线, §13.7 Jacobi 场, §13.11 Rauch 比较)| **自然梯度 / 优化地形** |
29
+
30
+ ## 可迁移到 AI/Infra 的核心结构
31
+
32
+ 每条都按 **几何概念 → 数学内核 → AI 迁移** 三段给出,方便直接接到算法设计上。
33
+
34
+ - **黎曼度量 g(Riemannian metric, §7.6 / §13.1)→ 自然梯度与信息几何。**
35
+ - 内核:度量张量在每点给切空间一个内积 ⟨u,v⟩_g = uᵀg v,决定"谁离谁近"、什么方向算"最陡"。
36
+ - 迁移:概率分布族上的天然度量就是 **Fisher 信息矩阵(Fisher–Rao metric)**;参数空间因此不是平坦欧氏的,而是弯曲流形。最陡下降方向不是 ∇L 而是 **g⁻¹∇L(natural gradient)**,对重参数化不变。
37
+ - **联络 / 协变导数(connection, §12.1–§12.4)→ 平行移动(parallel transport)。**
38
+ - 内核:不同点的切空间无法直接相加;联络 ∇ 规定"如何把一个向量沿曲线搬到另一点而不额外旋转"。**Levi-Civita 联络**是唯一与度量相容且无挠的那一个。
39
+ - 迁移:把**动量(momentum)/ 历史梯度 / 二阶状态**在参数流形上正确搬运,是 Riemannian SGD/Adam 中 vector transport 的来源。
40
+ - **曲率(curvature, §12.5 / §13.2 / §13.7)→ 优化地形(loss landscape)。**
41
+ - 内核:曲率 = 向量绕一个小环平行移动一圈后偏转多少,是"空间弯不弯、路径依不依赖"的度量,本质是 Hessian 的几何化身。
42
+ - 迁移:损失曲面的曲率决定条件数与尖锐度;**Jacobi 场 / Rauch 比较定理(§13.7 / §13.11)** 描述测地线发散—汇聚,等价于优化轨迹的稳定 vs 发散。
43
+ - **测地线与指数映射(geodesics, §13.4)→ 流形上的"直线步"。**
44
+ - 内核:测地线是局部最短路径;指数映射 exp_p(v) 把切空间向量 v 映回流形上对应的最短路径终点。
45
+ - 迁移:在 SPD 矩阵、Stiefel / Grassmann 流形上做**约束优化**时,exp_p 是 retraction 的精确版;latent 空间的测地插值比欧氏直线更尊重数据流形。
46
+ - **纤维丛 / 主丛 + G-联络(§6.8 / §12.12 / §9.8)→ 规范等变(gauge equivariance)。**
47
+ - 内核:主 G-丛把"局部坐标系 / frame 的任意选择"打包成纤维上的群作用;丛上的联络 = 规范场(gauge field),曲率 = 场强。
48
+ - 迁移:物理量不应依赖局部 frame 选择,这个"规范自由度(gauge freedom)"正是 **gauge-equivariant CNN(球面 / mesh / 一般流形卷积)** 的归纳偏置;§9.8 用 Maxwell 给出 U(1) 联络曲率的真实样板。
49
+ - **李群与李代数(§5)→ 连续对称作为先验。**
50
+ - 内核:指数映射 exp: 𝔤→G、伴随表示 Ad 给出"无穷小生成元 → 有限变换"的通道。
51
+ - 迁移:把对称群作为网络的硬归纳偏置(等变层、李代数参数化的旋转 / 刚体变换)。
52
+
53
+ ## 适合激活的问题类型
54
+
55
+ - 优化在**欧氏假设下病态 / 收敛慢**,但底层参数有自然的概率或几何结构(用度量重新定义"距离")。
56
+ - 数据本身住在**非欧流形**上:协方差 / SPD 矩阵、旋转 SO(3)、方向数据、图与网格、球面信号。
57
+ - 需要**严格的对称 / 等变保证**:旋转、平移、局部规范变换下输出可预测地变化。
58
+ - 需要把**"坐标选择的任意性"**显式建模成对称性(多视角、多 frame、传感器姿态无关)。
59
+ - 想用**几何量(曲率 / 测地距离)做正则或诊断**:sharpness、泛化、轨迹稳定性。
60
+
61
+ ## 可能的算法启发
62
+
63
+ - **自然梯度 / K-FAC(natural gradient / K-FAC)**:用 Fisher 度量做预条件,更新方向 = F⁻¹∇L 而非 ∇L。
64
+ - 关键工程:K-FAC 把每层 Fisher 近似成 Kronecker 积 **F ≈ A ⊗ B**(A 来自输入激活、B 来自输出梯度),求逆变两小矩阵求逆、作用变小 GEMM(见下节记分卡)。
65
+ - **信息几何优化(information-geometric optimization)**:把训练看成在分布流形上沿 Fisher–Rao 测地线移动。
66
+ - 镜像下降(mirror descent)、Bregman 散度、指数族的对偶坐标都是这套 Hessian 度量的特例;可用来设计对参数化不敏感的优化器。
67
+ - **Riemannian optimization**:在 SPD / Stiefel / Grassmann / 双曲流形上做 SGD/Adam。
68
+ - 三件套:retraction(exp 的廉价近似)、vector transport(平行移动的离散版)、流形上的动量;常用于度量学习、正交约束、层次结构嵌入。
69
+ - **Gauge-equivariant CNN**:在流形 / 网格上卷积时引入局部规范(local gauge)。
70
+ - 用 G-联络对齐相邻点的 frame,使特征对局部坐标选择不变;适用于球面信号、mesh、晶格等没有全局坐标的域。
71
+ - **曲率正则 / SAM 的几何视角(curvature regularization)**:用 Hessian-vector product 估计曲率。
72
+ - 惩罚尖锐极小(flat minima 偏好),或用 Jacobi 场刻画轨迹发散,给 sharpness-aware 训练一个几何解释。
73
+ - **测地插值与流形增广(geodesic interpolation)**:latent / 嵌入空间沿测地线插值与采样,比欧氏直线更尊重数据流形,可用于数据增广与可控生成。
74
+
75
+ ## GPU 友好性警告
76
+
77
+ > 用 `../gpu-friendly-math.md` 的**八维记分卡**逐项评判。微分几何最大的坑是"度量 / 曲率矩阵的求逆与物化"。
78
+
79
+ - **维度 2/3(GEMM 可映射 / 复杂度)—— 求逆是生死线。** 朴素自然梯度要算 N×N Fisher 的逆,N 是参数量(~10⁹),O(N³) 求逆 + O(N²) 显存,**直接出局**。
80
+ - **可改造 ✅**:**K-FAC** 把 F 分块为 Kronecker 积 A⊗B,利用 (A⊗B)⁻¹ = A⁻¹⊗B⁻¹,只需对两个小因子求逆,且预条件作用到梯度上**就是 GEMM**。这就是"能否 Kronecker 因子化为 GEMM"的肯定答案——能,且这是它唯一可上集群的形态。
81
+ - **维度 4(显存)—— 不要物化全 Hessian / 全曲率张量。** Riemann 曲率张量是 4 阶,全物化爆显存。用 **Hessian-vector product(HVP)** 经一次反向以 O(N) 拿到曲率信息,避免 N×N。
82
+ - **维度 5(低精度)—— Fisher / 度量矩阵常病态。** bf16/fp16 下求逆灾难性放大误差,**必须加阻尼(damping / Tikhonov,F+λI)** 并把求逆留在 fp32;否则违反"低精度稳定"。
83
+ - **维度 6(并行)—— 平行移动 / 测地线是串行 ODE。** 沿曲线积分联络方程是长串行递推,并行性差;工程上用**一步 retraction / 闭式平行移动**(特定流形有解析公式)替代逐步积分。
84
+ - **维度 1/2(张量化 / GEMM)—— 群卷积可友好,但连续群要当心。** 离散群(如 C_n、八面体群)的群卷积可展开成 GEMM ✅;连续李群需采样离散化,采样不当会导致等变性破缺 + 不规则 gather/scatter(维度 7 稀疏不友好)。
85
+
86
+ **自然梯度 / K-FAC 八维记分卡(worked example):**
87
+
88
+ | 维度 | 朴素自然梯度(全 Fisher 求逆)| K-FAC(Kronecker 因子化)|
89
+ |------|------------------------------|--------------------------|
90
+ | 1 张量化 | ❌ 大矩阵显式逆 | ✅ 批量小矩阵代数 |
91
+ | 2 GEMM | ❌ N×N 求逆无法 GEMM | ✅ A⁻¹⊗B⁻¹ 作用 = GEMM 链 |
92
+ | 3 复杂度 | ❌ O(N³) | ✅ 两个小因子,亚立方 |
93
+ | 4 显存 | ❌ 物化 N×N | ✅ 只存两个小因子 |
94
+ | 5 低精度 | ❌ 病态、需 fp64 | ⚠️ 加阻尼 + fp32 求逆可改造 |
95
+ | 6 并行 | ⚠️ 单次大求逆难并行 | ✅ 各层因子独立、可并行 |
96
+ | 7 稀疏 | — | ✅ 块对角结构化 |
97
+ | 8 融合 | ❌ | ✅ 预条件可融进优化器 kernel |
98
+
99
+ **结论**:黎曼 / 信息几何方法**只有在度量被结构化因子化(Kronecker / 块对角 / 低秩)后才 GPU 可行**;精确求逆与精确平行移动都属于"美但不可算",须改造或淘汰。
100
+
101
+ ## 该调用哪个思想武器
102
+
103
+ - **symmetry-invariance(⚛️ 对称与不变性)—— 首选。** 规范等变、李群对称、纤维丛 = 把"frame / 坐标选择无关"编码成对称性,是本书与 DL 最强的接口。
104
+ - **optimization(⚖️ 优化)—— 并列首选。** 自然梯度、Riemannian SGD、曲率正则都是"在弯曲约束空间里找最优"。
105
+ - **transformation(🔄 变换)**:指数 / 对数映射、retraction、坐标变换简化问题。
106
+ - **modeling(🌉 建模)**:把参数 / 数据空间显式建模为流形,再翻译回算法。
107
+ - **topological-thinking(🌀 拓扑)**:辅助——de Rham 上同调 / 整体不变量用于守恒量与可积性诊断。
108
+
109
+ 组合建议:先 `symmetry-invariance` 定对称结构 → `optimization` 落到自然梯度 / Riemannian 优化 → `transformation` 处理 retraction → 过 `../gpu-friendly-math.md` 验收门。
110
+
111
+ ## 反模式
112
+
113
+ 每条给出 **反模式 → 正解**:
114
+
115
+ - **物化并精确求逆全 Fisher / 全 Hessian**:O(N³) / O(N²),集群上不可行。
116
+ - 正解:先做 Kronecker / 块对角 / 低秩因子化,再求逆;不做因子化就别上自然梯度。
117
+ - **在 fp16 直接求逆病态度量矩阵**:灾难性抵消,结果是噪声。
118
+ - 正解:加阻尼 F+λI,求逆留在 fp32,必要时用 CG / Woodbury 隐式求解。
119
+ - **逐步 ODE 积分做平行移动 / 测地线**:串行递推杀死并行度。
120
+ - 正解:用闭式 retraction / vector transport(特定流形有解析式),把递推换成单步。
121
+ - **连续群无脑离散化**:等变性悄悄破缺,还引入不规则 gather/scatter。
122
+ - 正解:选可精确表示的离散子群,或用可证明误差界的求积 / 频域(球谐)方案。
123
+ - **为"几何美"强行流形化**:绝大多数任务欧氏近似已足够。
124
+ - 正解:上黎曼机制前先用实验证明欧氏确实病态(条件数 / 收敛曲线),再引入。
125
+ - **把曲率正则当万能药**:曲率估计本身昂贵且噪声大。
126
+ - 正解:先用 HVP 在小规模验证收益,确认信噪比再放大。
127
+
128
+ ## 深挖入口
129
+
130
+ > 全保真回查 = 让 Agent **自动搜索本地 PDF** `math_book/Manifolds and Differential Geometry.pdf`(按章号 / 节号定位,勿凭记忆复述)。本摘要只给坐标,不替代原文。
131
+
132
+ - **§6.8 Principal and Associated Bundles** + **§12.12 G-Connections**:规范等变的几何基础(主丛 + 联络 = 规范场)。
133
+ - **§7.6 Metric Tensors** + **§13.1 Levi-Civita Connection**:度量张量与自然梯度 / Fisher 度量的源头。
134
+ - **§13.2 Riemann Curvature Tensor** + **§13.7 Jacobi Fields**:曲率与优化地形、轨迹稳定性。
135
+ - **§13.4 Geodesics** + **§13.11 Rauch's Comparison Theorem**:测地线 / retraction 与收敛—发散比较。
136
+ - **§9.8 Electromagnetism**:规范场作为 U(1) 联络曲率的具体实例(跨域激活的历史样板)。
@@ -0,0 +1,142 @@
1
+ # 🧮 矩阵分析 / Matrix Analysis
2
+
3
+ > Roger A. Horn & Charles R. Johnson, *Matrix Analysis*, 2nd Edition, Cambridge University Press, 2013(ISBN 978-0-521-83940-2)。以**标准型(canonical forms)作为统一主题**的研究生级矩阵理论经典。
4
+
5
+ ## 概要
6
+
7
+ 这是把"线性代数"升级为"矩阵分析"的权威参考:不只算矩阵,而是研究矩阵在**相似 / 酉等价 / 合同**等变换下的不变量、标准型、谱的位置与扰动、范数几何、以及正定/非负结构。对 AI/ML/GPU 而言,它是 v2 书单里**最贴近底层算子的骨干**——GEMM、数值稳定、低秩压缩、二阶优化全都从这里取根。
8
+
9
+ 真实章节地图(来自实际目录):
10
+
11
+ - **Ch 0 Review and Miscellanea**:秩、非奇异、内积、分块矩阵——速查底座。
12
+ - **Ch 1 Eigenvalues, Eigenvectors, and Similarity**:特征方程、特征多项式、代数/几何重数、相似(§1.1–1.4)。
13
+ - **Ch 2 Unitary Similarity and Unitary Equivalence**:QR 分解(§2.1)、Schur 三角化(§2.4)、正规矩阵(§2.5)、**SVD(§2.6)**、CS 分解(§2.7)。
14
+ - **Ch 3 Canonical Forms for Similarity and Triangular Factorizations**:Jordan 标准型(§3.1)、最小多项式与友矩阵(§3.3)、实 Jordan 与 Weyr 型(§3.4)、三角分解 LU(§3.5)。
15
+ - **Ch 4 Hermitian, Symmetric Matrices, and Congruences**:变分刻画 Courant–Fischer(§4.2)、特征值不等式 Weyl/交错(§4.3)、合同与惯性定律(§4.5)。
16
+ - **Ch 5 Norms for Vectors and Matrices**:范数与内积、对偶范数(§5.5)、**矩阵范数(§5.6–5.7)**、**条件数(§5.8)**。
17
+ - **Ch 6 Location and Perturbation of Eigenvalues**:Geršgorin 圆盘(§6.1–6.2)、特征值扰动定理(§6.3)。
18
+ - **Ch 7 Positive Definite and Semidefinite Matrices**:极分解与 SVD(§7.3–7.4)、**Schur 积定理(§7.5)**、同时对角化(§7.6)、Loewner 偏序与分块矩阵(§7.7)、正定不等式(§7.8)。
19
+ - **Ch 8 Positive and Nonnegative Matrices**:Perron–Frobenius(§8.2–8.5)、随机与双随机矩阵(§8.7)。
20
+ - 附录 A–F:复数、**凸集与凸函数(B)**、代数基本定理、特征值连续性、紧致性、典范对(F)。
21
+
22
+ **激活时的边界提醒**:本书是**理论优先**的——讲存在性、刻画、不等式、标准型,而**不是数值算法食谱**。具体的算法实现、收敛常数、稳定性细节(如 blocked QR 的通信下界、SVD 的实际复杂度系数)需配数值线性代数教材(Golub–Van Loan / Trefethen–Bau)。这里给的是"该用哪个结构 + 为什么 + GPU 能不能算"的**激活索引**,落地实现回查那一类书。
23
+
24
+ ## 可迁移到 AI/Infra 的核心结构
25
+
26
+ | 数学结构(章节) | 迁移到 ML / 算法 / Infra |
27
+ |---|---|
28
+ | **SVD / 低秩(§2.6, §7.4)** | 一切低秩压缩的根基:LoRA、PCA/白化、Eckart–Young 最优低秩逼近、KV-Cache 低秩化、权重压缩 |
29
+ | **谱与相似不变量(Ch 1)** | Hessian/梯度协方差谱、谱半径决定线性 attention / SSM / RNN 的稳定性、迹=参数计数/正则 |
30
+ | **Schur 三角化 + 正规矩阵(§2.4–2.5)** | 数值 EVD 算法(QR algorithm)地基;正规⇔可酉对角化,是"良态谱"的判据 |
31
+ | **变分刻画 Courant–Fischer(§4.2)** | Rayleigh 商、谱归一化、谱聚类、PCA 即 min–max;最大奇异值=算子范数 |
32
+ | **特征值扰动 Weyl/Bauer–Fike(§4.3, §6.3)** | 量化/低精度/剪枝下的谱漂移界、训练扰动鲁棒性、稳定性证书 |
33
+ | **矩阵范数 + 对偶(§5.5–5.7)** | 谱范数(梯度裁剪/Lipschitz)、Frobenius(权重衰减)、**核范数=谱范数对偶**(低秩正则) |
34
+ | **条件数(§5.8)** | 数值稳定诊断、预条件、为什么 bf16 训练会发散 |
35
+ | **极分解 + Newton–Schulz(§7.3)** | 把梯度/权重正交化(Muon 优化器、正交初始化),纯 GEMM 可算 |
36
+ | **正定性 / PSD(Ch 7)** | 核方法、协方差、attention Gram 矩阵、二阶法预条件子、Loewner 偏序写矩阵不等式 |
37
+ | **Schur 积定理(§7.5)** | Hadamard 积保 PSD——可学习核工程、门控不破坏正定结构 |
38
+ | **Perron–Frobenius / 随机矩阵(Ch 8)** | attention 行随机矩阵的混合与坍缩(over-smoothing)、PageRank、图传播、谱 gap=表达力 |
39
+
40
+ 把上表收成四个**激活家族**,方便检索:
41
+
42
+ - **谱系(Ch 1–3)**:特征值/相似/标准型——回答"动力学稳不稳、谱长什么样"。注意 Jordan/Weyr 是理论工具,数值上转向 Schur/SVD。
43
+ - **范数系(Ch 5–6)**:范数/对偶/条件数/扰动——回答"误差怎么传、低精度稳不稳、该不该预条件"。
44
+ - **正定系(Ch 4, 7)**:Hermitian/PSD/极分解/Loewner——回答"二阶结构、核、协方差、最近正交矩阵"。
45
+ - **非负系(Ch 8)**:Perron–Frobenius/随机矩阵——回答"传播、混合、坍缩、平稳分布"。
46
+
47
+ ## 关键桥接事实(激活速记)
48
+
49
+ 把这本书"激活"成算法时,最常用到的连接性事实——记住这些就能在结构间快速跳转:
50
+
51
+ - **条件数 κ₂(A) = σ_max / σ_min(§5.8)**:直接预测 bf16/fp8 下误差放大几个数量级。
52
+ - **SVD ⇔ AᴴA 与 AAᴴ 的特征分解,σ = √λ(§2.6, §7.4)**:奇异值就是 Gram 矩阵的特征值开方。
53
+ - **谱范数 = σ_max,Frobenius = √Σσ²,核范数 = Σσ(§5.6)**:三大矩阵范数全由奇异值决定,谱范数与核范数互为对偶。
54
+ - **正规矩阵 ⇔ 可酉对角化(§2.5)**:唯一"特征值=奇异值结构良态"的类;非正规就要看 pseudospectra。
55
+ - **正定 ⇔ 所有特征值 > 0 ⇔ 所有顺序主子式 > 0(§7.1)**:后者是可算的正定判据(Sylvester 准则)。
56
+ - **极分解 A = UP,P = (AᴴA)^½(§7.3)**:Newton–Schulz 迭代收敛到正交因子 U。
57
+ - **Weyl 扰动界 |λ_i(A+E) − λ_i(A)| ≤ ‖E‖₂(§4.3)**:一行给出量化/剪枝的谱漂移上界。
58
+ - **行随机矩阵谱半径 = 1(§8.7)**:attention 的 Perron 根恒为 1,谱 gap 决定坍缩速度。
59
+
60
+ ## 适合激活的问题类型
61
+
62
+ - **低秩 / 压缩**:注意力、KV-Cache、权重、梯度里哪里有冗余?能压到多少秩?截断的最优逼近误差怎么估(Eckart–Young)?低秩正则该用核范数还是直接参数化?
63
+ - **数值稳定性**:低精度(bf16/fp8)训练为何发散?条件数与谱半径如何在线监控?量化/剪枝的谱漂移有没有界(Weyl、Bauer–Fike)?哪些算子需要重参数化才稳?
64
+ - **谱设计**:归一化(谱归一化 / BatchNorm)背后的算子范数;谱半径约束的循环 / 状态空间模型(SSM);谱 gap 决定表达力与可分性。
65
+ - **二阶优化**:Hessian / Fisher 的 PSD 结构与负曲率(惯性定律检测鞍点);预条件子的条件数改善;Kronecker 因子近似(K-FAC / Shampoo)。
66
+ - **图 / 传播**:消息传递的稳定性与 over-smoothing;行随机算子的混合时间;Markov 链平稳分布与谱 gap。
67
+
68
+ ## 可能的算法启发
69
+
70
+ > 每条标注**八维落点**(对应 `../gpu-friendly-math.md` 维度编号),方便直接进 GPU 验收门。
71
+
72
+ 1. **随机化数值线代(randomized NLA)**:用随机投影 + QR(§2.1)做随机 SVD,把 O(n³) 完整分解降到亚二次,对超大权重/激活做低秩草图(sketching)。*落点:维度 2/3——全 GEMM、复杂度可控。*
73
+ 2. **低秩注意力 / KV 压缩**:以 Eckart–Young(§7.4)保证截断 SVD 是最优低秩逼近;用**核范数(谱范数对偶,§5.5)**作低秩正则,把 KV-Cache 投影到低维子空间。*落点:维度 2/4——GEMM 链 + 显存压缩。*
74
+ 3. **谱归一化(spectral normalization)**:power iteration 估最大奇异值(算子范数 §5.6),约束每层 Lipschitz——GAN/扩散/稳定训练。*落点:维度 1/6——matvec,但迭代串行需块化。*
75
+ 4. **Newton–Schulz 正交化(Muon 式)**:极分解(§7.3)把梯度矩阵投到最近正交矩阵,迭代只含矩阵乘——当前最 GPU 友好的"二阶味"更新。*落点:维度 2/6/8——纯 GEMM、可融合、bf16 稳。*
76
+ 5. **预条件 / Shampoo / K-FAC**:条件数(§5.8)诊断病态,用 PSD Kronecker 因子(Ch 7)近似 Hessian 做预条件,把病态损失面拉圆。*落点:维度 2/5——小矩阵 GEMM,注意逆运算的精度。*
77
+ 6. **Geršgorin 廉价谱半径门(§6.1)**:训练循环里用圆盘界 O(n²) 快速估谱半径,做低成本稳定性 gate,不必跑完整 EVD。*落点:维度 1/3——逐行求和,极廉价。*
78
+ 7. **PSD 核工程(Schur 积定理 §7.5)**:用 Hadamard 积组合多个 PSD 核,保证可学习相似度矩阵始终半正定。*落点:维度 1——逐元素张量积,天然友好。*
79
+ 8. **Perron–Frobenius 诊断(§8.2–8.5)**:把行随机 attention 当 Markov 算子,用谱 gap 量化 over-smoothing / rank collapse,指导残差与温度设计。*落点:维度 1/3——谱估计廉价,避免深层坍缩。*
80
+ 9. **块化 / communication-avoiding 分解**:把 QR、Cholesky(§3.5)写成分块版本,用 GEMM 替代逐列消元,跨设备减少通信轮次。*落点:维度 2/6——串行递推改造成并行 + overlap。*
81
+
82
+ ## GPU 友好性警告
83
+
84
+ > 评分维度引用 `../gpu-friendly-math.md` 的**八维检查**(张量化 / GEMM 可映射 / 复杂度 / 显存 / 低精度 / 并行 / 稀疏 / 算子融合),此处不重复定义。
85
+
86
+ **天然友好(math beautiful × GPU friendly):**
87
+ - **SVD 截断 / 低秩**:写成 GEMM 链(维度 2),压缩 KV-Cache/权重(维度 4)。
88
+ - **Frobenius / 谱范数、Gram 矩阵、Hadamard 积**:批量张量代数(维度 1、2)。
89
+ - **极分解 Newton–Schulz**:纯矩阵乘迭代(维度 2、6、8 可融合),bf16 下稳健。
90
+ - **Geršgorin 圆盘**:O(n²) 逐行求和(维度 1),廉价稳定性估计。
91
+ - **良态 PSD 的 blocked Cholesky / Gram 构造**:分块后是 GEMM 链(维度 2),核方法与协方差预条件常用。
92
+
93
+ **美但不可算(beautiful, not computable):**
94
+ - **Jordan 标准型(§3.1)**——经典反例:特征值重数对扰动极度敏感,浮点下根本无法可靠计算,**永远不要当数值工具**(违反维度 5 低精度稳定)。Weyr 型同理。
95
+ - **完整 EVD / SVD 的 O(n³)**——大矩阵直接爆(违反维度 3),必须换随机化/迭代法。
96
+ - **非正规矩阵(non-normal,§2.5 之外)**——特征值不能反映真实行为,需 pseudospectra;低精度下谱失真(维度 5)。
97
+ - **病态 / 高条件数(§5.8)**——会出现灾难性抵消,要 fp64 才对,与 bf16/fp8 训练冲突(维度 5)。
98
+ - **QR / Cholesky 的串行依赖(§2.1, §3.5)**——朴素实现是长串行递推(违反维度 6),需 blocked / communication-avoiding 变体。
99
+ - **power iteration 的串行迭代**——单向量迭代并行度低;需块化(block / subspace iteration)才吃满 SM(维度 6)。
100
+
101
+ **改造手法(呼应 `../gpu-friendly-math.md` 的 Make-It-Computable Toolkit):**
102
+ - 完整 EVD/SVD → **随机化 + 截断**降复杂度(维度 3);
103
+ - 精确分解 → **块化 / GEMM 化**消除串行(维度 2/6);
104
+ - 病态/非正规 → **重参数化 + 谱归一化**稳低精度(维度 5);
105
+ - Jordan 等不可算标准型 → 只留作**理论证明**,数值上换 Schur/SVD。
106
+
107
+ ## 该调用哪个思想武器
108
+
109
+ 配合 `skills/` 下的现有武器使用:
110
+
111
+ - **`transformation`(变换)**:相似 / 酉等价 / 合同、SVD、对角化——本书的灵魂就是"换坐标让结构显形"。
112
+ - **`algorithmic-thinking`(算法与计算)**:power iteration、Newton–Schulz、QR algorithm、随机化 NLA——把定理变成可跑的 kernel。
113
+ - **`optimization`(优化)**:变分刻画(§4.2)、条件数与预条件、二阶法、Loewner 偏序下的矩阵不等式。
114
+ - **`symmetry-invariance`(对称与不变性)**:酉不变性、相似不变量(特征值/迹/行列式)、正规矩阵的良态谱。
115
+ - **`abstraction`(抽象化)**:标准型即"等价类的代表元"——用最简形态抓住本质、忽略坐标细节。
116
+ - **`probability-statistics`(概率与统计)**:随机化 NLA、随机矩阵谱、Perron–Frobenius/Markov 链平稳分布。
117
+
118
+ ## 反模式
119
+
120
+ - **把 Jordan 型当数值算法**:它在浮点下不可算,只用于理论分析,不要写进 kernel。
121
+ - **默认上完整 SVD/EVD**:大规模场景该用随机化/截断/迭代,否则 O(n³) 直接拖垮。
122
+ - **只看特征值忽略非正规性**:非正规矩阵的特征值不预测瞬态行为,要看奇异值 / pseudospectra。
123
+ - **假设矩阵都良态**:不监控条件数就上 bf16/fp8,发散后才找原因。
124
+ - **用核范数却忘了它要 SVD**:核范数是优雅的低秩正则,但计算依赖 SVD,需配近端/随机化技巧。
125
+ - **数值上假设精确正定**:浮点下 Gram/协方差可能丢正定性,要加 jitter(对角抖动)或用 Cholesky 带 pivot。
126
+ - **用 Frobenius 范数当低秩正则**:Frobenius / 权重衰减压的是"能量"不是"秩";要低秩得用核范数或显式低秩参数化(如 LoRA)。
127
+ - **对非对称矩阵谈"特征值大小"**:度量能量/范数/稳定裕度该看**奇异值**;非正规矩阵的特征值模长会严重误导(瞬态增长远超谱半径预测)。
128
+ - **把 O(n²) Gram 矩阵全量物化**:attention/核矩阵不分块就直接撑爆显存;应走 FlashAttention 式融合 + 分块(呼应 GPU 八维维度 4/8)。
129
+ - **堆定理而不诊断瓶颈**:先问"算法瓶颈是谱、低秩还是稳定性",再选结构,别一上来灌矩阵理论。
130
+
131
+ ## 深挖入口
132
+
133
+ **全保真回查 = 让 Agent 自动搜索本地 PDF `math_book/Matrix Analysis.pdf`**:用 `pdftotext` 抽取 → `grep` 定位关键词/定理名 → `Read` 命中页精读。本文件是"激活索引",不是替代品;需要精确陈述、证明或常数时,回原书核对。
134
+
135
+ 值得深读的真实章节:
136
+
137
+ - **§2.6 The singular value decomposition**——所有低秩压缩 / LoRA / PCA 的源头。
138
+ - **§4.2–4.3 Variational characterizations & eigenvalue inequalities**——Courant–Fischer min–max 与 Weyl 不等式,谱归一化与扰动界的理论根。
139
+ - **§5.6–5.8 Matrix norms & condition numbers**——数值稳定、梯度裁剪、预条件的判据全在这。
140
+ - **§7.3–7.5 Polar/SVD & the Schur product theorem**——Muon 正交化、PSD 核工程的直接出处。
141
+ - **§6.1–6.3 Geršgorin discs & perturbation theorems**——廉价谱定位与扰动鲁棒性。
142
+ - **§8.2–8.5 Perron–Frobenius theory**——行随机 attention、图传播、over-smoothing 分析。