学 AI 数学最崩溃的时刻,是读一篇论文看到一个公式,感觉”每个字都认识,连起来不知道在说什么”,然后开始怀疑:是不是我底子不够?这篇给你一个更真实的答案——AI 用到的所有数学,是一张从小学算术一路长上来的依赖网,中间没有任何跳步。 你卡住的地方,几乎总是某一个下层前置没补上,而不是”底子不够”这种模糊判决。下面把整张网摊开:六大主干、每股的主脊图与完整节点表,从最顶上的反向传播、注意力、扩散模型,一路拆到”计数”。
一个关键观念:它是网,不是梯子
很多人以为数学是一根梯子——一级级往上爬,爬不动就是”到顶了、能力不够”。
不对。数学是一张有向无环图(DAG)、一张网。一个高层概念(如”梯度”)同时依赖多个低层概念(“偏导数""向量”),而这些又各自往下依赖,且收敛共享:许多条链最后都踩在同一批基础(“函数""极限""分数”)上。
这个区别改变了”卡住”的含义:
梯子模型:卡住 = 爬不动 = 能力不够(不可修)。 网络模型:卡住 = 我要用的节点,某条前置边断了 = 有个更基础的点没真正掌握(可定位、可修复)。
你要做的不是”重学数学”,而是顺着断掉的边往下找,补上那个具体节点。
怎么读下面的内容
- 层级 L0–L8:L0 小学 → L8 AI 直接使用。层级是”认知难度序”,非严格标准。
- 每个节点:
**概念**(Ln)— 人话定义。 ← 直接前置。箭头←读作”需要先会”。 - 每股主干先给一张 mermaid 主脊图(箭头指向更基础的前置)作视觉锚点,随后是该主干完整节点表(按层)。
层级地图(L0 → L8)
| 层 | 大致对应 | 例子 |
|---|---|---|
| L0 | 小学 | 计数、加减乘除、分数、面积 |
| L1 | 小学高年级 | 负数、比与比例、幂、坐标平面 |
| L2 | 初中 | 变量、方程、函数、斜率、集合、计数原理 |
| L3 | 高中 | 指数/对数/三角函数、向量、排列组合、极限(直观) |
| L4 | 高中/大一 | 导数、积分、概率分布、矩阵初步 |
| L5 | 大学基础 | 多元微积分、线性代数核心、期望方差、贝叶斯 |
| L6 | 大学进阶 | 特征值、梯度/Hessian、协方差矩阵、凸函数 |
| L7 | 研究生/高级 | SVD、矩阵微积分、测度论、信息论、SGD 理论 |
| L8 | AI 直接使用 | 反向传播、注意力、交叉熵、扩散、策略梯度…… |
共享地基(L0–L2)
所有分支都站在这块地基上。
L0 · 小学
- 计数 — 数数、自然数。 ←(触底)
- 加法 — 合并数量。 ← 计数
- 减法 — 拿走/相差。 ← 加法
- 乘法 — 重复相加。 ← 加法
- 除法 — 平均分/包含除。 ← 乘法、减法
- 分数 — 部分与整体之比。 ← 除法
- 小数 — 十进制分数写法。 ← 分数、除法
- 运算顺序 — 先乘除后加减、括号优先。 ← 加减乘除
- 大小比较 — 大于/小于/等于。 ← 计数
- 图形与度量 — 长度、周长、面积、体积。 ← 加法、乘法
- 数轴 — 数在直线上的位置。 ← 计数、大小比较
L1 · 小学高年级
- 负数与整数 — 数轴向左延伸。 ← 数轴、减法
- 因数与倍数 — 整除、质数、公约/公倍。 ← 乘法、除法
- 比与比例 — a∶b、正反比。 ← 分数、除法
- 百分数 — 以 100 为分母的比。 ← 分数、比与比例
- 平均数 — 总和÷个数(期望的种子)。 ← 加法、除法
- 绝对值 — 到原点的距离。 ← 负数、数轴
- 幂(乘方) — 重复相乘、指数记法。 ← 乘法
- 平方根(直观) — 幂的逆、面积边长。 ← 幂、面积
- 坐标平面 — 有序数对定位点。 ← 数轴
L2 · 初中(代数与函数门槛)
- 变量与代数式 — 字母代数、代入求值。 ← 四则运算、比与比例
- 一元一次方程与不等式 — 解未知数、解集。 ← 变量、大小比较
- 函数(初步) — 一个输入对一个输出。 ← 变量、坐标平面
- 一次函数与斜率 — y=kx+b、变化率=Δy/Δx。 ← 函数、比与比例、坐标平面
- 多项式与因式分解 — 加减乘、拆成乘积。 ← 变量、幂
- 指数运算律 — 同底数幂相乘除、幂的幂。 ← 幂
- 根式 — 二次根号运算。 ← 平方根、指数运算律
- 集合(初步) — 元素、子集、并交补。 ← 大小比较
- 计数原理 — 分类相加、分步相乘。 ← 乘法、加法
- 平面几何与勾股定理 — a²+b²=c²。 ← 面积、平方根
- 相似与比例线段 — 图形放缩。 ← 比与比例、平面几何
主干① 线性代数
“数据即向量,变换即矩阵。”
flowchart TD
SVD["SVD / 低秩近似 (L7)"] --> EIG["特征分解 (L6)"]
SVD --> ORTH["正交/投影 (L6)"]
EIG --> DET["行列式 (L4)"]
EIG --> MV["矩阵-向量乘法 (L5)"]
ORTH --> DOT["点积 (L5)"]
MV --> MATMUL["矩阵乘法 (L5)"]
MATMUL --> DOT
MV --> LC["线性组合/张成 (L5)"]
LC --> VS["向量空间 (L5)"]
DOT --> VEC["向量 (L3)"]
VS --> VEC
DET --> SYS["方程组 (L4)"]
VEC --> COORD["坐标平面 (L1)"]
SYS --> EQ["一次方程 (L2)"]
DOT --> MULADD["乘法+加法 (L0)"]
MULADD --> COUNT["计数 (L0)"]
L3–L4 预备
- 平面向量(L3)— 有方向有大小、加法与数乘。 ← 坐标平面、一次函数
- 空间向量(L3)— 推广到三维。 ← 平面向量
- 多元一次方程组(L4)— 多个线性约束联立。 ← 一元一次方程
- 行列式(2×2/3×3)(L4)— 面积/体积的有向缩放因子。 ← 方程组、乘法
L5 核心
- 向量空间(L5)— 加法与数乘封闭的集合。 ← 空间向量、集合
- 线性组合/张成(L5)— 一组向量拼出的全部。 ← 向量空间
- 线性相关/无关(L5)— 有无冗余。 ← 线性组合
- 基与维数(L5)— 最小生成集。 ← 张成、线性无关
- 矩阵(L5)— 数的阵列、线性映射表示。 ← 方程组、向量
- 矩阵加法与数乘(L5)— 逐元素运算。 ← 矩阵、向量加法
- 矩阵乘法(L5)— 行乘列、复合映射。 ← 矩阵、点积
- 点积(内积)(L5)— 对应分量相乘再加、衡量相似。 ← 向量、乘法+加法
- 矩阵-向量乘法(线性变换)(L5)— 矩阵把向量映到向量。 ← 矩阵乘法、线性组合
- 单位矩阵与逆矩阵(L5)— 变换的”1”与”撤销”。 ← 矩阵乘法、行列式
- 转置(L5)— 行列互换。 ← 矩阵
- 高斯消元(L5)— 解 Ax=b。 ← 矩阵-向量乘法、逆矩阵
L6 进阶
- 秩(L6)— 独立信息的维数。 ← 基与维数、线性无关
- 零空间/列空间(L6)— 解结构与像空间。 ← 张成、秩
- 向量范数(L1/L2/∞)(L6)— 向量长度度量。 ← 点积、平方根
- 矩阵范数(L6)— 矩阵大小。 ← 向量范数
- 正交与正交基(L6)— 互相垂直、点积为零。 ← 点积、基与维数
- 投影(L6)— 把向量压到子空间。 ← 点积、正交
- 格拉姆-施密特(L6)— 造正交基。 ← 正交、投影
- 特征值与特征向量(L6)— 变换下只缩放不改向的方向。 ← 矩阵-向量乘法、行列式、方程组
- 特征分解(对角化)(L6)— 用特征向量拆矩阵。 ← 特征值、逆矩阵、基
- 二次型(L6)— xᵀAx 形式的多元二次函数。 ← 矩阵-向量乘法、点积
- 对称/正定·半正定(PSD)(L6)— 特征值实/非负、二次型≥0。 ← 特征值、转置、二次型
L7 高级
- 奇异值分解(SVD)(L7)— 任意矩阵拆成 UΣVᵀ。 ← 特征分解、正交、PSD
- 低秩近似(L7)— 用少数奇异值逼近(LoRA/压缩之根)。 ← SVD、秩
- Moore-Penrose 伪逆(L7)— 非方阵的广义逆、最小二乘解。 ← SVD、投影
- 矩阵微积分(L7)— 对向量/矩阵求导的矩阵写法。 ← 偏导数、矩阵乘法
- 张量与张量运算(L7)— 多维数组、广播、爱因斯坦求和。 ← 矩阵、向量空间
- 谱分解与谱范数(L7)— 从特征/奇异值看性质。 ← 特征分解、SVD
主干② 微积分与分析
“变化""逼近""连续”的语言——梯度的来源。
flowchart TD
BP["多元链式法则=反向传播 (L8)"] --> CHAIN["链式法则 (L5)"]
BP --> PARTIAL["偏导数 (L6)"]
PARTIAL --> DERIV["导数 (L5)"]
CHAIN --> DERIV
CHAIN --> COMP["函数复合 (L3)"]
DERIV --> LIM["极限 (L5)"]
DERIV --> SLOPE["斜率 (L2)"]
LIM --> SEQ["数列 (L3)"]
LIM --> FUNC["函数 (L2)"]
SLOPE --> RATIO["比与除法 (L1)"]
FUNC --> VAR2["变量 (L2)"]
RATIO --> FRAC["分数 (L0)"]
FRAC --> DIV["除法 (L0)"]
DIV --> COUNT2["计数 (L0)"]
L3–L4 预备
- 二次函数与抛物线(L3)— 极值最初直觉。 ← 多项式、函数
- 指数函数(L3)— aˣ、增长/衰减。 ← 指数运算律、函数
- 对数函数(L3)— 指数的逆、log。 ← 指数函数、反函数
- 三角函数(L3)— sin/cos/tan、周期(傅里叶、位置编码之种)。 ← 相似、坐标平面
- 函数复合与反函数(L3)— f(g(x))、互逆。 ← 函数
- 数列与级数(L3)— 有序数、求和 Σ。 ← 函数、加法
- 极限(直观)(L3)— 无限逼近。 ← 数列、函数
L5 核心
- 极限(严格 ε-δ)(L5)— 逼近的形式化。 ← 极限(直观)、不等式
- 连续性(L5)— 无断裂。 ← 极限(严格)
- 导数(微分)(L5)— 瞬时变化率=切线斜率。 ← 极限、斜率
- 求导法则(L5)— 和/积/商/幂的基本导数。 ← 导数、多项式
- 链式法则(L5)— 复合函数求导(反传心脏)。 ← 导数、函数复合
- 不定/定积分(L5)— 反导数、曲线下面积。 ← 导数、极限、面积
- 微积分基本定理(L5)— 积分与微分互逆。 ← 定积分、导数
- 泰勒展开(L5)— 用多项式局部逼近。 ← 高阶导数、级数
L6 多元与进阶
- 多元函数(L6)— 多输入函数。 ← 函数、向量空间
- 偏导数(L6)— 固定其他变量求导。 ← 导数、多元函数
- 梯度 ∇f(L6)— 各偏导组成的向量、最速上升方向。 ← 偏导数、向量
- 多元链式法则(L6)— 复合多元求导(反传完整形式)。 ← 链式法则、偏导数
- 雅可比矩阵(L6)— 向量值函数的一阶导矩阵。 ← 偏导数、矩阵
- 黑塞矩阵 Hessian(L6)— 二阶偏导矩阵、曲率。 ← 偏导数、矩阵、二次型
- 方向导数(L6)— 沿任意方向的变化率。 ← 梯度、点积
- 多元泰勒展开(L6)— 梯度+Hessian 局部逼近。 ← 泰勒展开、梯度、Hessian
L7 分析深水区
- 实分析基础(L7)— 收敛、上确界、柯西列。 ← 极限(严格)、集合
- Lipschitz 连续(L7)— 变化速度有界。 ← 连续性、范数
- 内积空间与希尔伯特空间(L7)— 带内积的(可无限维)向量空间。 ← 点积、向量空间、收敛
- 常微分方程 ODE(L7)— 含导数的方程、连续动态(Neural ODE)。 ← 导数、积分
- 随机微分方程 SDE(直观)(L7)— 带噪声的 ODE(扩散模型)。 ← ODE、随机过程
- 傅里叶分析(L7)— 函数分解为频率(卷积定理、谱方法)。 ← 三角函数、积分、级数
主干③ 概率与统计
不确定性的语言——损失函数与生成模型的根。
flowchart TD
MLE["最大似然/交叉熵 (L8)"] --> EXP["期望 (L5)"]
MLE --> DIST["概率分布 (L5)"]
MVN["多元正态/协方差矩阵 (L6)"] --> COV["协方差 (L6)"]
COV --> EXP
EXP --> AVG["平均数 (L1)"]
DIST --> RV["随机变量 (L4)"]
RV --> PROB["古典概率 (L3)"]
MLE --> BAYES["贝叶斯定理 (L5)"]
BAYES --> COND["条件概率 (L5)"]
COND --> AXIOM["概率公理 (L5)"]
AXIOM --> PROB
PROB --> COMB["排列组合 (L3)"]
COMB --> CP["计数原理 (L2)"]
AVG --> DIV3["除法 (L0)"]
CP --> MUL3["乘法 (L0)"]
DIV3 --> COUNT3["计数 (L0)"]
L3–L4 预备
- 排列与组合(L3)— 有序/无序选取计数。 ← 计数原理、乘法
- 古典概率(L3)— 等可能事件的比值。 ← 排列组合、比与比例
- 频率与统计图表(L3)— 用数据估计概率。 ← 百分数、平均数
- 随机变量(初步)(L4)— 把随机结果映射成数。 ← 古典概率、函数
L5 核心
- 概率公理与样本空间(L5)— 事件与概率规则。 ← 集合、古典概率
- 条件概率(L5)— P(A|B)。 ← 概率公理
- 独立性(L5)— 互不影响。 ← 条件概率
- 贝叶斯定理(L5)— 用证据更新信念。 ← 条件概率
- 离散分布(L5)— 伯努利、二项、泊松、类别。 ← 随机变量、概率公理
- 连续随机变量与密度(L5)— 密度函数、积分求概率。 ← 随机变量、定积分
- 期望(均值)(L5)— 加权平均、长期平均。 ← 平均数、随机变量、求和/积分
- 方差与标准差(L5)— 离散程度。 ← 期望、平方
- 常见连续分布(L5)— 均匀、指数、正态。 ← 密度函数、指数函数
- 联合/边缘/条件分布(L5)— 多变量概率结构。 ← 条件概率、多元函数
L6 多变量与统计
- 协方差与相关系数(L6)— 两变量共同变化。 ← 期望、方差
- 协方差矩阵(L6)— 多变量协方差矩阵。 ← 协方差、矩阵、PSD
- 多元正态 MVN(L6)— 高维高斯、椭球等高线。 ← 协方差矩阵、二次型、正态
- 大数定律与中心极限定理(L6)— 均值趋近期望、和趋近正态。 ← 期望、方差、收敛
- 点估计(L6)— 用样本估参数。 ← 期望、抽样
- 最大似然估计 MLE(L6)— 选让数据最可能的参数。 ← 概率分布、对数、优化
- 偏差-方差分解(L6)— 估计误差的两来源。 ← 期望、方差
L7 高级概率
- 测度论概率(L7)— σ-代数、测度、勒贝格积分(严格地基)。 ← 集合、实分析、积分
- 指数族分布(L7)— 统一伯努利/高斯/类别。 ← 常见分布、对数、内积
- 随机过程与马尔可夫链(L7)— 随时间演化、无记忆性(RL/MCMC/扩散)。 ← 条件概率、随机变量
- 贝叶斯推断与后验(L7)— 先验×似然→后验。 ← 贝叶斯定理、MLE
- 蒙特卡洛与采样(L7)— 用随机样本估期望(重要性/Gibbs)。 ← 期望、随机变量、大数定律
- 集中不等式(L7)— Markov/Chebyshev/Hoeffding(泛化界)。 ← 期望、方差
- Fisher 信息与信息几何(L7)— 参数空间曲率、自然梯度。 ← 期望、Hessian、对数似然
主干④ 优化
“把损失降到最低”的机器——踩在微积分+线性代数上。
flowchart TD
ADAM["SGD/Adam (L7)"] --> GD["梯度下降 (L5)"]
KKT["对偶/KKT (L7)"] --> LAG["拉格朗日乘子 (L7)"]
GD --> GRAD["梯度 (L6)"]
GD --> FOC["驻点 ∇f=0 (L5)"]
LAG --> FOC
ADAM --> VARIANCE["方差 (L5)"]
FOC --> GRAD
KKT --> CONVEX["凸函数 (L6)"]
CONVEX --> INEQ["不等式 (L2)"]
GRAD --> PARTIAL2["偏导数 (L6)"]
PARTIAL2 --> DERIV2["导数 (L5)"]
L5–L6
- 极值(最大/最小)(L5)— 函数峰谷。 ← 二次函数、导数
- 一阶条件(驻点 ∇f=0)(L5)— 极值候选点。 ← 梯度
- 二阶条件(Hessian 判凹凸)(L6)— 判极小/极大/鞍点。 ← Hessian、PSD
- 凸集与凸函数(L6)— 局部最优即全局最优。 ← 不等式、二次型
- 梯度下降(L5)— 沿负梯度下山。 ← 梯度、一阶条件
- 学习率与步长(L5)— 每步走多远。 ← 梯度下降
- 最小二乘(L6)— 最小化平方误差、有闭式解。 ← 二次型、伪逆、一阶条件
L7 高级优化
- 随机梯度下降 SGD(L7)— 小批量估梯度、可扩展。 ← 梯度下降、期望、蒙特卡洛
- 动量 / Nesterov(L7)— 累积历史梯度加速。 ← SGD、向量加法
- 自适应方法(AdaGrad/RMSProp/Adam/AdamW)(L7)— 每维自适应步长。 ← SGD、动量、方差
- 牛顿法与拟牛顿(L-BFGS)(L7)— 用二阶信息加速。 ← Hessian、多元泰勒
- 约束优化与拉格朗日乘子(L7)— 带约束求极值。 ← 一阶条件、梯度
- 对偶性与 KKT(L7)— 原/对偶、约束最优判据。 ← 拉格朗日乘子、凸函数
- 凸优化理论(L7)— 可解性与收敛保证。 ← 凸函数、对偶性
- 非凸景观(鞍点/局部极小)(L7)— 深度学习的现实地形。 ← 二阶条件、Hessian
主干⑤ 信息论
“惊讶/不确定性”的度量——交叉熵损失、KL 的家。
flowchart TD
KL["KL 散度 (L7)"] --> CE["交叉熵 (L7)"]
KL --> JENSEN["Jensen 不等式 (L7)"]
CE --> ENT["熵 (L6)"]
ENT --> SI["自信息 (L6)"]
ENT --> EXP2["期望 (L5)"]
SI --> LOG["对数 (L3)"]
SI --> PROB2["概率 (L3)"]
JENSEN --> CONVEX2["凸函数 (L6)"]
LOG --> EXPF["指数函数 (L3)"]
EXPF --> POW["幂 (L1)"]
POW --> MUL4["乘法 (L0)"]
L6–L7
- 自信息(-log p)(L6)— 一个事件多”意外”。 ← 对数、概率
- 熵(Entropy)(L6)— 分布的平均不确定性。 ← 自信息、期望
- 联合熵/条件熵(L6)— 多变量不确定性。 ← 熵、联合分布
- Jensen 不等式(L7)— 凸函数下 E[f(X)]≥f(E[X])。 ← 凸函数、期望
- 交叉熵(L7)— 用 q 编码来自 p 的数据的平均代价。 ← 熵、期望、对数
- KL 散度(相对熵)(L7)— 两分布差异、≥0。 ← 交叉熵、熵、Jensen
- 互信息(L7)— 两变量共享的信息。 ← 熵、条件熵、KL
- 困惑度 Perplexity(L7)— 交叉熵的指数、语言模型指标。 ← 交叉熵、指数函数
- 证据下界 ELBO(L7)— 变分推断对 log 似然的下界(VAE)。 ← KL、Jensen、期望
主干⑥ 离散数学 · 图论 · 逻辑 · 博弈 · 数值
flowchart TD
GNN["图神经网络 (L8)"] --> ADJ["邻接/拉普拉斯矩阵 (L6)"]
GAN["GAN minimax (L8)"] --> GAME["博弈论/纳什 (L6)"]
RL["Bellman/动态规划 (L8)"] --> DP["动态规划 (L6)"]
ADJ --> GRAPH["图 (L4)"]
DP --> REC["递归 (L4)"]
GAME --> PROB3["概率 (L3)"]
GRAPH --> SET["集合 (L2)"]
REC --> SEQ2["数列 (L3)"]
SET --> COMPARE["数量比较 (L0)"]
L2–L6
- 命题逻辑与布尔代数(L2)— 与/或/非、真值。 ← 集合
- 谓词与量词(L3)— ∀/∃。 ← 命题逻辑
- 关系与映射(L3)— 集合间对应、等价关系。 ← 集合、函数
- 图(顶点+边)(L4)— 关系的网络结构。 ← 集合、关系
- 树与有向无环图 DAG(L4)— 无环层级/依赖。 ← 图
- 邻接/拉普拉斯矩阵(L6)— 用矩阵表示图(GNN/谱聚类)。 ← 图、矩阵
- 组合计数进阶(L4)— 容斥、递推、生成函数。 ← 排列组合、数列
- 递归与数学归纳法(L4)— 自我调用、逐级证明。 ← 数列、谓词逻辑
- 计算复杂度(大O、P/NP)(L6)— 资源增长阶。 ← 函数、极限、组合计数
- 博弈论(minimax、纳什均衡)(L6)— 多方策略均衡(GAN/多智能体)。 ← 概率、优化
- 动态规划与 Bellman 方程(L6)— 最优子结构、递归求最优(RL)。 ← 递归、期望、优化
- 数值计算(浮点、误差、条件数)(L6)— 有限精度稳定性。 ← 小数、幂、范数
- 数值稳定技巧(log-sum-exp、softmax 稳定化)(L7)— 防上溢/下溢。 ← 对数、指数、浮点
顶层 L8:AI 用到的数学全覆盖
上面六股汇合于此。下面按 AI 子领域列出顶层清单——力求不遗漏 AI 涉及的数学,每项标注它直接踩在哪些前置上(这些前置在上文都已展开到小学)。
通用深度学习引擎
- 自动微分/计算图 ← 多元链式法则、DAG、雅可比
- 反向传播 ← 多元链式法则、矩阵乘法、雅可比
- 梯度下降家族(SGD/动量/Adam/AdamW) ← SGD、自适应方法、动量
- 均方误差 MSE ← 最小二乘、期望
- 交叉熵/负对数似然 ← 交叉熵、MLE、对数
- Softmax ← 指数函数、类别分布、数值稳定化
- 激活函数(Sigmoid/tanh/ReLU) ← 指数函数、分段函数、导数
- 权重初始化(Xavier/He) ← 方差、正态分布
- 梯度裁剪/学习率调度 ← 范数、梯度下降
架构数学
- 仿射层(全连接) ← 矩阵-向量乘法、向量加法
- 卷积(CNN) ← 卷积(傅里叶)、点积、张量运算
- 傅里叶/谱视角(卷积定理) ← 傅里叶分析
- RNN/LSTM 序列动态 ← 函数复合、离散动态、链式法则
- 注意力(scaled dot-product) ← 点积、矩阵乘法、Softmax、范数缩放
- 多头注意力 ← 注意力、张量运算、线性变换
- 位置编码(正弦/RoPE) ← 三角函数、向量、复数旋转
- 归一化(Batch/Layer/RMSNorm) ← 期望、方差、标准差
- Dropout ← 伯努利分布、期望
- 嵌入与表示空间 ← 向量空间、点积、范数
- 低秩适配 LoRA ← 低秩近似、SVD、矩阵乘法
概率与生成模型
- 最大似然(训练的概率解释) ← MLE、对数、SGD
- 最大后验 MAP 与正则化 ← 贝叶斯推断、MLE
- VAE/变分推断 ← ELBO、KL、重参数化、MVN
- 重参数化技巧 ← 随机变量变换、期望、链式法则
- GAN ← 博弈论 minimax、KL/JS 散度、纳什均衡
- 扩散/分数匹配 ← 随机微分方程、马尔可夫链、高斯、分数函数 ∇log p
- 归一化流 ← 变量替换、雅可比行列式、可逆函数
- MCMC ← 马尔可夫链、蒙特卡洛采样、条件概率
- 高斯过程 ← MVN、协方差核、贝叶斯推断
强化学习
- 马尔可夫决策过程 MDP ← 马尔可夫链、条件概率、期望
- Bellman 方程/动态规划 ← 动态规划、期望、递归
- 价值函数/Q学习/时序差分 TD ← 期望、Bellman、随机逼近
- 策略梯度(REINFORCE) ← 期望、对数导数技巧、梯度、蒙特卡洛
- Actor-Critic/优势函数 ← 价值函数、策略梯度、方差缩减
- 信赖域/PPO/GRPO ← KL 散度、约束优化、优势估计
经典 ML 与核方法
- 线性回归 ← 最小二乘、伪逆、期望
- 逻辑回归 ← Sigmoid、交叉熵、MLE、凸优化
- 正则化(L1/L2、岭/LASSO) ← 向量范数、约束优化、MAP
- 主成分分析 PCA ← 协方差矩阵、特征分解/SVD、投影
- 支持向量机 SVM ← 凸优化、拉格朗日对偶、KKT、几何间隔
- 核方法/核技巧 ← 内积空间、RKHS、Mercer 定理
- 再生核希尔伯特空间 RKHS ← 希尔伯特空间、内积、正定核
- 决策树/集成(信息增益) ← 熵、互信息、期望
图学习
- 图神经网络 GNN ← 图、邻接矩阵、矩阵乘法
- 谱图方法/图拉普拉斯 ← 拉普拉斯矩阵、特征分解、傅里叶
统计学习理论(为什么能泛化)
- 经验风险最小化 ERM ← 期望、损失函数、优化
- 偏差-方差权衡 ← 偏差-方差分解、期望
- VC 维/Rademacher/泛化界 ← 集中不等式、组合计数、上确界
- PAC 学习 ← 概率、复杂度、集中不等式
- 双下降/过参数化 ← 泛化界、范数、优化景观
数值 · 信息几何 · 前沿粘合剂
- 数值稳定与混合精度 ← 浮点、log-sum-exp、条件数
- Fisher 信息与自然梯度 ← Fisher 信息、Hessian、KL 二阶近似
- 神经正切核 NTK ← 泰勒展开、核方法、梯度流
- 神经 ODE/连续深度 ← 常微分方程、雅可比、自动微分
四条完整纵切:亲眼看它”不跳步”
抽四个顶层终点,各拉一条一路到 L0 的链,中间每步都咬合:
① 反向传播 ← 多元链式法则 ← 链式法则 ← 导数 ← 极限 ← 函数/数列 ← 坐标平面 ← 数轴 ← 计数
② 交叉熵损失 ← 熵 ← 自信息 ← 对数 ← 指数函数 ← 幂 ← 乘法 ← 计数(另一条腿:期望 ← 平均数 ← 除法;概率 ← 排列组合 ← 计数原理)
③ 注意力 ← 点积(← 乘法+加法)+ Softmax(← 指数函数 ← 幂)+ 矩阵乘法(← 点积)+ 缩放(← 平方根 ← 面积)→ 全部落到 计数
④ PCA / LoRA ← 协方差矩阵(← 协方差 ← 期望 ← 平均数 ← 除法)+ 特征分解(← 行列式 ← 方程组 ← 一次方程 ← 变量 ← 四则运算)→ 计数
四个跨越几十年、看起来毫不相干的 AI 技术,最后都收敛到同一个地基:你小学一年级学的数数。
所以,下次卡住时
把”我是不是底子不够”换成一个可执行动作:
- 定位那个让你懵的数学点,在这张图的哪一层、哪股主干。
- 看它的直接前置(箭头指向的那些)你是否真的会。
- 顺着断掉的边往下走,直到踩到一个你确实扎实的节点。
- 从那里往上补——补的往往不是”一整门数学”,而是一两个具体节点。
“听不懂”不是能力的判决,是地图上一个待补的坐标。你不缺天赋,缺的只是一张标好依赖关系的地图——现在你有了。
延伸阅读:这张图讲的是 AI 的数学地基;如果你想要的是俯瞰 AI 思想的地图,看姊妹篇《站在 AI 的山巅:一句话 + 12 条原理》。想看这些数学和原理如何在一篇真实论文里合体,看《不教,只给激励:DeepSeek-R1 如何让大模型自己长出推理能力》。