AI 数学全景拆解:从研究前沿一路拆到小学算术,不跳步(完整节点版)

把 AI 用到的全部数学,从最高层一层层往下拆,每个概念只连它真正的直接前置,中间绝不跳步,一直拆到小学的加减乘除。六大主干(线性代数/微积分/概率统计/优化/信息论/离散)各附主脊图与完整节点表,顶层覆盖 AI 各子领域用到的数学——并解释为什么"听不懂"几乎总是某个下层前置没补上,而不是你不行。

学 AI 数学最崩溃的时刻,是读一篇论文看到一个公式,感觉”每个字都认识,连起来不知道在说什么”,然后开始怀疑:是不是我底子不够?这篇给你一个更真实的答案——AI 用到的所有数学,是一张从小学算术一路长上来的依赖网,中间没有任何跳步。 你卡住的地方,几乎总是某一个下层前置没补上,而不是”底子不够”这种模糊判决。下面把整张网摊开:六大主干、每股的主脊图与完整节点表,从最顶上的反向传播、注意力、扩散模型,一路拆到”计数”。

一个关键观念:它是网,不是梯子

很多人以为数学是一根梯子——一级级往上爬,爬不动就是”到顶了、能力不够”。

不对。数学是一张有向无环图(DAG)、一张网。一个高层概念(如”梯度”)同时依赖多个低层概念(“偏导数""向量”),而这些又各自往下依赖,且收敛共享:许多条链最后都踩在同一批基础(“函数""极限""分数”)上。

这个区别改变了”卡住”的含义:

梯子模型:卡住 = 爬不动 = 能力不够(不可修)。 网络模型:卡住 = 我要用的节点,某条前置边断了 = 有个更基础的点没真正掌握(可定位、可修复)。

你要做的不是”重学数学”,而是顺着断掉的边往下找,补上那个具体节点。

怎么读下面的内容

  • 层级 L0–L8:L0 小学 → L8 AI 直接使用。层级是”认知难度序”,非严格标准。
  • 每个节点**概念**(Ln)— 人话定义。 ← 直接前置。箭头 读作”需要先会”。
  • 每股主干先给一张 mermaid 主脊图(箭头指向更基础的前置)作视觉锚点,随后是该主干完整节点表(按层)。

层级地图(L0 → L8)

大致对应例子
L0小学计数、加减乘除、分数、面积
L1小学高年级负数、比与比例、幂、坐标平面
L2初中变量、方程、函数、斜率、集合、计数原理
L3高中指数/对数/三角函数、向量、排列组合、极限(直观)
L4高中/大一导数、积分、概率分布、矩阵初步
L5大学基础多元微积分、线性代数核心、期望方差、贝叶斯
L6大学进阶特征值、梯度/Hessian、协方差矩阵、凸函数
L7研究生/高级SVD、矩阵微积分、测度论、信息论、SGD 理论
L8AI 直接使用反向传播、注意力、交叉熵、扩散、策略梯度……

共享地基(L0–L2)

所有分支都站在这块地基上。

L0 · 小学

  • 计数 — 数数、自然数。 ←(触底)
  • 加法 — 合并数量。 ← 计数
  • 减法 — 拿走/相差。 ← 加法
  • 乘法 — 重复相加。 ← 加法
  • 除法 — 平均分/包含除。 ← 乘法、减法
  • 分数 — 部分与整体之比。 ← 除法
  • 小数 — 十进制分数写法。 ← 分数、除法
  • 运算顺序 — 先乘除后加减、括号优先。 ← 加减乘除
  • 大小比较 — 大于/小于/等于。 ← 计数
  • 图形与度量 — 长度、周长、面积、体积。 ← 加法、乘法
  • 数轴 — 数在直线上的位置。 ← 计数、大小比较

L1 · 小学高年级

  • 负数与整数 — 数轴向左延伸。 ← 数轴、减法
  • 因数与倍数 — 整除、质数、公约/公倍。 ← 乘法、除法
  • 比与比例 — a∶b、正反比。 ← 分数、除法
  • 百分数 — 以 100 为分母的比。 ← 分数、比与比例
  • 平均数 — 总和÷个数(期望的种子)。 ← 加法、除法
  • 绝对值 — 到原点的距离。 ← 负数、数轴
  • 幂(乘方) — 重复相乘、指数记法。 ← 乘法
  • 平方根(直观) — 幂的逆、面积边长。 ← 幂、面积
  • 坐标平面 — 有序数对定位点。 ← 数轴

L2 · 初中(代数与函数门槛)

  • 变量与代数式 — 字母代数、代入求值。 ← 四则运算、比与比例
  • 一元一次方程与不等式 — 解未知数、解集。 ← 变量、大小比较
  • 函数(初步) — 一个输入对一个输出。 ← 变量、坐标平面
  • 一次函数与斜率 — y=kx+b、变化率=Δy/Δx。 ← 函数、比与比例、坐标平面
  • 多项式与因式分解 — 加减乘、拆成乘积。 ← 变量、幂
  • 指数运算律 — 同底数幂相乘除、幂的幂。 ← 幂
  • 根式 — 二次根号运算。 ← 平方根、指数运算律
  • 集合(初步) — 元素、子集、并交补。 ← 大小比较
  • 计数原理 — 分类相加、分步相乘。 ← 乘法、加法
  • 平面几何与勾股定理 — a²+b²=c²。 ← 面积、平方根
  • 相似与比例线段 — 图形放缩。 ← 比与比例、平面几何

主干① 线性代数

“数据即向量,变换即矩阵。”

flowchart TD
    SVD["SVD / 低秩近似 (L7)"] --> EIG["特征分解 (L6)"]
    SVD --> ORTH["正交/投影 (L6)"]
    EIG --> DET["行列式 (L4)"]
    EIG --> MV["矩阵-向量乘法 (L5)"]
    ORTH --> DOT["点积 (L5)"]
    MV --> MATMUL["矩阵乘法 (L5)"]
    MATMUL --> DOT
    MV --> LC["线性组合/张成 (L5)"]
    LC --> VS["向量空间 (L5)"]
    DOT --> VEC["向量 (L3)"]
    VS --> VEC
    DET --> SYS["方程组 (L4)"]
    VEC --> COORD["坐标平面 (L1)"]
    SYS --> EQ["一次方程 (L2)"]
    DOT --> MULADD["乘法+加法 (L0)"]
    MULADD --> COUNT["计数 (L0)"]

L3–L4 预备

  • 平面向量(L3)— 有方向有大小、加法与数乘。 ← 坐标平面、一次函数
  • 空间向量(L3)— 推广到三维。 ← 平面向量
  • 多元一次方程组(L4)— 多个线性约束联立。 ← 一元一次方程
  • 行列式(2×2/3×3)(L4)— 面积/体积的有向缩放因子。 ← 方程组、乘法

L5 核心

  • 向量空间(L5)— 加法与数乘封闭的集合。 ← 空间向量、集合
  • 线性组合/张成(L5)— 一组向量拼出的全部。 ← 向量空间
  • 线性相关/无关(L5)— 有无冗余。 ← 线性组合
  • 基与维数(L5)— 最小生成集。 ← 张成、线性无关
  • 矩阵(L5)— 数的阵列、线性映射表示。 ← 方程组、向量
  • 矩阵加法与数乘(L5)— 逐元素运算。 ← 矩阵、向量加法
  • 矩阵乘法(L5)— 行乘列、复合映射。 ← 矩阵、点积
  • 点积(内积)(L5)— 对应分量相乘再加、衡量相似。 ← 向量、乘法+加法
  • 矩阵-向量乘法(线性变换)(L5)— 矩阵把向量映到向量。 ← 矩阵乘法、线性组合
  • 单位矩阵与逆矩阵(L5)— 变换的”1”与”撤销”。 ← 矩阵乘法、行列式
  • 转置(L5)— 行列互换。 ← 矩阵
  • 高斯消元(L5)— 解 Ax=b。 ← 矩阵-向量乘法、逆矩阵

L6 进阶

  • (L6)— 独立信息的维数。 ← 基与维数、线性无关
  • 零空间/列空间(L6)— 解结构与像空间。 ← 张成、秩
  • 向量范数(L1/L2/∞)(L6)— 向量长度度量。 ← 点积、平方根
  • 矩阵范数(L6)— 矩阵大小。 ← 向量范数
  • 正交与正交基(L6)— 互相垂直、点积为零。 ← 点积、基与维数
  • 投影(L6)— 把向量压到子空间。 ← 点积、正交
  • 格拉姆-施密特(L6)— 造正交基。 ← 正交、投影
  • 特征值与特征向量(L6)— 变换下只缩放不改向的方向。 ← 矩阵-向量乘法、行列式、方程组
  • 特征分解(对角化)(L6)— 用特征向量拆矩阵。 ← 特征值、逆矩阵、基
  • 二次型(L6)— xᵀAx 形式的多元二次函数。 ← 矩阵-向量乘法、点积
  • 对称/正定·半正定(PSD)(L6)— 特征值实/非负、二次型≥0。 ← 特征值、转置、二次型

L7 高级

  • 奇异值分解(SVD)(L7)— 任意矩阵拆成 UΣVᵀ。 ← 特征分解、正交、PSD
  • 低秩近似(L7)— 用少数奇异值逼近(LoRA/压缩之根)。 ← SVD、秩
  • Moore-Penrose 伪逆(L7)— 非方阵的广义逆、最小二乘解。 ← SVD、投影
  • 矩阵微积分(L7)— 对向量/矩阵求导的矩阵写法。 ← 偏导数、矩阵乘法
  • 张量与张量运算(L7)— 多维数组、广播、爱因斯坦求和。 ← 矩阵、向量空间
  • 谱分解与谱范数(L7)— 从特征/奇异值看性质。 ← 特征分解、SVD

主干② 微积分与分析

“变化""逼近""连续”的语言——梯度的来源。

flowchart TD
    BP["多元链式法则=反向传播 (L8)"] --> CHAIN["链式法则 (L5)"]
    BP --> PARTIAL["偏导数 (L6)"]
    PARTIAL --> DERIV["导数 (L5)"]
    CHAIN --> DERIV
    CHAIN --> COMP["函数复合 (L3)"]
    DERIV --> LIM["极限 (L5)"]
    DERIV --> SLOPE["斜率 (L2)"]
    LIM --> SEQ["数列 (L3)"]
    LIM --> FUNC["函数 (L2)"]
    SLOPE --> RATIO["比与除法 (L1)"]
    FUNC --> VAR2["变量 (L2)"]
    RATIO --> FRAC["分数 (L0)"]
    FRAC --> DIV["除法 (L0)"]
    DIV --> COUNT2["计数 (L0)"]

L3–L4 预备

  • 二次函数与抛物线(L3)— 极值最初直觉。 ← 多项式、函数
  • 指数函数(L3)— aˣ、增长/衰减。 ← 指数运算律、函数
  • 对数函数(L3)— 指数的逆、log。 ← 指数函数、反函数
  • 三角函数(L3)— sin/cos/tan、周期(傅里叶、位置编码之种)。 ← 相似、坐标平面
  • 函数复合与反函数(L3)— f(g(x))、互逆。 ← 函数
  • 数列与级数(L3)— 有序数、求和 Σ。 ← 函数、加法
  • 极限(直观)(L3)— 无限逼近。 ← 数列、函数

L5 核心

  • 极限(严格 ε-δ)(L5)— 逼近的形式化。 ← 极限(直观)、不等式
  • 连续性(L5)— 无断裂。 ← 极限(严格)
  • 导数(微分)(L5)— 瞬时变化率=切线斜率。 ← 极限、斜率
  • 求导法则(L5)— 和/积/商/幂的基本导数。 ← 导数、多项式
  • 链式法则(L5)— 复合函数求导(反传心脏)。 ← 导数、函数复合
  • 不定/定积分(L5)— 反导数、曲线下面积。 ← 导数、极限、面积
  • 微积分基本定理(L5)— 积分与微分互逆。 ← 定积分、导数
  • 泰勒展开(L5)— 用多项式局部逼近。 ← 高阶导数、级数

L6 多元与进阶

  • 多元函数(L6)— 多输入函数。 ← 函数、向量空间
  • 偏导数(L6)— 固定其他变量求导。 ← 导数、多元函数
  • 梯度 ∇f(L6)— 各偏导组成的向量、最速上升方向。 ← 偏导数、向量
  • 多元链式法则(L6)— 复合多元求导(反传完整形式)。 ← 链式法则、偏导数
  • 雅可比矩阵(L6)— 向量值函数的一阶导矩阵。 ← 偏导数、矩阵
  • 黑塞矩阵 Hessian(L6)— 二阶偏导矩阵、曲率。 ← 偏导数、矩阵、二次型
  • 方向导数(L6)— 沿任意方向的变化率。 ← 梯度、点积
  • 多元泰勒展开(L6)— 梯度+Hessian 局部逼近。 ← 泰勒展开、梯度、Hessian

L7 分析深水区

  • 实分析基础(L7)— 收敛、上确界、柯西列。 ← 极限(严格)、集合
  • Lipschitz 连续(L7)— 变化速度有界。 ← 连续性、范数
  • 内积空间与希尔伯特空间(L7)— 带内积的(可无限维)向量空间。 ← 点积、向量空间、收敛
  • 常微分方程 ODE(L7)— 含导数的方程、连续动态(Neural ODE)。 ← 导数、积分
  • 随机微分方程 SDE(直观)(L7)— 带噪声的 ODE(扩散模型)。 ← ODE、随机过程
  • 傅里叶分析(L7)— 函数分解为频率(卷积定理、谱方法)。 ← 三角函数、积分、级数

主干③ 概率与统计

不确定性的语言——损失函数与生成模型的根。

flowchart TD
    MLE["最大似然/交叉熵 (L8)"] --> EXP["期望 (L5)"]
    MLE --> DIST["概率分布 (L5)"]
    MVN["多元正态/协方差矩阵 (L6)"] --> COV["协方差 (L6)"]
    COV --> EXP
    EXP --> AVG["平均数 (L1)"]
    DIST --> RV["随机变量 (L4)"]
    RV --> PROB["古典概率 (L3)"]
    MLE --> BAYES["贝叶斯定理 (L5)"]
    BAYES --> COND["条件概率 (L5)"]
    COND --> AXIOM["概率公理 (L5)"]
    AXIOM --> PROB
    PROB --> COMB["排列组合 (L3)"]
    COMB --> CP["计数原理 (L2)"]
    AVG --> DIV3["除法 (L0)"]
    CP --> MUL3["乘法 (L0)"]
    DIV3 --> COUNT3["计数 (L0)"]

L3–L4 预备

  • 排列与组合(L3)— 有序/无序选取计数。 ← 计数原理、乘法
  • 古典概率(L3)— 等可能事件的比值。 ← 排列组合、比与比例
  • 频率与统计图表(L3)— 用数据估计概率。 ← 百分数、平均数
  • 随机变量(初步)(L4)— 把随机结果映射成数。 ← 古典概率、函数

L5 核心

  • 概率公理与样本空间(L5)— 事件与概率规则。 ← 集合、古典概率
  • 条件概率(L5)— P(A|B)。 ← 概率公理
  • 独立性(L5)— 互不影响。 ← 条件概率
  • 贝叶斯定理(L5)— 用证据更新信念。 ← 条件概率
  • 离散分布(L5)— 伯努利、二项、泊松、类别。 ← 随机变量、概率公理
  • 连续随机变量与密度(L5)— 密度函数、积分求概率。 ← 随机变量、定积分
  • 期望(均值)(L5)— 加权平均、长期平均。 ← 平均数、随机变量、求和/积分
  • 方差与标准差(L5)— 离散程度。 ← 期望、平方
  • 常见连续分布(L5)— 均匀、指数、正态。 ← 密度函数、指数函数
  • 联合/边缘/条件分布(L5)— 多变量概率结构。 ← 条件概率、多元函数

L6 多变量与统计

  • 协方差与相关系数(L6)— 两变量共同变化。 ← 期望、方差
  • 协方差矩阵(L6)— 多变量协方差矩阵。 ← 协方差、矩阵、PSD
  • 多元正态 MVN(L6)— 高维高斯、椭球等高线。 ← 协方差矩阵、二次型、正态
  • 大数定律与中心极限定理(L6)— 均值趋近期望、和趋近正态。 ← 期望、方差、收敛
  • 点估计(L6)— 用样本估参数。 ← 期望、抽样
  • 最大似然估计 MLE(L6)— 选让数据最可能的参数。 ← 概率分布、对数、优化
  • 偏差-方差分解(L6)— 估计误差的两来源。 ← 期望、方差

L7 高级概率

  • 测度论概率(L7)— σ-代数、测度、勒贝格积分(严格地基)。 ← 集合、实分析、积分
  • 指数族分布(L7)— 统一伯努利/高斯/类别。 ← 常见分布、对数、内积
  • 随机过程与马尔可夫链(L7)— 随时间演化、无记忆性(RL/MCMC/扩散)。 ← 条件概率、随机变量
  • 贝叶斯推断与后验(L7)— 先验×似然→后验。 ← 贝叶斯定理、MLE
  • 蒙特卡洛与采样(L7)— 用随机样本估期望(重要性/Gibbs)。 ← 期望、随机变量、大数定律
  • 集中不等式(L7)— Markov/Chebyshev/Hoeffding(泛化界)。 ← 期望、方差
  • Fisher 信息与信息几何(L7)— 参数空间曲率、自然梯度。 ← 期望、Hessian、对数似然

主干④ 优化

“把损失降到最低”的机器——踩在微积分+线性代数上。

flowchart TD
    ADAM["SGD/Adam (L7)"] --> GD["梯度下降 (L5)"]
    KKT["对偶/KKT (L7)"] --> LAG["拉格朗日乘子 (L7)"]
    GD --> GRAD["梯度 (L6)"]
    GD --> FOC["驻点 ∇f=0 (L5)"]
    LAG --> FOC
    ADAM --> VARIANCE["方差 (L5)"]
    FOC --> GRAD
    KKT --> CONVEX["凸函数 (L6)"]
    CONVEX --> INEQ["不等式 (L2)"]
    GRAD --> PARTIAL2["偏导数 (L6)"]
    PARTIAL2 --> DERIV2["导数 (L5)"]

L5–L6

  • 极值(最大/最小)(L5)— 函数峰谷。 ← 二次函数、导数
  • 一阶条件(驻点 ∇f=0)(L5)— 极值候选点。 ← 梯度
  • 二阶条件(Hessian 判凹凸)(L6)— 判极小/极大/鞍点。 ← Hessian、PSD
  • 凸集与凸函数(L6)— 局部最优即全局最优。 ← 不等式、二次型
  • 梯度下降(L5)— 沿负梯度下山。 ← 梯度、一阶条件
  • 学习率与步长(L5)— 每步走多远。 ← 梯度下降
  • 最小二乘(L6)— 最小化平方误差、有闭式解。 ← 二次型、伪逆、一阶条件

L7 高级优化

  • 随机梯度下降 SGD(L7)— 小批量估梯度、可扩展。 ← 梯度下降、期望、蒙特卡洛
  • 动量 / Nesterov(L7)— 累积历史梯度加速。 ← SGD、向量加法
  • 自适应方法(AdaGrad/RMSProp/Adam/AdamW)(L7)— 每维自适应步长。 ← SGD、动量、方差
  • 牛顿法与拟牛顿(L-BFGS)(L7)— 用二阶信息加速。 ← Hessian、多元泰勒
  • 约束优化与拉格朗日乘子(L7)— 带约束求极值。 ← 一阶条件、梯度
  • 对偶性与 KKT(L7)— 原/对偶、约束最优判据。 ← 拉格朗日乘子、凸函数
  • 凸优化理论(L7)— 可解性与收敛保证。 ← 凸函数、对偶性
  • 非凸景观(鞍点/局部极小)(L7)— 深度学习的现实地形。 ← 二阶条件、Hessian

主干⑤ 信息论

“惊讶/不确定性”的度量——交叉熵损失、KL 的家。

flowchart TD
    KL["KL 散度 (L7)"] --> CE["交叉熵 (L7)"]
    KL --> JENSEN["Jensen 不等式 (L7)"]
    CE --> ENT["熵 (L6)"]
    ENT --> SI["自信息 (L6)"]
    ENT --> EXP2["期望 (L5)"]
    SI --> LOG["对数 (L3)"]
    SI --> PROB2["概率 (L3)"]
    JENSEN --> CONVEX2["凸函数 (L6)"]
    LOG --> EXPF["指数函数 (L3)"]
    EXPF --> POW["幂 (L1)"]
    POW --> MUL4["乘法 (L0)"]

L6–L7

  • 自信息(-log p)(L6)— 一个事件多”意外”。 ← 对数、概率
  • 熵(Entropy)(L6)— 分布的平均不确定性。 ← 自信息、期望
  • 联合熵/条件熵(L6)— 多变量不确定性。 ← 熵、联合分布
  • Jensen 不等式(L7)— 凸函数下 E[f(X)]≥f(E[X])。 ← 凸函数、期望
  • 交叉熵(L7)— 用 q 编码来自 p 的数据的平均代价。 ← 熵、期望、对数
  • KL 散度(相对熵)(L7)— 两分布差异、≥0。 ← 交叉熵、熵、Jensen
  • 互信息(L7)— 两变量共享的信息。 ← 熵、条件熵、KL
  • 困惑度 Perplexity(L7)— 交叉熵的指数、语言模型指标。 ← 交叉熵、指数函数
  • 证据下界 ELBO(L7)— 变分推断对 log 似然的下界(VAE)。 ← KL、Jensen、期望

主干⑥ 离散数学 · 图论 · 逻辑 · 博弈 · 数值

flowchart TD
    GNN["图神经网络 (L8)"] --> ADJ["邻接/拉普拉斯矩阵 (L6)"]
    GAN["GAN minimax (L8)"] --> GAME["博弈论/纳什 (L6)"]
    RL["Bellman/动态规划 (L8)"] --> DP["动态规划 (L6)"]
    ADJ --> GRAPH["图 (L4)"]
    DP --> REC["递归 (L4)"]
    GAME --> PROB3["概率 (L3)"]
    GRAPH --> SET["集合 (L2)"]
    REC --> SEQ2["数列 (L3)"]
    SET --> COMPARE["数量比较 (L0)"]

L2–L6

  • 命题逻辑与布尔代数(L2)— 与/或/非、真值。 ← 集合
  • 谓词与量词(L3)— ∀/∃。 ← 命题逻辑
  • 关系与映射(L3)— 集合间对应、等价关系。 ← 集合、函数
  • 图(顶点+边)(L4)— 关系的网络结构。 ← 集合、关系
  • 树与有向无环图 DAG(L4)— 无环层级/依赖。 ← 图
  • 邻接/拉普拉斯矩阵(L6)— 用矩阵表示图(GNN/谱聚类)。 ← 图、矩阵
  • 组合计数进阶(L4)— 容斥、递推、生成函数。 ← 排列组合、数列
  • 递归与数学归纳法(L4)— 自我调用、逐级证明。 ← 数列、谓词逻辑
  • 计算复杂度(大O、P/NP)(L6)— 资源增长阶。 ← 函数、极限、组合计数
  • 博弈论(minimax、纳什均衡)(L6)— 多方策略均衡(GAN/多智能体)。 ← 概率、优化
  • 动态规划与 Bellman 方程(L6)— 最优子结构、递归求最优(RL)。 ← 递归、期望、优化
  • 数值计算(浮点、误差、条件数)(L6)— 有限精度稳定性。 ← 小数、幂、范数
  • 数值稳定技巧(log-sum-exp、softmax 稳定化)(L7)— 防上溢/下溢。 ← 对数、指数、浮点

顶层 L8:AI 用到的数学全覆盖

上面六股汇合于此。下面按 AI 子领域列出顶层清单——力求不遗漏 AI 涉及的数学,每项标注它直接踩在哪些前置上(这些前置在上文都已展开到小学)。

通用深度学习引擎

  • 自动微分/计算图 ← 多元链式法则、DAG、雅可比
  • 反向传播 ← 多元链式法则、矩阵乘法、雅可比
  • 梯度下降家族(SGD/动量/Adam/AdamW) ← SGD、自适应方法、动量
  • 均方误差 MSE ← 最小二乘、期望
  • 交叉熵/负对数似然 ← 交叉熵、MLE、对数
  • Softmax ← 指数函数、类别分布、数值稳定化
  • 激活函数(Sigmoid/tanh/ReLU) ← 指数函数、分段函数、导数
  • 权重初始化(Xavier/He) ← 方差、正态分布
  • 梯度裁剪/学习率调度 ← 范数、梯度下降

架构数学

  • 仿射层(全连接) ← 矩阵-向量乘法、向量加法
  • 卷积(CNN) ← 卷积(傅里叶)、点积、张量运算
  • 傅里叶/谱视角(卷积定理) ← 傅里叶分析
  • RNN/LSTM 序列动态 ← 函数复合、离散动态、链式法则
  • 注意力(scaled dot-product) ← 点积、矩阵乘法、Softmax、范数缩放
  • 多头注意力 ← 注意力、张量运算、线性变换
  • 位置编码(正弦/RoPE) ← 三角函数、向量、复数旋转
  • 归一化(Batch/Layer/RMSNorm) ← 期望、方差、标准差
  • Dropout ← 伯努利分布、期望
  • 嵌入与表示空间 ← 向量空间、点积、范数
  • 低秩适配 LoRA ← 低秩近似、SVD、矩阵乘法

概率与生成模型

  • 最大似然(训练的概率解释) ← MLE、对数、SGD
  • 最大后验 MAP 与正则化 ← 贝叶斯推断、MLE
  • VAE/变分推断 ← ELBO、KL、重参数化、MVN
  • 重参数化技巧 ← 随机变量变换、期望、链式法则
  • GAN ← 博弈论 minimax、KL/JS 散度、纳什均衡
  • 扩散/分数匹配 ← 随机微分方程、马尔可夫链、高斯、分数函数 ∇log p
  • 归一化流 ← 变量替换、雅可比行列式、可逆函数
  • MCMC ← 马尔可夫链、蒙特卡洛采样、条件概率
  • 高斯过程 ← MVN、协方差核、贝叶斯推断

强化学习

  • 马尔可夫决策过程 MDP ← 马尔可夫链、条件概率、期望
  • Bellman 方程/动态规划 ← 动态规划、期望、递归
  • 价值函数/Q学习/时序差分 TD ← 期望、Bellman、随机逼近
  • 策略梯度(REINFORCE) ← 期望、对数导数技巧、梯度、蒙特卡洛
  • Actor-Critic/优势函数 ← 价值函数、策略梯度、方差缩减
  • 信赖域/PPO/GRPO ← KL 散度、约束优化、优势估计

经典 ML 与核方法

  • 线性回归 ← 最小二乘、伪逆、期望
  • 逻辑回归 ← Sigmoid、交叉熵、MLE、凸优化
  • 正则化(L1/L2、岭/LASSO) ← 向量范数、约束优化、MAP
  • 主成分分析 PCA ← 协方差矩阵、特征分解/SVD、投影
  • 支持向量机 SVM ← 凸优化、拉格朗日对偶、KKT、几何间隔
  • 核方法/核技巧 ← 内积空间、RKHS、Mercer 定理
  • 再生核希尔伯特空间 RKHS ← 希尔伯特空间、内积、正定核
  • 决策树/集成(信息增益) ← 熵、互信息、期望

图学习

  • 图神经网络 GNN ← 图、邻接矩阵、矩阵乘法
  • 谱图方法/图拉普拉斯 ← 拉普拉斯矩阵、特征分解、傅里叶

统计学习理论(为什么能泛化)

  • 经验风险最小化 ERM ← 期望、损失函数、优化
  • 偏差-方差权衡 ← 偏差-方差分解、期望
  • VC 维/Rademacher/泛化界 ← 集中不等式、组合计数、上确界
  • PAC 学习 ← 概率、复杂度、集中不等式
  • 双下降/过参数化 ← 泛化界、范数、优化景观

数值 · 信息几何 · 前沿粘合剂

  • 数值稳定与混合精度 ← 浮点、log-sum-exp、条件数
  • Fisher 信息与自然梯度 ← Fisher 信息、Hessian、KL 二阶近似
  • 神经正切核 NTK ← 泰勒展开、核方法、梯度流
  • 神经 ODE/连续深度 ← 常微分方程、雅可比、自动微分

四条完整纵切:亲眼看它”不跳步”

抽四个顶层终点,各拉一条一路到 L0 的链,中间每步都咬合:

① 反向传播 ← 多元链式法则 ← 链式法则 ← 导数 ← 极限 ← 函数/数列 ← 坐标平面 ← 数轴 ← 计数

② 交叉熵损失 ← 熵 ← 自信息 ← 对数 ← 指数函数 ← 幂 ← 乘法 ← 计数(另一条腿:期望 ← 平均数 ← 除法;概率 ← 排列组合 ← 计数原理)

③ 注意力 ← 点积(← 乘法+加法)+ Softmax(← 指数函数 ← 幂)+ 矩阵乘法(← 点积)+ 缩放(← 平方根 ← 面积)→ 全部落到 计数

④ PCA / LoRA ← 协方差矩阵(← 协方差 ← 期望 ← 平均数 ← 除法)+ 特征分解(← 行列式 ← 方程组 ← 一次方程 ← 变量 ← 四则运算)→ 计数

四个跨越几十年、看起来毫不相干的 AI 技术,最后都收敛到同一个地基:你小学一年级学的数数。

所以,下次卡住时

把”我是不是底子不够”换成一个可执行动作

  1. 定位那个让你懵的数学点,在这张图的哪一层、哪股主干。
  2. 看它的直接前置(箭头指向的那些)你是否真的会。
  3. 顺着断掉的边往下走,直到踩到一个你确实扎实的节点。
  4. 从那里往上补——补的往往不是”一整门数学”,而是一两个具体节点

“听不懂”不是能力的判决,是地图上一个待补的坐标。你不缺天赋,缺的只是一张标好依赖关系的地图——现在你有了。


延伸阅读:这张图讲的是 AI 的数学地基;如果你想要的是俯瞰 AI 思想的地图,看姊妹篇《站在 AI 的山巅:一句话 + 12 条原理》。想看这些数学和原理如何在一篇真实论文里合体,看《不教,只给激励:DeepSeek-R1 如何让大模型自己长出推理能力》