AI Infra 数学地基(细分版):每个知识点拆到高中数学起步

给数学底子一般的人的 AI Infra 数学地图:8 个板块全部拆到高中数学层级,标注难度和前置依赖,每个概念配人话解释,并用真实实验数据代入验证。

上一篇《AI Infra 全景思维导图》画了整个领域有什么,这一篇回答另一个问题:掌握这些东西,到底需要哪些数学?

这张图专门为”数学底子一般”的读者设计(包括我自己),三个特点:

  • 每个节点标了难度:🟢 高中水平直接看,🟡 半天能补的新概念,🔴 有前置依赖——且每个 🔴 都写明前置是什么,卡住就知道退到哪里。
  • 先人话后公式:点积是”衡量两个向量有多像”,量化是”身高 150–190 的人只发 S/M/L/XL 四种码的衣服”,compute-bound vs memory-bound 是”厨师切菜速度 vs 传菜员搬菜速度”。
  • 用真实数据代入:KV cache 那笔账直接用 Qwen2.5-7B 算出来(seq=2048 时 117MB,没有 GQA 就是 820MB);7B×Q4≈3.5GB 对上我本地模型文件的 4.4GB;带宽÷模型大小≈34 t/s 理论上限,对上我 M5 Pro 实测的 25 t/s。

图比较长(8 个板块 · 难度分级 · 前置依赖标注),建议直接打开 PDF 版缩放阅读:

📄 打开 PDF 版(矢量,放大不糊,推荐)

AI Infra 数学地基思维导图(细分版)

八个板块的一句话导读

  1. 线性代数 — 从向量和点积起步,走到 GEMM 和 stride。读推理引擎源码 90% 的形状检查靠一条规则:[M,K]×[K,N]→[M,N],中间的 K 必须相等。
  2. 数值计算与浮点 — 从二进制和科学计数法起步(浮点数本质就是二进制的科学计数法),走到 online softmax 和 Q4_K 量化。这是 Infra 区别于算法岗的差异化数学。
  3. 概率与信息论 — temperature/top-p 的直觉、perplexity 到底在度量什么(“模型平均在几个候选里犹豫”)。
  4. 微积分与优化 — 推理方向浅涉即可,图里明确标了”到此为止,别陷太深”。
  5. 算法与复杂度 — KV cache 那笔只需要乘法的账、attention 为什么 O(n²)、PagedAttention 等于操作系统分页。
  6. 性能建模 — 五条能心算的公式,Infra 面试估算题的通关钥匙。优先级最高的一章。
  7. 并行计算 — Amdahl 定律和通信量分析,多卡之前可以整章跳过。
  8. 补数学的策略 — 按需拉取而不是系统重学:本周该会什么、W3 前该会什么、什么可以永远不学。

一个立刻能做的练习

图里第 5.3 节那笔 KV cache 账,只用乘法:

2 (K和V) × 28 层 × 4 个KV头 × 128 维 × 2048 序列长 × 2 字节
= 117 MB

如果没有 GQA(28 个头全存)就是 7 倍 = 820MB;100 个并发用户就是 11.7GB——算完这一笔,你就同时理解了 GQA 和 PagedAttention 各自为什么存在。这就是”用自己的数字代入一遍,胜过看十遍推导”。

三张图(全景图、这张数学图、后续的周记)会随着 90 天路线推进持续修订。