上一篇《AI Infra 全景思维导图》画了整个领域有什么,这一篇回答另一个问题:掌握这些东西,到底需要哪些数学?
这张图专门为”数学底子一般”的读者设计(包括我自己),三个特点:
- 每个节点标了难度:🟢 高中水平直接看,🟡 半天能补的新概念,🔴 有前置依赖——且每个 🔴 都写明前置是什么,卡住就知道退到哪里。
- 先人话后公式:点积是”衡量两个向量有多像”,量化是”身高 150–190 的人只发 S/M/L/XL 四种码的衣服”,compute-bound vs memory-bound 是”厨师切菜速度 vs 传菜员搬菜速度”。
- 用真实数据代入:KV cache 那笔账直接用 Qwen2.5-7B 算出来(seq=2048 时 117MB,没有 GQA 就是 820MB);7B×Q4≈3.5GB 对上我本地模型文件的 4.4GB;带宽÷模型大小≈34 t/s 理论上限,对上我 M5 Pro 实测的 25 t/s。
图比较长(8 个板块 · 难度分级 · 前置依赖标注),建议直接打开 PDF 版缩放阅读:

八个板块的一句话导读
- 线性代数 — 从向量和点积起步,走到 GEMM 和 stride。读推理引擎源码 90% 的形状检查靠一条规则:
[M,K]×[K,N]→[M,N],中间的 K 必须相等。 - 数值计算与浮点 — 从二进制和科学计数法起步(浮点数本质就是二进制的科学计数法),走到 online softmax 和 Q4_K 量化。这是 Infra 区别于算法岗的差异化数学。
- 概率与信息论 — temperature/top-p 的直觉、perplexity 到底在度量什么(“模型平均在几个候选里犹豫”)。
- 微积分与优化 — 推理方向浅涉即可,图里明确标了”到此为止,别陷太深”。
- 算法与复杂度 — KV cache 那笔只需要乘法的账、attention 为什么 O(n²)、PagedAttention 等于操作系统分页。
- 性能建模 — 五条能心算的公式,Infra 面试估算题的通关钥匙。优先级最高的一章。
- 并行计算 — Amdahl 定律和通信量分析,多卡之前可以整章跳过。
- 补数学的策略 — 按需拉取而不是系统重学:本周该会什么、W3 前该会什么、什么可以永远不学。
一个立刻能做的练习
图里第 5.3 节那笔 KV cache 账,只用乘法:
2 (K和V) × 28 层 × 4 个KV头 × 128 维 × 2048 序列长 × 2 字节
= 117 MB
如果没有 GQA(28 个头全存)就是 7 倍 = 820MB;100 个并发用户就是 11.7GB——算完这一笔,你就同时理解了 GQA 和 PagedAttention 各自为什么存在。这就是”用自己的数字代入一遍,胜过看十遍推导”。
三张图(全景图、这张数学图、后续的周记)会随着 90 天路线推进持续修订。