前端领域有人画过”前端知识全景图”,把散落的知识点钉在一张图上。AI Infra 也值得一张这样的图——下面这张思维导图是我在做 90 天 AI Infra 学习路线(Lumen Atelier 项目)时整理的,共 12 个一级分支、约 120 个叶子节点。

这张图怎么读
分支不是平铺的,背后有一条组织逻辑:
- 1–5 是栈的纵轴,也是”一个 token 的一生”的物理路径:硬件(GPU/HBM/互联)→ 算子与编译(CUDA/Triton/FlashAttention)→ 训练 Infra(并行策略)→ 推理 Infra(vLLM/KV cache/量化)→ 服务与调度(SLO/路由/伸缩)。
- 6–9 是横切面:数据管线、后训练(SFT/RLHF)、可观测性与评估、集群编排。它们不属于某一层,而是贯穿所有层。
- 10–12 是场景分支:端侧推理(llama.cpp/MLX)、成本工程、以及 MoE/多模态/Agent infra 这些前沿方向。
几个值得说的取舍
推理 Infra(第 4 块)是当下权重最高的板块。 如果目标是推理方向的岗位,这一块占面试内容的一半以上:prefill/decode 的两阶段分叉、PagedAttention 为什么存在、连续批处理、投机解码。第 2 块的 FlashAttention 和 Triton 则是区分度所在。
训练 Infra 和推理 Infra 是两条不同的纵深。 万卡集群的 3D 并行和单机的 KV cache 管理几乎是两个工种,初学者常犯的错是两头都想要。我的选择是推理纵深优先——训练 Infra 只保留并行策略的概念理解。
端侧是被低估的差异化赛道。 llama.cpp 是可读性最好的推理引擎教材,MLX + Apple Silicon 的统一内存架构是很少有人深耕的方向。用一台 MacBook 就能建立起 memory-bandwidth-bound 的直觉,这个直觉迁移到 H100 上依然成立。
我的 90 天路线在图上是一条对角线
图中星标(★)是我当前学习路线的覆盖位置:从第 4 块的 llama.cpp 角落出发(W1–W2,拆 GGUF、读 ggml 主循环),移动到 vLLM/PagedAttention 核心区(W3–W6),副线扎在第 10 块端侧 + 第 2 块 Metal 内核。训练 Infra 和集群编排是有意留白的两大块——是取舍,不是遗漏。
这张图会随着学习推进持续修订。如果你也在啃 AI Infra,欢迎对照着找自己的位置。