2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingMoETransformer推理引擎论文学习
2026年7月15日vLLM 是顶流,但不是终点:LLM 推理框架的五条路线从 vLLM、SGLang、TensorRT-LLM、TGI、llama.cpp 到 RTP-LLM,梳理当下 LLM inference serving 框架的主流路线、学习价值和选型边界。AIAI InfravLLMLLM ServingSGLangTensorRT-LLM推理引擎架构设计
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读推理引擎KV Cache
2026年7月6日一个 token 的诞生:从 llama.cpp 主循环看懂 Prefill 和 Decode从 llama.cpp 的命令行入口、tokenize、生成 while 循环、llama_decode、batch、n_past 和 KV cache 串起一次 LLM 推理,解释 prefill 与 decode 的代码分叉和性能差异。AIAI InfraLLMllama.cpp推理引擎源码阅读
2026年7月6日计算图不是在算,而是在排活:从伪代码到 ggml 看懂 llama.cpp 的 Qwen2 forward用一段极简伪代码解释计算图,再拆开 ggml_tensor、ggml_cgraph 和 llama.cpp 的 Qwen2 graph builder,看懂一次 forward 如何从 logits 反向追出完整执行图。AIAI InfraLLMllama.cppggml推理引擎源码阅读