2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLMverlRLHFGRPO源码阅读LLM Serving
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingMoETransformer推理引擎论文学习
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM ServingPagedAttentionSpeculative Decoding论文学习
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingKV CacheTransformers源码阅读
2026年7月15日vLLM 是顶流,但不是终点:LLM 推理框架的五条路线从 vLLM、SGLang、TensorRT-LLM、TGI、llama.cpp 到 RTP-LLM,梳理当下 LLM inference serving 框架的主流路线、学习价值和选型边界。AIAI InfravLLMLLM ServingSGLangTensorRT-LLM推理引擎架构设计
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读推理引擎KV Cache