2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMInferenceGPUTransformer学习笔记
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMInferenceTransformerAttentionKV Cachellama.cppvLLMQwen
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLMInferenceBenchmarkKV CacheQuantizationllama.cppQwen
2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLMInferenceBenchmarkllama.cppQwen数学