2026年7月18日把注意力换成一块「会遗忘的内存」:源码级深读 Kimi K3 的心脏 KDAKimi K3 权重 7 月 27 日才放出,但它的核心 KDA 九个月前就完整开源了。从 arXiv 论文和 flash-linear-attention 的 kernel 源码出发,拆解这块 128×128 的矩阵内存如何撑起 2.8 万亿参数与 1M 上下文。LLMAI InfraAttention论文解读Kimi
2026年7月18日会加减乘除就够:十个问题,手算读懂 Kimi K3 心脏里的全部数学上一篇 KDA 深读里的公式劝退你了?这篇是零基础陪读:用一块 2×2 的迷你内存和十个问题,每一步都能用小学算术手算,算完你能逐个符号读懂 KDA 的核心公式。数学LLMAttention零基础论文解读
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMInferenceTransformerAttentionKV Cachellama.cppvLLMQwen
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerAttentionKV CacheQwenllama.cpp数学
2026年7月8日Out 投影到底在输出什么:把多头 attention 结果重新混回 hidden state补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。AIAI InfraLLMTransformerAttentionllama.cpp源码阅读数学
2026年7月7日Masked Softmax 到底在 mask 什么:把 QK 分数变成注意力权重面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。AIAI InfraLLMTransformerAttentionSoftmaxllama.cpp源码阅读数学
2026年7月7日QKV 投影到底在投什么:从 3584 维 hidden 到 28 个 Query 头、4 个 KV 头面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。AIAI InfraLLMTransformerAttentionllama.cpp源码阅读数学
2026年7月7日RoPE 为什么只是高中三角函数:把 Q/K 向量按位置旋转面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。AIAI InfraLLMTransformerAttentionRoPEllama.cpp源码阅读数学