2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文导读学习笔记
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentCode AgentAI InfraContext Engineering学习笔记
2026年7月20日所谓点拨:不是贵人一句话,而是把自己送进高价值反馈场从清华到 OpenAI、Meta Superintelligence Labs、Google DeepMind 等公开案例出发,拆解“点拨”的真实机制:识别热场、压缩路径、构建可验证筹码,并给出 AI 学习者的 90 天行动协议。AI职业地图学习方法AgentAI Infra大模型深度思考
2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMInferenceGPUTransformer学习笔记
2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLMverlRLHFGRPO源码阅读LLM Serving
2026年7月18日把注意力换成一块「会遗忘的内存」:源码级深读 Kimi K3 的心脏 KDAKimi K3 权重 7 月 27 日才放出,但它的核心 KDA 九个月前就完整开源了。从 arXiv 论文和 flash-linear-attention 的 kernel 源码出发,拆解这块 128×128 的矩阵内存如何撑起 2.8 万亿参数与 1M 上下文。LLMAI InfraAttention论文解读Kimi
2026年7月18日KV cache 是内存管理,上下文管理是 GC 吗?——把 LLM 推理栈当操作系统读一遍一个常见直觉的精确化:KV cache 层确实对应操作系统内存管理——PagedAttention 就是把虚拟内存搬进显存,前缀缓存的 ref_cnt 就是字面意义的引用计数 GC;但语义层的上下文管理对应的不是 GC,而是页面置换加有损压缩。给出三问判据。AI InfraLLMvLLMKV Cache操作系统论文解读
2026年7月16日提示词之后:上下文工程如何接管 LLM 应用质量从系统提示词、用户提示词、会话上下文、检索上下文、Token 窗口、幻觉抑制和提示词模板库出发,结合 arXiv 论文解释为什么 LLM 应用的核心工程对象正在从 prompt 变成 context。AILLMPrompt EngineeringContext EngineeringRAGAI Infra
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingMoETransformer推理引擎论文学习
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM ServingPagedAttentionSpeculative Decoding论文学习
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingKV CacheTransformers源码阅读
2026年7月15日vLLM 是顶流,但不是终点:LLM 推理框架的五条路线从 vLLM、SGLang、TensorRT-LLM、TGI、llama.cpp 到 RTP-LLM,梳理当下 LLM inference serving 框架的主流路线、学习价值和选型边界。AIAI InfravLLMLLM ServingSGLangTensorRT-LLM推理引擎架构设计
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读推理引擎KV Cache
2026年7月15日从提示词到工作制度:Superpowers Skill 的结构上下文哲学结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。AILLMAgentAgent SkillsSuperpowersContext EngineeringAI Infra
2026年7月14日把智能体当人用:Claude Agent SDK 的架构设计哲学不是功能罗列,而是深读 Claude Agent SDK 的设计思想——为什么"给智能体一台电脑"、agent loop 为什么是控制循环、上下文窗口如何成为一切设计的隐形主线、以及为什么可靠性工程发生在 harness 而不是模型里。AI InfraAgentClaudeLLM架构设计
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMInferenceTransformerAttentionKV Cachellama.cppvLLMQwen
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLMInferenceBenchmarkKV CacheQuantizationllama.cppQwen
2026年7月13日采样不是玄学:从 logits 到 temperature、top-k、top-p用一次 llama-cli 采样实验讲清 logits、softmax、temperature、top-k 和 top-p 的真实作用。AIAI InfraLLMSamplingllama.cppQwen数学
2026年7月10日换空间是一种数学肌肉记忆:从 LLM 到顶级数学家的思考方式从交叉熵、embedding、RoPE、量化和 LoRA 出发,讲清为什么数学家和工程师总是在换空间,以及如何把这种提问方式练成日常肌肉记忆。AIAI InfraLLMMathLearning MethodPerplexityRepresentation
2026年7月10日攻克数学恐惧:从顶级数学家的脑回路,到一条可训练的数学探索路径从 Euclid、Euler、Gauss、Riemann、Noether、Poincare、Hilbert、Grothendieck、von Neumann、Ramanujan 和 Tao 的思维动作里,提炼一条适合 AI Infra 学习者的数学探索路径。AIAI InfraLLMMathLearning MethodMathematical Thinking
2026年7月10日PPL 是什么:把模型困惑度理解成平均岔路数用 Qwen2.5-7B 的 llama-perplexity 实测结果,讲清 PPL、交叉熵和量化质量评估之间的关系。AIAI InfraLLMEvaluationPerplexityllama.cppQwen数学
2026年7月10日本机实操一次最小大模型蒸馏:用 GGUF Qwen 当 teacher用本机 GGUF Qwen teacher、llama-server top-k logprobs 和 NumPy tiny student,讲清大模型蒸馏里的 soft labels、KL loss、训练流程和最小实现。learning-logAILLMAI InfraDistillationllama.cppGGUF
2026年7月10日为什么交叉熵偏偏要用 log:从模型开发者脑回路理解 PPL从模型开发者会遇到的概率连乘、数值下溢和训练优化问题出发,还原 log、ln、exp、交叉熵与 PPL 之间的动机链条。AIAI InfraLLMEvaluationPerplexityCross Entropy数学
2026年7月9日Fable 写出 GPU Megakernel:AI 研发自动化真正值得盯的信号深读 Import AI 464:从 Fable 的 KernelBench-Mega 结果出发,串起 GPU kernel、远程数字劳动、OSWorld 2.0、企业知识系统和 AI 研发自动化的真实边界。learning-logAI InfraGPUagentAI R&D
2026年7月9日CUDA 张量并行之后,到底有哪几种计算用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。learning-logAI InfraCUDAGPUTensor ParallelismTransformer
2026年7月9日从 FlashAttention 看懂算子融合:为什么融合、少读写了什么、又会错在哪里用 FlashAttention 官方论文和 CUDA 源码拆解 attention fusion:从 QK、softmax、PV 的普通三段式,到 online softmax、HBM 读写减少、边界条件和 kernel 正确性风险。learning-logAI InfraGPUCUDAFlashAttention源码阅读
2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLMInferenceBenchmarkllama.cppQwen数学
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerAttentionKV CacheQwenllama.cpp数学
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLMEvalAI Infra论文学习
2026年7月8日从 .codex 目录反推 Codex 内核:一个本地 Agent OS 的剖面从 CODEX_HOME 的目录、SQLite schema 和官方文档出发,把 Codex 拆成控制面、状态面、执行面、扩展面、安全面、后台面和记忆面,理解它为什么更像本地 agent runtime。learning-logcodexagentAI InfraMCPskills
2026年7月8日Agent Jail:把 AI Agent 关进可审计的企业权限边界从 untrusted tenant 视角重新设计 Codex、Claude Code 和企业 Agent 的运行边界:Capability Manifest、策略引擎、短期凭证、MCP Gateway、审计和绕过防护。learning-logagentAI InfrasecurityMCPcodex
2026年7月8日Out 投影到底在输出什么:把多头 attention 结果重新混回 hidden state补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。AIAI InfraLLMTransformerAttentionllama.cpp源码阅读数学
2026年7月8日BPE 不是一个汉字一个 Token:从 Qwen tokenizer 实验看懂 token 计费用 Qwen2.5 tokenizer 的中文、英文、代码和 emoji 实测数据,讲清为什么 token 不是字符,以及为什么 LLM 按 token 而不是字符计费。AIAI InfraLLMTokenizerBPEQwen学习笔记
2026年7月7日Masked Softmax 到底在 mask 什么:把 QK 分数变成注意力权重面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。AIAI InfraLLMTransformerAttentionSoftmaxllama.cpp源码阅读数学
2026年7月7日QKV 投影到底在投什么:从 3584 维 hidden 到 28 个 Query 头、4 个 KV 头面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。AIAI InfraLLMTransformerAttentionllama.cpp源码阅读数学
2026年7月7日RoPE 为什么只是高中三角函数:把 Q/K 向量按位置旋转面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。AIAI InfraLLMTransformerAttentionRoPEllama.cpp源码阅读数学
2026年7月6日AI Infra 工程师日常工作地图:以 OpenAI 岗位为镜,明自己的学习坐标基于 OpenAI 公开 AI Infra 相关岗位描述,按训练、推理、数据、GPU 集群、可靠性、评测发布、Agent Infra、安全和开发效率拆解 AI Infra 工程师每天实际做什么,并映射到个人学习路线。AIAI InfraLLM职业地图学习笔记OpenAI
2026年7月6日一个 token 的诞生:从 llama.cpp 主循环看懂 Prefill 和 Decode从 llama.cpp 的命令行入口、tokenize、生成 while 循环、llama_decode、batch、n_past 和 KV cache 串起一次 LLM 推理,解释 prefill 与 decode 的代码分叉和性能差异。AIAI InfraLLMllama.cpp推理引擎源码阅读
2026年7月6日LoRA 机制学习笔记:为什么它能把函数和技能变成大模型的可插拔补丁从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。AILLMAI Infra论文学习LoRAPEFTProgram-as-WeightsParametric Skills
2026年7月6日LoRA rank=16 数学直觉:不是更新 16 个维度,而是用 16 个方向生成完整增量从矩阵秩、外积、低秩分解和瓶颈层出发,用通俗数学解释 LoRA 里的 rank=16 到底是什么意思,为什么它能影响所有输出维度,以及为什么常在 8/16/32/64 之间取值。AILLMAI Infra论文学习LoRAPEFT数学
2026年7月6日计算图不是在算,而是在排活:从伪代码到 ggml 看懂 llama.cpp 的 Qwen2 forward用一段极简伪代码解释计算图,再拆开 ggml_tensor、ggml_cgraph 和 llama.cpp 的 Qwen2 graph builder,看懂一次 forward 如何从 logits 反向追出完整执行图。AIAI InfraLLMllama.cppggml推理引擎源码阅读
2026年7月6日Parametric Skills 学习笔记:把 Agent 技能从上下文说明书编译成 LoRA 参数深入拆解 Parametric Skills:为什么文本技能会在长上下文 Agent 中失效,如何用 hypernetwork 把 SKILL.md / 轨迹经验转成 LoRA adapter,以及它和 Program-as-Weights 的关系。AILLMAI Infra论文学习Parametric SkillsagentLoRAskills
2026年7月6日本地跑通一个真实 PEFT LoRA:从环境、代码到 base/adapter/merged 输出对比完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。AILLMAI Infra论文学习LoRAPEFTTransformers本地推理
2026年7月6日Program-as-Weights 学习笔记:把一次大模型调用编译成可复用的小权重程序深入拆解 Program-as-Weights 论文:为什么要把模糊函数编译成权重、PAW 的编译器-解释器结构、Text-to-LoRA 实现、FuzzyBench 训练方式、实验结果、工程收益和局限。AILLMAI Infra论文学习Program-as-WeightsParametric SkillsLoRA本地推理
2026年7月4日AI Infra 数学地基(细分版):每个知识点拆到高中数学起步给数学底子一般的人的 AI Infra 数学地图:8 个板块全部拆到高中数学层级,标注难度和前置依赖,每个概念配人话解释,并用真实实验数据代入验证。AIAI InfraLLM数学思维导图学习笔记
2026年7月4日AI Infra 全景思维导图:一个 token 的一生要经过哪些系统用一张思维导图梳理 AI Infrastructure 的 12 个板块:从硬件、算子编译、训练与推理引擎,到服务调度、量化、端侧和成本工程,并标注 90 天学习路线的覆盖位置。AIAI InfraLLM思维导图学习笔记