2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文导读学习笔记
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentCode AgentAI InfraContext Engineering学习笔记
2026年7月20日所谓点拨:不是贵人一句话,而是把自己送进高价值反馈场从清华到 OpenAI、Meta Superintelligence Labs、Google DeepMind 等公开案例出发,拆解“点拨”的真实机制:识别热场、压缩路径、构建可验证筹码,并给出 AI 学习者的 90 天行动协议。AI职业地图学习方法AgentAI Infra大模型深度思考
2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMInferenceGPUTransformer学习笔记
2026年7月18日短视频说"AI 一小时证明了 50 年数学悬案"——我把 OpenAI 那两份 PDF 读了,真实故事更精彩2026 年 7 月,"GPT-5.6 一小时证明循环双覆盖猜想"刷屏短视频。事实核查:事件为真,但"证明了"三个字说早了——现在的准确状态是"机器生成了一份证明,人类正在核验"。这篇先用能手画的小例子讲透这个 50 年悬案本身(圈、桥、snark),再逐页拆 OpenAI 发布的两份一手 PDF:3 页的证明走了哪四步,那份比证明更值得读的 2 页提示词里藏着哪些多代理工程设计。结尾是一张"视频说法 vs 核实结果"对照表,以及一个漂亮的对偶:费马大定理是人类已证、等机器核验;这次是机器生成、等人类核验。数学AI图论事实核查LLM
2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLMverlRLHFGRPO源码阅读LLM Serving
2026年7月17日Agent 的内存管理:Claude Code 与 Codex 如何决定"忘掉什么"深度拆解 Claude Code / Codex 的上下文淘汰策略:分层压缩管道、compaction 幸存规则、KV cache 淘汰的同构问题,以及 arXiv 论文给出的反直觉证据——简单丢弃常常不输昂贵的摘要。AILLMCode AgentContext EngineeringClaude CodeCodex论文学习
2026年7月17日Claude Code 和 Codex 还在用 RAG 吗?——代码检索为什么回到了 grep拆解 Claude Code / Codex 的代码检索机制:为什么两家都放弃了向量索引式 RAG,改用 agentic search(grep + 模型闭环);Fetch 工具到底是干什么的;以及 arXiv 论文链条给出的证据与边界。AILLMCode AgentRAGAgentic SearchClaude CodeCodex论文学习
2026年7月17日给「物料搭建 + 还原业务逻辑」设计一套 AI Harness前两篇讲了设计稿出码的难题和物料驱动搭建的问题地图。这一篇动手:从「AI 可被控制、可被配置的切面」出发,设计一套能真正跑起来的搭建 harness——用一条「逐步降低不确定性」的窄专家流水线,每步产出可校验的 typed artifact,把 skill.md / tool schema / MCP / 结构化输出 / 编排 / 校验门 / 人机门 当成控制阀装上去。含可直接参考的 SKILL.md、工具契约、IR schema 与编排流程图。AIAgentHarnessLow-CodeFrontendOrchestrationMCPSkill
2026年7月17日设计稿出码,七年走到哪了:从 pix2code 到 Design2Code 的深度精读精读设计稿出码方向的两篇奠基论文——2017 年 pix2code(CNN+LSTM 学「截图→DSL」)与 2024 年斯坦福 Design2Code(多模态 LLM 直接出前端代码)。不只讲模型,重点拆解一个更隐蔽的问题:这个任务到底该怎么「评好坏」,以及为什么「元素召回」和「布局」始终是最难啃的骨头。AIDesign2CodeMultimodalFrontendCode GenerationPaper Reading
2026年7月17日搭建系统最会流血的两处,其实是同一种病:PRD 抽取与双向同步系列深挖篇。把「PRD→交互规格的 intake agent」和「schema↔代码的 round-trip」这两个搭建系统里最疼的单点挖到底,并揭示它们是同一种病——同一份信息在两种表示之间来回翻译时的边界问题。前者会静默编造缺失的逻辑,后者会静默漂移。负责任的解法都是同一句:把有损与歧义的部分显式化,而不是替它糊过去。含 intake 的完备性矩阵设计与 round-trip 四种策略的取舍。AIAgentLow-CodeFrontendRound-tripPRDHarnessArchitecture
2026年7月17日物料搭建 × AI Harness:一套完整表达生产级页面的协议族设计本系列的规范篇。为「基于物料的 UI 还原 + AI Harness 控制的业务逻辑还原」这套架构,负责任地穷举出需要的全部协议/Schema——分六层、23 个协议,共享一个 Envelope、彼此用 id 交叉引用,逐一给出结构、关键字段与含义。目标是让这套协议族能完整表达复杂场景与真实应用页面,逼近生产运行表现;同时诚实标注它的边界与未解难点。AIProtocolSchemaLow-CodeFrontendArchitectureDesign SystemHarness
2026年7月17日把协议族跑起来:一个协议驱动的 TODO 应用(含可运行 demo)系列实现篇。用 React + Vite + TS 把前面设计的协议族真正实现成一个可运行的 TODO 应用——整个 app 的视觉、数据、业务逻辑、边界态全部是一份声明式协议数据,运行时解释它渲染而成,换掉这份数据就换掉整个应用。接口用 mock 拦截真实 fetch 模拟真实行为(状态码/延迟/持久化/错误注入)。因为逻辑与 DOM 分离,同一个运行时能被无头单测完整覆盖。附可在线体验的 demo 与全部源码结构。AILow-CodeReactTypeScriptProtocolFrontendArchitectureHarness
2026年7月16日AI 时代的思考方式:真正的分水岭是「你把哪部分思考外包了」结合 MIT 的 EEG 实验、Nature Human Behaviour 的人机协作元分析等一手论文,论证 AI 时代思考能力的分水岭不是「用不用 AI」,而是「卸载哪一层思考」——机械层可以外包,判断与综合层不能,否则你在借「认知债」。AIThinkingCognitionHuman-AI CollaborationProductivity
2026年7月16日从 Agent 供给工程到设计即交付:三份 AI 研发规范背后的生产线逻辑结合论文与 KaiHub、Echo Builder、设计上下文、物料渲染等实现,解读 Skills & MCP、提示词与上下文工程、D2D 如何组成公司级 AI 研发生产线。AIAgentMCPSkillsContext EngineeringD2DAI Engineering
2026年7月16日提示词之后:上下文工程如何接管 LLM 应用质量从系统提示词、用户提示词、会话上下文、检索上下文、Token 窗口、幻觉抑制和提示词模板库出发,结合 arXiv 论文解释为什么 LLM 应用的核心工程对象正在从 prompt 变成 context。AILLMPrompt EngineeringContext EngineeringRAGAI Infra
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingMoETransformer推理引擎论文学习
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM ServingPagedAttentionSpeculative Decoding论文学习
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingKV CacheTransformers源码阅读
2026年7月15日vLLM 是顶流,但不是终点:LLM 推理框架的五条路线从 vLLM、SGLang、TensorRT-LLM、TGI、llama.cpp 到 RTP-LLM,梳理当下 LLM inference serving 框架的主流路线、学习价值和选型边界。AIAI InfravLLMLLM ServingSGLangTensorRT-LLM推理引擎架构设计
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读推理引擎KV Cache
2026年7月15日从提示词到工作制度:Superpowers Skill 的结构上下文哲学结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。AILLMAgentAgent SkillsSuperpowersContext EngineeringAI Infra
2026年7月14日任务能力怎样写进 LLM 权重:从一次梯度更新到预训练与对齐沿着一条训练信号的旅程,解释 loss、gradient、AdamW 怎样改变权重,并串起预训练、SFT、RLHF、DPO、LoRA 与上下文学习。AILLM模型训练论文学习RLHFLoRA可解释性
2026年7月14日一组权重,为什么能学会许多任务:条件化计算、梯度冲突与多任务收敛从一个根本无解的双标签训练集出发,解释任务条件、不同激活、梯度夹角、Pareto 折中,以及怎样让一个模型可靠地同时学会 A、B 和更多任务。AILLM模型训练多任务学习优化可解释性
2026年7月13日Graphify 源码深潜:从 AST 构图到 LLM 任务的上下文装配从语法树构图、跨文件消歧和图遍历查询,到 Skill、AGENTS.md、CLI 与 MCP 接入,讲清 Graphify 如何在构图期与任务运行期分配 LLM 职责。AIAgentLLM代码知识图谱MCP源码阅读
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMInferenceTransformerAttentionKV Cachellama.cppvLLMQwen
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLMInferenceBenchmarkKV CacheQuantizationllama.cppQwen
2026年7月13日采样不是玄学:从 logits 到 temperature、top-k、top-p用一次 llama-cli 采样实验讲清 logits、softmax、temperature、top-k 和 top-p 的真实作用。AIAI InfraLLMSamplingllama.cppQwen数学
2026年7月10日Agent 能力会被内化吗:外部系统、模型训练与研发护城河深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。AILLMAgentTool Use论文学习
2026年7月10日Agent 长记忆不是向量库:从记忆流到内存管理消化 Generative Agents、Reflexion、MemGPT、Mem0 和 A-Mem:为什么 Agent 长记忆不是简单存聊天记录,而是一套写入、整理、检索、更新和评估系统。AILLMAgentMemory论文学习
2026年7月10日Agent 的工具调用机制:从 Function Calling、MCP 到 Skill拆开一次 Agent 工具调用:模型只提出结构化调用意图,运行时负责校验、执行和回填;MCP 标准化外部能力,Skill 标准化可复用工作流。AIAgentMCPSkillCodex工具调用
2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgentEval长任务论文学习
2026年7月10日换空间是一种数学肌肉记忆:从 LLM 到顶级数学家的思考方式从交叉熵、embedding、RoPE、量化和 LoRA 出发,讲清为什么数学家和工程师总是在换空间,以及如何把这种提问方式练成日常肌肉记忆。AIAI InfraLLMMathLearning MethodPerplexityRepresentation
2026年7月10日攻克数学恐惧:从顶级数学家的脑回路,到一条可训练的数学探索路径从 Euclid、Euler、Gauss、Riemann、Noether、Poincare、Hilbert、Grothendieck、von Neumann、Ramanujan 和 Tao 的思维动作里,提炼一条适合 AI Infra 学习者的数学探索路径。AIAI InfraLLMMathLearning MethodMathematical Thinking
2026年7月10日PPL 是什么:把模型困惑度理解成平均岔路数用 Qwen2.5-7B 的 llama-perplexity 实测结果,讲清 PPL、交叉熵和量化质量评估之间的关系。AIAI InfraLLMEvaluationPerplexityllama.cppQwen数学
2026年7月10日本机实操一次最小大模型蒸馏:用 GGUF Qwen 当 teacher用本机 GGUF Qwen teacher、llama-server top-k logprobs 和 NumPy tiny student,讲清大模型蒸馏里的 soft labels、KL loss、训练流程和最小实现。learning-logAILLMAI InfraDistillationllama.cppGGUF
2026年7月10日为什么交叉熵偏偏要用 log:从模型开发者脑回路理解 PPL从模型开发者会遇到的概率连乘、数值下溢和训练优化问题出发,还原 log、ln、exp、交叉熵与 PPL 之间的动机链条。AIAI InfraLLMEvaluationPerplexityCross Entropy数学
2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLMInferenceBenchmarkllama.cppQwen数学
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerAttentionKV CacheQwenllama.cpp数学
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgentEval论文学习
2026年7月8日Evoflux 学习笔记:小模型不会稳定用工具时,先别急着微调消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。AILLMAgentTool UseMCP论文学习
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLMEvalAI Infra论文学习
2026年7月8日IFEval 学习笔记:别只问模型聪不聪明,先测它是否真的听话消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。AILLMEvalInstruction Following论文学习
2026年7月8日LLM-as-a-Judge 学习笔记:让模型当裁判,到底靠不靠谱消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。AILLMEvalLLM-as-a-Judge论文学习
2026年7月8日Out 投影到底在输出什么:把多头 attention 结果重新混回 hidden state补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。AIAI InfraLLMTransformerAttentionllama.cpp源码阅读数学
2026年7月8日BPE 不是一个汉字一个 Token:从 Qwen tokenizer 实验看懂 token 计费用 Qwen2.5 tokenizer 的中文、英文、代码和 emoji 实测数据,讲清为什么 token 不是字符,以及为什么 LLM 按 token 而不是字符计费。AIAI InfraLLMTokenizerBPEQwen学习笔记
2026年7月8日PrologMCP 学习笔记:别让大模型硬想,把演绎推理交给符号系统消化 PrologMCP 论文:为什么 LLM 在深层演绎推理上不稳定,PrologMCP 如何把 Prolog 标准化为 MCP 工具,以及“模型做翻译、求解器做推理”的系统分工。AILLMAgentMCPPrologSymbolic AI论文学习
2026年7月8日SWE-bench 学习笔记:代码模型评测,终于从刷题走向真实修 Bug消化 SWE-bench 论文:为什么传统代码生成评测不足以衡量软件工程能力,SWE-bench 如何用真实 GitHub issue、仓库上下文和测试执行构造可执行评测。AILLMEvalCode AgentSWE-bench论文学习
2026年7月7日Masked Softmax 到底在 mask 什么:把 QK 分数变成注意力权重面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。AIAI InfraLLMTransformerAttentionSoftmaxllama.cpp源码阅读数学
2026年7月7日QKV 投影到底在投什么:从 3584 维 hidden 到 28 个 Query 头、4 个 KV 头面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。AIAI InfraLLMTransformerAttentionllama.cpp源码阅读数学
2026年7月7日RoPE 为什么只是高中三角函数:把 Q/K 向量按位置旋转面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。AIAI InfraLLMTransformerAttentionRoPEllama.cpp源码阅读数学
2026年7月6日AI Infra 工程师日常工作地图:以 OpenAI 岗位为镜,明自己的学习坐标基于 OpenAI 公开 AI Infra 相关岗位描述,按训练、推理、数据、GPU 集群、可靠性、评测发布、Agent Infra、安全和开发效率拆解 AI Infra 工程师每天实际做什么,并映射到个人学习路线。AIAI InfraLLM职业地图学习笔记OpenAI
2026年7月6日一个 token 的诞生:从 llama.cpp 主循环看懂 Prefill 和 Decode从 llama.cpp 的命令行入口、tokenize、生成 while 循环、llama_decode、batch、n_past 和 KV cache 串起一次 LLM 推理,解释 prefill 与 decode 的代码分叉和性能差异。AIAI InfraLLMllama.cpp推理引擎源码阅读
2026年7月6日LoRA 机制学习笔记:为什么它能把函数和技能变成大模型的可插拔补丁从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。AILLMAI Infra论文学习LoRAPEFTProgram-as-WeightsParametric Skills
2026年7月6日LoRA rank=16 数学直觉:不是更新 16 个维度,而是用 16 个方向生成完整增量从矩阵秩、外积、低秩分解和瓶颈层出发,用通俗数学解释 LoRA 里的 rank=16 到底是什么意思,为什么它能影响所有输出维度,以及为什么常在 8/16/32/64 之间取值。AILLMAI Infra论文学习LoRAPEFT数学
2026年7月6日计算图不是在算,而是在排活:从伪代码到 ggml 看懂 llama.cpp 的 Qwen2 forward用一段极简伪代码解释计算图,再拆开 ggml_tensor、ggml_cgraph 和 llama.cpp 的 Qwen2 graph builder,看懂一次 forward 如何从 logits 反向追出完整执行图。AIAI InfraLLMllama.cppggml推理引擎源码阅读
2026年7月6日Parametric Skills 学习笔记:把 Agent 技能从上下文说明书编译成 LoRA 参数深入拆解 Parametric Skills:为什么文本技能会在长上下文 Agent 中失效,如何用 hypernetwork 把 SKILL.md / 轨迹经验转成 LoRA adapter,以及它和 Program-as-Weights 的关系。AILLMAI Infra论文学习Parametric SkillsagentLoRAskills
2026年7月6日本地跑通一个真实 PEFT LoRA:从环境、代码到 base/adapter/merged 输出对比完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。AILLMAI Infra论文学习LoRAPEFTTransformers本地推理
2026年7月6日Program-as-Weights 学习笔记:把一次大模型调用编译成可复用的小权重程序深入拆解 Program-as-Weights 论文:为什么要把模糊函数编译成权重、PAW 的编译器-解释器结构、Text-to-LoRA 实现、FuzzyBench 训练方式、实验结果、工程收益和局限。AILLMAI Infra论文学习Program-as-WeightsParametric SkillsLoRA本地推理
2026年7月4日AI Infra 数学地基(细分版):每个知识点拆到高中数学起步给数学底子一般的人的 AI Infra 数学地图:8 个板块全部拆到高中数学层级,标注难度和前置依赖,每个概念配人话解释,并用真实实验数据代入验证。AIAI InfraLLM数学思维导图学习笔记
2026年7月4日AI Infra 全景思维导图:一个 token 的一生要经过哪些系统用一张思维导图梳理 AI Infrastructure 的 12 个板块:从硬件、算子编译、训练与推理引擎,到服务调度、量化、端侧和成本工程,并标注 90 天学习路线的覆盖位置。AIAI InfraLLM思维导图学习笔记