2026年7月17日Agent 的内存管理:Claude Code 与 Codex 如何决定"忘掉什么"深度拆解 Claude Code / Codex 的上下文淘汰策略:分层压缩管道、compaction 幸存规则、KV cache 淘汰的同构问题,以及 arXiv 论文给出的反直觉证据——简单丢弃常常不输昂贵的摘要。AILLMCode AgentContext EngineeringClaude CodeCodex论文学习
2026年7月17日Claude Code 和 Codex 还在用 RAG 吗?——代码检索为什么回到了 grep拆解 Claude Code / Codex 的代码检索机制:为什么两家都放弃了向量索引式 RAG,改用 agentic search(grep + 模型闭环);Fetch 工具到底是干什么的;以及 arXiv 论文链条给出的证据与边界。AILLMCode AgentRAGAgentic SearchClaude CodeCodex论文学习
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingMoETransformer推理引擎论文学习
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM ServingPagedAttentionSpeculative Decoding论文学习
2026年7月14日任务能力怎样写进 LLM 权重:从一次梯度更新到预训练与对齐沿着一条训练信号的旅程,解释 loss、gradient、AdamW 怎样改变权重,并串起预训练、SFT、RLHF、DPO、LoRA 与上下文学习。AILLM模型训练论文学习RLHFLoRA可解释性
2026年7月10日Agent 能力会被内化吗:外部系统、模型训练与研发护城河深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。AILLMAgentTool Use论文学习
2026年7月10日Agent 长记忆不是向量库:从记忆流到内存管理消化 Generative Agents、Reflexion、MemGPT、Mem0 和 A-Mem:为什么 Agent 长记忆不是简单存聊天记录,而是一套写入、整理、检索、更新和评估系统。AILLMAgentMemory论文学习
2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgentEval长任务论文学习
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgentEval论文学习
2026年7月8日Evoflux 学习笔记:小模型不会稳定用工具时,先别急着微调消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。AILLMAgentTool UseMCP论文学习
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLMEvalAI Infra论文学习
2026年7月8日IFEval 学习笔记:别只问模型聪不聪明,先测它是否真的听话消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。AILLMEvalInstruction Following论文学习
2026年7月8日LLM-as-a-Judge 学习笔记:让模型当裁判,到底靠不靠谱消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。AILLMEvalLLM-as-a-Judge论文学习
2026年7月8日PrologMCP 学习笔记:别让大模型硬想,把演绎推理交给符号系统消化 PrologMCP 论文:为什么 LLM 在深层演绎推理上不稳定,PrologMCP 如何把 Prolog 标准化为 MCP 工具,以及“模型做翻译、求解器做推理”的系统分工。AILLMAgentMCPPrologSymbolic AI论文学习
2026年7月8日SWE-bench 学习笔记:代码模型评测,终于从刷题走向真实修 Bug消化 SWE-bench 论文:为什么传统代码生成评测不足以衡量软件工程能力,SWE-bench 如何用真实 GitHub issue、仓库上下文和测试执行构造可执行评测。AILLMEvalCode AgentSWE-bench论文学习
2026年7月6日LoRA 机制学习笔记:为什么它能把函数和技能变成大模型的可插拔补丁从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。AILLMAI Infra论文学习LoRAPEFTProgram-as-WeightsParametric Skills
2026年7月6日LoRA rank=16 数学直觉:不是更新 16 个维度,而是用 16 个方向生成完整增量从矩阵秩、外积、低秩分解和瓶颈层出发,用通俗数学解释 LoRA 里的 rank=16 到底是什么意思,为什么它能影响所有输出维度,以及为什么常在 8/16/32/64 之间取值。AILLMAI Infra论文学习LoRAPEFT数学
2026年7月6日Parametric Skills 学习笔记:把 Agent 技能从上下文说明书编译成 LoRA 参数深入拆解 Parametric Skills:为什么文本技能会在长上下文 Agent 中失效,如何用 hypernetwork 把 SKILL.md / 轨迹经验转成 LoRA adapter,以及它和 Program-as-Weights 的关系。AILLMAI Infra论文学习Parametric SkillsagentLoRAskills
2026年7月6日本地跑通一个真实 PEFT LoRA:从环境、代码到 base/adapter/merged 输出对比完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。AILLMAI Infra论文学习LoRAPEFTTransformers本地推理
2026年7月6日Program-as-Weights 学习笔记:把一次大模型调用编译成可复用的小权重程序深入拆解 Program-as-Weights 论文:为什么要把模糊函数编译成权重、PAW 的编译器-解释器结构、Text-to-LoRA 实现、FuzzyBench 训练方式、实验结果、工程收益和局限。AILLMAI Infra论文学习Program-as-WeightsParametric SkillsLoRA本地推理