2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文导读学习笔记
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentCode AgentAI InfraContext Engineering学习笔记
2026年7月20日所谓点拨:不是贵人一句话,而是把自己送进高价值反馈场从清华到 OpenAI、Meta Superintelligence Labs、Google DeepMind 等公开案例出发,拆解“点拨”的真实机制:识别热场、压缩路径、构建可验证筹码,并给出 AI 学习者的 90 天行动协议。AI职业地图学习方法AgentAI Infra大模型深度思考
2026年7月20日Lilian Weng 新文深读:当 Harness 本身成为被优化的对象《Harness Engineering for Self-Improvement》深度消化:递归自我改进不会从模型改写自己的权重开始,而是从部署层开始。被优化对象的爬升路径(prompt → context → workflow → harness 代码 → 优化器代码),以及为什么评估器必须留在循环之外。researcher-deepdivelilian-wengAgentSelf-ImprovementHarness学习笔记
2026年7月17日给「物料搭建 + 还原业务逻辑」设计一套 AI Harness前两篇讲了设计稿出码的难题和物料驱动搭建的问题地图。这一篇动手:从「AI 可被控制、可被配置的切面」出发,设计一套能真正跑起来的搭建 harness——用一条「逐步降低不确定性」的窄专家流水线,每步产出可校验的 typed artifact,把 skill.md / tool schema / MCP / 结构化输出 / 编排 / 校验门 / 人机门 当成控制阀装上去。含可直接参考的 SKILL.md、工具契约、IR schema 与编排流程图。AIAgentHarnessLow-CodeFrontendOrchestrationMCPSkill
2026年7月17日搭建系统最会流血的两处,其实是同一种病:PRD 抽取与双向同步系列深挖篇。把「PRD→交互规格的 intake agent」和「schema↔代码的 round-trip」这两个搭建系统里最疼的单点挖到底,并揭示它们是同一种病——同一份信息在两种表示之间来回翻译时的边界问题。前者会静默编造缺失的逻辑,后者会静默漂移。负责任的解法都是同一句:把有损与歧义的部分显式化,而不是替它糊过去。含 intake 的完备性矩阵设计与 round-trip 四种策略的取舍。AIAgentLow-CodeFrontendRound-tripPRDHarnessArchitecture
2026年7月16日从 Agent 供给工程到设计即交付:三份 AI 研发规范背后的生产线逻辑结合论文与 KaiHub、Echo Builder、设计上下文、物料渲染等实现,解读 Skills & MCP、提示词与上下文工程、D2D 如何组成公司级 AI 研发生产线。AIAgentMCPSkillsContext EngineeringD2DAI Engineering
2026年7月15日从提示词到工作制度:Superpowers Skill 的结构上下文哲学结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。AILLMAgentAgent SkillsSuperpowersContext EngineeringAI Infra
2026年7月14日把智能体当人用:Claude Agent SDK 的架构设计哲学不是功能罗列,而是深读 Claude Agent SDK 的设计思想——为什么"给智能体一台电脑"、agent loop 为什么是控制循环、上下文窗口如何成为一切设计的隐形主线、以及为什么可靠性工程发生在 harness 而不是模型里。AI InfraAgentClaudeLLM架构设计
2026年7月13日Graphify 源码深潜:从 AST 构图到 LLM 任务的上下文装配从语法树构图、跨文件消歧和图遍历查询,到 Skill、AGENTS.md、CLI 与 MCP 接入,讲清 Graphify 如何在构图期与任务运行期分配 LLM 职责。AIAgentLLM代码知识图谱MCP源码阅读
2026年7月10日Agent 能力会被内化吗:外部系统、模型训练与研发护城河深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。AILLMAgentTool Use论文学习
2026年7月10日Agent 长记忆不是向量库:从记忆流到内存管理消化 Generative Agents、Reflexion、MemGPT、Mem0 和 A-Mem:为什么 Agent 长记忆不是简单存聊天记录,而是一套写入、整理、检索、更新和评估系统。AILLMAgentMemory论文学习
2026年7月10日Agent 的工具调用机制:从 Function Calling、MCP 到 Skill拆开一次 Agent 工具调用:模型只提出结构化调用意图,运行时负责校验、执行和回填;MCP 标准化外部能力,Skill 标准化可复用工作流。AIAgentMCPSkillCodex工具调用
2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgentEval长任务论文学习
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgentEval论文学习
2026年7月8日Evoflux 学习笔记:小模型不会稳定用工具时,先别急着微调消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。AILLMAgentTool UseMCP论文学习
2026年7月8日PrologMCP 学习笔记:别让大模型硬想,把演绎推理交给符号系统消化 PrologMCP 论文:为什么 LLM 在深层演绎推理上不稳定,PrologMCP 如何把 Prolog 标准化为 MCP 工具,以及“模型做翻译、求解器做推理”的系统分工。AILLMAgentMCPPrologSymbolic AI论文学习