2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgentEval长任务论文学习
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgentEval论文学习
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLMEvalAI Infra论文学习
2026年7月8日IFEval 学习笔记:别只问模型聪不聪明,先测它是否真的听话消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。AILLMEvalInstruction Following论文学习
2026年7月8日LLM-as-a-Judge 学习笔记:让模型当裁判,到底靠不靠谱消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。AILLMEvalLLM-as-a-Judge论文学习
2026年7月8日SWE-bench 学习笔记:代码模型评测,终于从刷题走向真实修 Bug消化 SWE-bench 论文:为什么传统代码生成评测不足以衡量软件工程能力,SWE-bench 如何用真实 GitHub issue、仓库上下文和测试执行构造可执行评测。AILLMEvalCode AgentSWE-bench论文学习