一句话结论
这期 Import AI 最值得抓住的不是“Fable 又刷了一个榜”,而是几个独立信号正在合到一起:AI 开始进入研发性能优化、远程数字劳动、长时电脑操作和企业知识系统这些真正有产出约束的环节。
我的判断是:Fable 的 GPU megakernel 还不能证明完整的递归自我改进,但它证明了一件更近、更工程化、也更可追踪的事:AI 正在吃掉 AI 研发链条里的高杠杆子任务。以后判断 AI 能不能“改进自己”,不要先看口号,要看它能不能在真实 harness 里完成 profile、写 kernel、跑 benchmark、修错误、验证正确性、再把结果稳定并入系统。
先补最小背景:kernel 到底是什么
GPU kernel 可以理解成“发给 GPU 执行的一小段并行程序”。深度学习框架里的矩阵乘、归一化、采样、KV cache 读写,最后都会落到一批 kernel 上。
普通写法往往是:一个模型 block 被拆成很多小操作,每个操作启动一次 kernel。这样容易开发,也容易组合,但会带来启动开销、内存搬运和中间结果读写。megakernel 的思路是把一整块计算尽量融合进一个更大的 kernel,让数据少在显存和调度之间来回折腾。
这不是“代码短一点”的优化,而是靠近推理成本核心的位置。尤其在 decode 阶段,模型一个 token 一个 token 地生成,任何 kernel launch、内存带宽和中间状态开销,都会被重复很多次。
所以 Fable 这次不是在写普通业务脚本,而是在碰 AI infra 里最硬的一层:把模型推理的底层执行路径变快。
Fable 的 KernelBench-Mega 结果为什么重要
Import AI 关注的是 KernelBench-Mega 上的一个结果。KernelBench-Mega 测的不是单个孤立算子,而是 whole-block megakernel:让 agent 把一整个模型 block 融合成高性能实现。官方页面说明,该任务是 02_kimi_linear_decode,也就是 Kimi-Linear W4A16 hybrid decode。榜单用相对优化 PyTorch baseline 的 decode speedup 作为核心指标。
截至我阅读时,KernelBench-Mega 页面显示:
claude-fable-5在 RTX PRO 6000 Blackwell 上通过正确性检查,decode speedup 为 18.71x。- 同一 GPU 上,
claude-opus-4-8为 14.40x,glm-5.2为 11.14x,gpt-5.5为 4.34x。 - 每次运行是一个最长 3 小时的自主 session,榜单保留 reference、baseline、solution 和 trace。
Import AI 进一步强调了一个关键细节:这不是把很多高分小 kernel 拼起来,而是接近单次 cooperative kernel launch 的 megakernel 路线。这个细节比“18.71x”更重要,因为它说明模型不只是会调参或调用现成模板,而是在做融合、内存布局、并行组织和正确性之间的综合取舍。
真正的信号在这里:AI 已经能在限定环境里完成一段性能工程闭环。它读任务,生成 CUDA/Triton 代码,跑测试,根据 benchmark 反馈迭代,最后交付一个可比较的加速结果。
这正是 AI 研发自动化的输入任务之一。
但这还不是完整 RSI
Import AI 把它和 recursive self-improvement 放在一起讨论是合理的,但我会更谨慎一点。
完整的自我改进至少需要一个闭环:
- 系统发现自己或底层栈的瓶颈。
- 系统提出改进方案。
- 系统实现改进。
- 系统验证改进没有破坏正确性。
- 系统把改进部署回自己的训练或推理流程。
- 新能力反过来提升下一轮改进能力。
Fable 的结果覆盖了第 2 到第 4 步的一小段,而且是在 benchmark harness 里完成的。这已经很强,但它还不是完整研发组织,也不是自动改写整个训练系统。
所以我更愿意把它叫作“AI R&D automation 的强局部证据”,而不是直接叫 RSI 已经发生。强局部证据的价值反而更高,因为它能被追踪、复现、拆解和学习。
这期 Import AI 的其他线索,其实都在补同一张图
Fable kernel 是研发自动化。Remote Labor Index 是经济任务自动化。OSWorld 2.0 是长时电脑操作。京东 Oxygen AIIC 是企业知识系统。这几条放在一起,才是这期真正的主线。
1. RLI:AI 开始碰“客户愿不愿意收货”
CAIS 和 Scale Labs 的 Remote Labor Index 测的是 AI 能不能完成真实、经济上有价值的远程工作项目,比如 3D/CAD、建筑、图形设计、视频动画、音频、数据分析和 Web 应用。
它的关键不是题目有多难,而是评价方式更接近现实:AI 交付物要由人类评审,和付费专业人士的交付物相比,达到可接受质量才算自动化成功。
CAIS 2026 年 7 月更新显示,Fable 5 的 full-automation rate 为 15.8%,Opus 4.8 为 8.3%,GPT-5.5 为 6.3%。而 RLI 发布时最高只有 2.5%。数字还不高,但变化速度值得盯。
这里的趋势不是“所有工作马上消失”,而是 AI 的可交付半径正在扩大。它正在从回答问题,进入做成东西。
2. OSWorld 2.0:会用电脑,还不等于能长期负责
OSWorld 2.0 提供了另一个重要边界。它有 108 个 long-horizon computer-use workflows,31 个 self-hosted websites,任务中位数需要人类约 1.6 小时完成,69.6% 的任务超过 1 小时。
最强设置下,Claude Opus 4.8 的 binary completion 只有 20.6%,partial score 为 54.8%。这说明当前 agent 已经能做不少局部操作,但长任务里的隐藏状态、约束追踪、中途信息、用户确认和最终验证仍然很难。
这对 Fable kernel 的解读很重要:AI 在某些窄而硬的任务上可以很强,但一旦任务变成长时、跨软件、跨文件、跨状态的工作流,失败模式会变多。未来的差距不只在模型,还在 harness、记忆、权限、恢复、验证和人工升级机制。
3. 京东 Oxygen AIIC:真正上线的 AI 往往不是纯 agent
Import AI 还提到京东 Oxygen AI Item Center。论文描述的是一个工业级商品理解和知识生产系统:面向数十亿级 SKU、动态本体、LLM/VLM 商品理解、统一数据服务,以及大规模生产管线。
它的启发是:现实世界里的 AI 自动化通常不是“一个聪明 agent 单挑所有问题”,而是把模型嵌入结构化系统。论文里的四个支柱很典型:人机协作维护 ontology,先语义检索再判别,自演化的 LLM/VLM,统一 item tunnel。
这类系统对 AI infra 学习者更有价值,因为它告诉你:企业 AI 的胜负手往往在数据结构、管线、评估、增量更新和业务接口,而不只是模型名字。
4. 模拟计算寓言:安全感来自限制通用性
最后的 Tech Tale 讲了一个未来:通用计算被视为危险,人类转向为天气、海洋、洪水、电网等问题构建专用模拟计算机。
我不把它当预测看,而把它当一个思想实验:通用计算越强,能力和风险都越难界定;专用系统能力窄,但边界清楚。这个寓言和前面的技术线索其实相连。未来 agent 的关键问题不是“能不能做”,而是“被允许在什么边界内做”。
Fable 可以写 kernel,RLI agent 可以交付远程工作,OSWorld agent 可以操作软件,企业系统可以自动更新知识。下一步不是把所有权限都打开,而是给每一类能力配上可验证的 harness。
我读完后的四个判断
第一,AI 自动化正在从语言层下沉到执行层。以前我们关心模型会不会答,现在更该关心它能不能交付代码、图像、视频、数据分析、软件操作和性能优化结果。
第二,AI 研发自动化最先突破的可能不是“发明新理论”,而是大量高杠杆工程子任务:写 kernel、调 benchmark、找瓶颈、生成测试、压成本、修 runtime。它们单个看起来不宏大,但会直接影响训练和推理效率。
第三,未来判断模型能力要看 harness。KernelBench-Mega、RLI、OSWorld 2.0 的共同点是:它们都不只问“模型知道什么”,而是问“模型在环境里完成了什么”。任务、工具、时间限制、评分方式和失败记录,会比单个分数更重要。
第四,人类的比较优势要往验证、系统设计和问题定义迁移。如果 AI 越来越会写底层代码和交付工作,人类更应该学会定义正确目标、设计评估、识别幻觉、控制权限、看懂 profile 和决定什么结果可以上线。
对我的学习路线有什么用
这篇 Import AI 可以转成一个很具体的学习清单:
- 学会拆推理性能:区分 prefill、decode、kernel launch、显存带宽、KV cache 和调度开销。
- 至少跑一次小型 benchmark:别只看“快了”,要同时看正确性、不同上下文长度、重复运行波动和硬件条件。
- 读一个 kernel solution:哪怕暂时写不出 CUDA,也要看懂为什么融合、为什么减少中间读写、为什么可能错。
- 评估 agent 时看交付物:不要只看聊天过程,要看最终文件、测试结果、截图、用户是否能验收。
- 设计 harness 边界:给 agent 明确工具、文件范围、网络权限、运行时间、回滚方式和人工确认点。
如果只把 Fable 的结果看成模型新闻,很快就会过期。把它看成 AI infra 学习入口,它就能留下来:性能工程、benchmark、验证和自动化研发,会是接下来很长时间都值得练的能力。
还需要继续验证的边界
KernelBench-Mega 页面声明它是独立网站,并非 Stanford KernelBench 官方背书。这个不削弱结果的学习价值,但提醒我们不要把榜单当成最终事实来源。
RLI 的结果在 Import AI 正文和 CAIS 页面之间有轻微数字差异。博客里我采用 CAIS 页面当前显示的 15.8%,并把它理解为“约 16%”这个量级信号。
Fable 的 kernel 结果是否能泛化到更多模型 block、更多硬件、更多真实推理栈,还要看后续开源代码、复现实验和失败案例。单点突破很重要,但系统性能力要看分布。