2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMInferenceGPUTransformer学习笔记
2026年7月9日Fable 写出 GPU Megakernel:AI 研发自动化真正值得盯的信号深读 Import AI 464:从 Fable 的 KernelBench-Mega 结果出发,串起 GPU kernel、远程数字劳动、OSWorld 2.0、企业知识系统和 AI 研发自动化的真实边界。learning-logAI InfraGPUagentAI R&D
2026年7月9日CUDA 张量并行之后,到底有哪几种计算用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。learning-logAI InfraCUDAGPUTensor ParallelismTransformer
2026年7月9日从 FlashAttention 看懂算子融合:为什么融合、少读写了什么、又会错在哪里用 FlashAttention 官方论文和 CUDA 源码拆解 attention fusion:从 QK、softmax、PV 的普通三段式,到 online softmax、HBM 读写减少、边界条件和 kernel 正确性风险。learning-logAI InfraGPUCUDAFlashAttention源码阅读