2026年7月9日CUDA 张量并行之后,到底有哪几种计算用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。learning-logAI InfraCUDAGPUTensor ParallelismTransformer
2026年7月9日从 FlashAttention 看懂算子融合:为什么融合、少读写了什么、又会错在哪里用 FlashAttention 官方论文和 CUDA 源码拆解 attention fusion:从 QK、softmax、PV 的普通三段式,到 online softmax、HBM 读写减少、边界条件和 kernel 正确性风险。learning-logAI InfraGPUCUDAFlashAttention源码阅读