Published onSeptember 10, 2026关于 Prefill 一些模糊点的理解AI-InfraLLMTransformer从 token 与 attention head 的并行、矩阵化计算中的权重复用,到算术强度和耗时下界,厘清 prefill 与 decode 的性能差异。
Published onSeptember 9, 2026稀疏注意力(Sparse Attention)AI-InfraLLMAttention从连接模式、复杂度与工程实现出发,解释稀疏注意力,并比较 FlashAttention 与 PagedAttention。