#proxyattn
ProxyAttn, a training‑free method without additional training using representative heads, claims up to 10.3× faster raw attention and 2.4× speed‑up in LLM pre‑fill. Read more: https://getnews.me/proxyattn-introduces-guided-sparse-attention-using-representative-heads/ #proxyattn #sparseattention
September 30, 2025 at 11:38 PM
Yixuan Wang, Huang He, Siqi Bao, Hua Wu, Haifeng Wang, Qingfu Zhu, Wanxiang Che
ProxyAttn: Guided Sparse Attention via Representative Heads
https://arxiv.org/abs/2509.24745
September 30, 2025 at 8:37 AM
Yixuan Wang, Huang He, Siqi Bao, Hua Wu, Haifeng Wang, Qingfu Zhu, Wanxiang Che: ProxyAttn: Guided Sparse Attention via Representative Heads https://arxiv.org/abs/2509.24745 https://arxiv.org/pdf/2509.24745 https://arxiv.org/html/2509.24745
September 30, 2025 at 6:32 AM