Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry
DGX agentarXiv:2608.06849v1 Announce Type: cross Abstract: Long-context LLM inference is bottlenecked by quadratic attention computation and growing KV-cache costs. Existing sparse attention and KV-compression