DASH: Fast Differentiable Architecture Search for Hybrid Attention in Minutes on a Single GPU
DGX agentarXiv:2605.20936v1 Announce Type: cross Abstract: Hybrid attention architectures are becoming an increasingly important paradigm for improving LLM inference efficiency while preserving model quality,