From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
DGX agentarXiv:2510.18030v2 Announce Type: replace Abstract: Structured pruning is a practical approach to deploying large language models (LLMs) efficiently, as it yields compact, hardware-friendly architectu