Rethinking Layer Redundancy in Large Language Models: Calibration Objectives and Search for Depth Pruning
DGX agentarXiv:2604.24938v1 Announce Type: cross Abstract: Depth pruning improves the inference efficiency of large language models by removing Transformer blocks. Prior work has focused on importance criteria