Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
arXiv:2601.07667v2 Announce Type: replace Abstract: Due to the prevalence of large language models (LLMs), key-value (KV) cache reduction for LLM inference has received remarkable attention. Among num