NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference
DGX agentarXiv:2606.03910v1 Announce Type: cross Abstract: Disaggregated LLM inference forces the KV cache to traverse the datacenter network before decoding begins, so transfer time enters directly into the T