QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving
arXiv:2606.05875v1 Announce Type: new Abstract: Retrieval-augmented generation (RAG) improves large language model (LLM) answer quality by grounding generation in external evidence, but processing ret