FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration
DGX agentarXiv:2605.20022v1 Announce Type: new Abstract: Speculative decoding accelerates memory-bound LLM inference without quality degradation by using a fast drafter to propose multiple candidate tokens and