TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
DGX agentarXiv:2510.15545v4 Announce Type: replace Abstract: Accelerating the inference of large language models (LLMs) has been a critical challenge in generative AI. Speculative decoding (SD) substantially i