arXiv cs.CL
· Papers
AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters
arXiv:2607.19223v1 Announce Type: cross Abstract: Speculative decoding, in which a lightweight draft model first generates a draft sequence that is then verified in parallel by the target model, has become a prevalent paradigm for accelerating large language model inference. Recent work such as DFlash further boosts dr