arXiv cs.LG
· Papers
When Drafts Evolve: Speculative Decoding Meets Online Learning
arXiv:2603.12617v2 Announce Type: replace Abstract: Speculative decoding has emerged as a widely adopted paradigm for accelerating large language model inference, where a lightweight draft model rapidly generates candidate tokens that are then verified in parallel by a larger target model. However, due to limited model