Skip to content
arXiv cs.LG · Papers

When Drafts Evolve: Speculative Decoding Meets Online Learning

arXiv:2603.12617v2 Announce Type: replace Abstract: Speculative decoding has emerged as a widely adopted paradigm for accelerating large language model inference, where a lightweight draft model rapidly generates candidate tokens that are then verified in parallel by a larger target model. However, due to limited model