Skip to content
arXiv cs.LG · Papers

Sticky Routing: Training MoE Models for Memory-Efficient Inference

arXiv:2607.08780v1 Announce Type: new Abstract: Mixture-of-Experts (MoE) models activate only a sparse subset of experts per token, yet consecutive tokens frequently activate different experts -- causing constant weight swapping between slow storage and fast memory on edge devices. Existing remedies are either system-l