Skip to content
arXiv cs.CV · Papers

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

arXiv:2608.04132v1 Announce Type: new Abstract: High-resolution images and long videos provide vision-language models with rich context for multimodal reasoning and fine-grained perception, but the resulting long visual token sequences make large language model-side computation and memory costly. Existing visual token