Skip to content
arXiv cs.CV · Papers

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

arXiv:2607.09029v1 Announce Type: new Abstract: Vision-Language Models (VLMs) have achieved success using homogeneous Transformers to process multimedia data. Recent studies show that heterogeneous structures interleaving efficient mechanisms, like linear attention, improve both performance and inference latency over h