HF Daily Papers
· Papers
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
Large Vision-Language Models (LVLMs) remain bottlenecked by massive computational footprints, precluding their deployment on resource-constrained edge devices. While efforts to compress LVLMs focus heavily on vision token reduction or smaller language models, the vision encoder is largely overlooked