arXiv cs.CV
· Papers
OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models
arXiv:2607.03050v1 Announce Type: cross Abstract: Omni modal large language models (OmniLLMs) have attracted wide attention for their ability to jointly process audio and video, but they generate large token sequences under audio-visual inputs, leading to substantial inference cost. Existing audio-visual token compress