MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
arXiv:2608.11167v1 Announce Type: cross Abstract: Existing Multimodal Large Language Models (MLLMs) predominantly rely on image-text pairs for modality alignment pretraining, mapping global image representations to long…