Skip to content
arXiv cs.CV · Papers

T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

arXiv:2511.16107v4 Announce Type: replace Abstract: Visual in-context learning (VICL) solves visual tasks by conditioning on a few input-output demonstrations without any model training. Recent advances in large vision-language models (VLMs) have shown promising VICL capability when the demonstration pair and the query