arXiv cs.CV
· Papers
T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
arXiv:2511.16107v4 Announce Type: replace Abstract: Visual in-context learning (VICL) solves visual tasks by conditioning on a few input-output demonstrations without any model training. Recent advances in large vision-language models (VLMs) have shown promising VICL capability when the demonstration pair and the query