arXiv cs.CV
· Papers
SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
arXiv:2607.14333v1 Announce Type: new Abstract: Vision Language Models (VLMs) demonstrate strong perceptual abilities but remain limited in tasks requiring analytical reasoning across multiple visual states, such as multi-image comparison, change detection, and multi-step visual inference. These capabilities are critic