Skip to content
arXiv cs.CV · Papers

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

arXiv:2607.14333v1 Announce Type: new Abstract: Vision Language Models (VLMs) demonstrate strong perceptual abilities but remain limited in tasks requiring analytical reasoning across multiple visual states, such as multi-image comparison, change detection, and multi-step visual inference. These capabilities are critic