SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
arXiv:2607.14333v1 Announce Type: new Abstract: Vision Language Models (VLMs) demonstrate strong perceptual abilities but remain limited in tasks requiring analytical reasoning across multiple visual states, such…