Skip to content
arXiv cs.CL · Papers

Failing to See or Failing to Know? Attributing Errors in Vision-Language Models

arXiv:2607.04683v4 Announce Type: replace-cross Abstract: Vision-language models (VLMs) can recognize entities in clear images yet still fail when answering questions that require factual knowledge beyond what is directly observable. Prior work has either examined individual failure modes in isolation or treated incorr