arXiv cs.CL
· Papers
Failing to See or Failing to Know? Attributing Errors in Vision-Language Models
arXiv:2607.04683v4 Announce Type: replace-cross Abstract: Vision-language models (VLMs) can recognize entities in clear images yet still fail when answering questions that require factual knowledge beyond what is directly observable. Prior work has either examined individual failure modes in isolation or treated incorr