arXiv AI

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

arXiv:2606. 31407v1 Announce Type: cross Abstract: Vision-language models can produce confident answers on visually ambiguous inputs, resulting in biased predictions.