arXiv AI By Jaeyoon Jung, Yejun Yoon, Kunwoo Park

Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity

Read the original on arXiv AI →

The Flow has not summarised this story yet — read it at arXiv AI.

arXiv AI
Aug 10

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

arXiv:2608. 06938v1 Announce Type: cross Abstract: The visual reasoning ability of multimodal large language models (MLLMs) is crucial for downstream applications, particularly counter-commonsense reasoning, which requires models to reason beyond common assumptions.

By Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding
arXiv AI
6d ago

Faithful Chart Generation for Multimodal Deep Research: Frame-Evidence Co-Adaptation

The paper introduces Frame‑Evidence Co‑Adaptation (FECA), an evidence‑adaptive visual planning framework for generating analytical charts in multimodal deep research. FECA treats chart generation as an iterative interaction between visual frames and retrieved evidence, allowing frames to be guided, revised, or dropped based on evidence availability. Experiments on 100 real‑world research topics demonstrate that FECA improves numerical fidelity while maintaining report quality and chart utility.

By Yuxin Yue, Yingchen Zhang, Ruqing Zhang, Jiafeng Guo, Maarten de Rijke, Xueqi Cheng