← Back to all news
Hugging Face Trending Papers August 24, 2026

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

Read the original on Hugging Face Trending Papers →

The Flow has not summarised this story yet — read it at Hugging Face Trending Papers.

  • llms
  • fine-tuning
  • multimodal
  • benchmarks

One email a morning, machine-written

One email a day, machine-written, one click to leave. We never share your address.

Related stories

arXiv Computer Vision
1d ago

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

arXiv:2608.22996v1 Announce Type: new Abstract: Vision-Language Models (VLMs) perform well on diverse vision-language tasks, but transformer-based visual encoders split images into fixed-resolution s...

By Yuanhao Sun, Huawei Ji, Jiaxin Ding, Luoyi Fu, Xinbing Wang
llmsfine-tuningmultimodalbenchmarks
More like this →
arXiv AI
Aug 10

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

arXiv:2608. 07088v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) encode images as long visual token sequences, making prefilling and KV-cache storage expensive.

By Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo
llmsefficiencymultimodal
More like this →
arXiv AI
Jun 24

Listening makes Vision Clear for VLMs

arXiv:2606. 23763v1 Announce Type: cross Abstract: Recent work typically assesses vision--language consistency using attention distributions of answer-side tokens.

By Yiyang Chen, Yixin Tan, Binrui Shen
safety
More like this →
Hugging Face Trending Papers
Aug 11

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

Abundant visual information strengthens vision-language model (VLM) perception, yet massive visual tokens raise inference costs. Existing visual token pruning methods rely on similarity-based guidance, which exploits pairwise text-vision and vision-vision token correlations for compression.

llmsefficiencymultimodal
More like this →
arXiv AI
Jun 2

On the Limits of Token Reduction for Efficient Unified Vision Language Training

arXiv:2606. 01503v1 Announce Type: cross Abstract: Unified vision-language models (VLMs) integrate visual understanding and visual generation within a single autoregressive backbone, but their joint training is computationally expensive and largely overlooked from an efficiency perspective.

By Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv
llmsmultimodal
More like this →
arXiv AI
Jul 8

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

arXiv:2607. 05978v1 Announce Type: cross Abstract: Multimodal large language models can emit localized predictions, bounding boxes for objects and temporal windows for video and audio events, but they hallucinate these regions prolifically.

By Daniel Shalam, Emanuel Ben Baruch, Avi Ben Cohen, Tal Remez
llmscomputer-visionmultimodalsafety
More like this →
About Pricing API Newsletter Sources Privacy Terms Refunds Accessibility Provider info Contact RSS

The Flow links to publishers and never republishes their articles. Summaries are machine-generated.

v1.1.0 · 5f852ea