UniDiffFusion: A Unified Diffusion Framework for Multi-Task and Degradation-Robust Image Fusion
Read the original on arXiv Computer Vision →The Flow has not summarised this story yet — read it at arXiv Computer Vision.
The Flow has not summarised this story yet — read it at arXiv Computer Vision.
HP-UniIF is a unified vision framework that uses diffusion priors and a depth‑wise hierarchical conditional modulation strategy to support heterogeneous image fusion, visual restoration, and downstream perception tasks. The framework introduces task prompt modulation at bottleneck layers, a degradation prompt router at shallow layers, and an application prompt bank at decoding stages to decouple and adapt to different objectives. Experiments across multiple fusion tasks, degradations, and downstream applications show that HP‑UniIF achieves superior performance while maintaining visually faithful results and task‑relevant semantics.
arXiv:2609.01092v1 Announce Type: new Abstract: Text-guided image fusion has recently emerged as an effective paradigm for integrating multi-modal information while enabling flexible and task-oriente...
Infrared-visible image fusion (IVIF) is pivotal for multimodal perception, yet reconciling the inherent information disparity between thermal and textural features remains a fundamental challenge. Existing prior-guided methods often rely on static constraints that induce optimization conflicts or utilize extrinsic semantic priors from large-scale foundation models (e.
Multi-modality image fusion (MMIF) enhances scene representation by exploiting complementary cues from different modalities. Adverse weather, however, causes significant image degradation, disrupting feature representation and requiring simultaneous feature restoration and cross-modal complementarity.
Multimodal fusion learning (MFL) has shown great potential in the medical domain, where we are faced with disparate data modalities such as imaging, clinical records, and omics. However, existing MFL strategies face several major challenges.
arXiv:2608.29220v1 Announce Type: new Abstract: Multimodal image fusion (MMIF) aims to integrate complementary sensor data into a single representation that preserves intrinsic scene reality while el...