arXiv AI By Ziwei Cheng, Zhenhua Tan, Zhuomin Zhu

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

Read the original on arXiv AI →

arXiv:2607. 29112v1 Announce Type: cross Abstract: Audio-visual speech recognition (AVSR) relies on effective fusion of audio and visual modalities, yet existing approaches treat cross-modal interaction as a single-step operation without structured iterative refinement.

Summary generated by The Flow from the publisher's feed. The full article lives at arXiv AI.