Return
A collaborative optimization framework for efficient long-sequence Audio-Visual understanding
DOI:10.1016/j.eswa.2026.132367.png)
Abstract
En 中文
• Cross-modal guided adaptive pruning boosts long-sequence audio-visual efficiency • Dynamic gating balances token compression with multimodal task performance • CG-ATP achieves 8.9× faster inference while retaining over 95% model accuracy • Framework enhances interpretability for efficient multimodal learning systems • Extensive benchmarks confirm superior trade-off of accuracy and computation
Keywords:
Audio-visual understanding
Transformer optimization
Token pruning
Multimodal learning
AI Summary
Key information extracted from the uploaded paper, including a brief overview, abstract, background, key highlights, visual analysis, and future outlook.
Journal
IF:
7.5
Papers:
2.9W
Citations:
10.2W

