arrow
Return

A collaborative optimization framework for efficient long-sequence Audio-Visual understanding

delete2026-04-09
delete0
delete
OA
AI
Y
Yiqun Ma
B
Bai, Hao *
X
Xueren Li
B
Bichen Shang
L
Liwei Zhang
W
Weijie Sun *
DOI:10.1016/j.eswa.2026.132367delete
deleteOriginal
deleteShare
deleteSave
View PDF
Abstract

Abstract

En 中文
• Cross-modal guided adaptive pruning boosts long-sequence audio-visual efficiency • Dynamic gating balances token compression with multimodal task performance • CG-ATP achieves 8.9× faster inference while retaining over 95% model accuracy • Framework enhances interpretability for efficient multimodal learning systems • Extensive benchmarks confirm superior trade-off of accuracy and computation
Keywords:
Audio-visual understanding
Transformer optimization
Token pruning
Multimodal learning
AI Summary

AI Summary

Key information extracted from the uploaded paper, including a brief overview, abstract, background, key highlights, visual analysis, and future outlook.

Journal

Expert Systems with Applications cover
Expert Systems with Applications
IF:
7.5
Papers:
2.9W
Citations:
10.2W

Organization

C
china university of mining and technology
Scholars:
5.7K
Papers: 2.0K
Citations: 0
P
purdue university
Scholars:
1.5K
Papers: 749
Citations: 1
U
University of Alberta
Scholars:
1.1K
Papers: 520
Citations: 1
H
Hainan Vocational University of Science and Technology
Scholars:
113
Papers: 84
Citations: 11
researcher View more organizations