arrow
返回

Towards General Cross-Modal Visual Coding for Emergency Communications

delete2025-12-03
delete0
PRE
AI
P
Peilin Li
陈
陈亚楠 (Yanan Chen)
L
Lindong Zhao
A
Ang Li
B
Bin Kang
吴丹 封面图
吴丹 (Dan Wu)
L
Liang Zhou
DOI:10.1109/TMM.2025.3639942delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
多模态视觉信号在应急通信中普遍存在。为确保在带宽限制下信号传输的高可靠性,尽可能压缩模态内和模态间的冗余信息并保证重建信号的保真度至关重要。大多数现有研究仅依赖单模态编码方案,未能有效利用模态间的语义相关性。在本文中,我们提出了一种端到端的通用跨模态视觉编码方案,即CMVC,旨在联合压缩多模态视觉信号(如可见光和红外信号)。首先,我们提出一种跨模态异步熵模块,利用交叉注意力机制提取共性特征。此外,通过最大化互信息损失来增强共性特征提取的准确性。该模块通过仅压缩模态间的残差特征进一步压缩多模态视觉信号。其次,我们提出一种基于跨模态Mamba的级联增强模块,融合互补信息以提升多模态视觉信号的重建质量。最后,广泛的实验结果表明,我们的方案在可见光-红外数据集上显著优于其他先进方法。即使在低比特率下,多模态视觉信号仍能实现出色的重建质量。此外,当应用于可见光-深度信号时,我们的方案表现出卓越的压缩与重建性能,有效展示了其鲁棒性和通用性。
Keyword:
Cross-modal Mamba
cross-modal visual coding
emergency communications
mutual information loss
semantic correlations

期刊

IEEE Transactions on Multimedia 封面图
IEEE Transactions on Multimedia
IF:
9.7
论文数:
4.5K
被引数:
2.4W

机构

A
army engineering university of pla
学者数:
238
论文数: 76
被引数: 0
N
Nanjing University of Posts and Telecommunications
学者数:
2.4K
论文数: 969
被引数: 1.2W
引用论文

引用论文

err分享
err收藏
Estimating mutual information估计互信息
err2004-06-23
err0
errOAAI
errAlexander Kraskov; Harald Stögbauer; Peter Grassberger
err分享
err收藏
Resource-Efficient RGBD Aerial Tracking
err2023-06-01
err0
PREAI
errJinyu Yang; Shang Gao; Zhe Li; Feng Zheng; Aleš Leonardis
err分享
err收藏
学者 查看更多内容