返回
Learning semantic consistency for audio-visual zero-shot learning
DOI:10.1007/s10462-025-11228-4.png)
摘要
En 中文
视听零样本学习需要理解音频和视觉信息之间的关系以确定未见过的类别。尽管在该领域付出了许多努力并取得了显著进展,但许多现有方法倾向于关注学习强表示,忽视了音频与视频之间的语义一致性以及数据的固有层次结构。为了解决这些问题,我们提出了用于视听零样本学习的语义一致性学习。具体而言,我们采用注意力机制来增强跨模态信息交互,旨在捕捉音频和视觉数据之间的语义一致性。同时,我们引入了双曲空间来建模数据本身的层次结构。此外,所提出的方法包含一个新颖的损失函数,该函数考虑了输入模态之间的关系,减少了不同模态特征之间的距离。为了评估所提出的方法,我们在三个基准数据集 \documentclass[12pt]{minimal} \usepackage{amsmath} \usepackage{wasysym} \usepackage{amsfonts} \usepackage{amssymb} \usepackage{amsbsy} \usepackage{mathrsfs} \usepackage{upgreek} \setlength{\oddsidemargin}{-69pt} \begin{document}$$\hbox {VGGSound-GZS}{{\textrm{L}}<^>{cls}}$$\end{document}、\documentclass[12pt]{minimal} \usepackage{amsmath} \usepackage{wasysym} \usepackage{amsfonts} \usepackage{amssymb} \usepackage{amsbsy} \usepackage{mathrsfs} \usepackage{upgreek} \setlength{\oddsidemargin}{-69pt} \begin{document}$$\hbox {UCF-GZS}{{\textrm{L}}<^>{cls}}$$\end{document} 和 \documentclass[12pt]{minimal} \usepackage{amsmath} \usepackage{wasysym} \usepackage{amsfonts} \usepackage{amssymb} \usepackage{amsbsy} \usepackage{mathrsfs} \usepackage{upgreek} \setlength{\oddsidemargin}{-69pt} \begin{document}$$\hbox {ActivityNet-GZS}{{\textrm{L}}<^>{cls}}$$\end{document} 上进行了测试。广泛的实验结果表明,所提出的方法在所有三个数据集上都达到了最先进性能。例如,在 \documentclass[12pt]{minimal} \usepackage{amsmath} \usepackage{wasysym} \usepackage{amsfonts} \usepackage{amssymb} \usepackage{amsbsy} \usepackage{mathrsfs} \usepackage{upgreek} \setlength{\oddsidemargin}{-69pt} \begin{document}$$\hbox {UCF-GZS}{{\textrm{L}}<^>{cls}}$$\end{document} 数据集上,调和平均数提高了5.7%。代码和数据可在 https://github.com/ybyangjing/LSC-AVZSL 获取。
Keyword:
Audio-visual zero-shot learning
Video classification
Attention mechanism
Hyperbolic geometry
Semantic consistency
期刊
IF:
13.9
论文数:
6.1K
被引数:
1.9W
机构
引用论文
HiCMAE: Hierarchical Contrastive Masked Autoencoder for self-supervised Audio-Visual Emotion RecognitionHiCMAE: 用于自监督视听情感识别的分层对比掩蔽自编码器
INFORMATION FUSION
IF15.5
A Generative Approach to Audio-Visual Generalized Zero-Shot Learning: Combining Contrastive and Discriminative Techniques一种用于视听泛化零样本学习的生成方法:结合对比和判别技术
SPIRF-CTA: Selection of parameter importance levels for reasonable forgetting in continuous task adaptationSpirf-cta: 连续任务适应中合理遗忘的参数重要度选择

