arrow
返回

A Multi-Modal Knowledge-Driven Approach for Generalized Zero-shot Video Classification

delete2026-01-04
delete0
PRE
AI
M
Mingyao Hong
X
Xinfeng Zhang *
G
Guorong Li
Q
Q. Huang
DOI:10.1007/s11263-025-02584-3delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
仅通过类别名称学习视频信息限制了泛化零样本视频分类(GZSVC)任务的发展。通过分析人类学习新事物的方式,我们发现人们可以利用文本概念和视觉基础等知识来构建新的视频认知。受此启发,我们提出了一种多模态知识驱动的方法,通过搜索和学习多种知识来解决GZSVC任务。在现实世界中,很难保证新视频的重要组件能被现有知识覆盖。为弥合这一知识差距,我们的方法为类别构建了基于多模态信息的可靠知识补充,这也能在类别之间建立连接。为了融合不同模态的信息,我们提出了一个多模态生成模型,以合成内容丰富且更接近视频真实分布的视觉特征。由于训练过程缺乏真实的未见视觉信息,我们提出模型应更关注任务中的语义信息,并在所提出的框架中强化了语义信息的约束与利用。在多个数据库上的广泛实验结果表明,我们提出的方法优于当前最先进的GZSVC方法。
Keyword:
Generalized Zero-shot Learning
Video Classification
Generative Adversarial Network
Multi-modal Knowledge

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

S
School of Computer Science and Technology
学者数:
1.5K
论文数: 566
被引数: 0
引用论文

引用论文

err分享
err收藏
err分享
err收藏
Learning temporal information and object relation for zero-shot action recognition
err2022-07-01
err14
PREAI
errQi, Qiuping; Wang, Hanli; Su, Taiyi; Liu, Xianhui
err分享
err收藏
学者 查看更多内容