返回
Generative External Knowledge for Zero-shot Action Recognition
DOI:10.1016/j.eswa.2025.127420.png)
摘要
En 中文
零样本动作识别(ZSAR)旨在推断新的动作类别,而无需这些类别的任何样本。获取语言和视觉知识的传统方法限制了此类知识的关联性和丰富性,从而增加了对未见类别的识别泛化难度。为解决此问题,本文提出了一种基于生成式外部知识的ZSAR新方法。具体而言,利用视觉-语言大规模模型生成高质量对象,以作为视频样本的语言知识。同时,通过文本到图像的大规模模型从类别描述生成类别图像,以作为类别的视觉知识。随后,结合统一的 多流Transformer框架的CLIP预训练编码器,通过双独立编码器之间的强交互学习增强的跨模态表示。此外,本文提出了一种基于生成知识及多原型CLIP(GK-MP-CLIP)的新型预测模型,该模型利用类别图像的数量形成多原型表示以支持分类。所提方法全面应用生成式的视觉和语言知识构建视频与类别之间的关系,从而提升ZSAR性能。实验结果证明了所提方法在提升物体交互动作的零样本识别准确率方面的显著优势。这表明,选择与数据集特征相符的知识来源可以改善ZSAR性能。
Keyword:
Zero-shot action recognition
Generative external knowledge
Cross-modal representation
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
引用论文
CLIP4Clip: An empirical study of CLIP for end to end video clip retrieval and captioningCLIP4Clip: 端到端视频剪辑检索和字幕剪辑的实证研究
NEUROCOMPUTING
IF6.5

