arrow
返回

Generative External Knowledge for Zero-shot Action Recognition

delete2025-06-01
delete0
PRE
AI
J
Jianing Mao
X
Xinhang Xu
X
Xinran Li
X
Xiang Meng
DOI:10.1016/j.eswa.2025.127420delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
零样本动作识别(ZSAR)旨在推断新的动作类别,而无需这些类别的任何样本。获取语言和视觉知识的传统方法限制了此类知识的关联性和丰富性,从而增加了对未见类别的识别泛化难度。为解决此问题,本文提出了一种基于生成式外部知识的ZSAR新方法。具体而言,利用视觉-语言大规模模型生成高质量对象,以作为视频样本的语言知识。同时,通过文本到图像的大规模模型从类别描述生成类别图像,以作为类别的视觉知识。随后,结合统一的 多流Transformer框架的CLIP预训练编码器,通过双独立编码器之间的强交互学习增强的跨模态表示。此外,本文提出了一种基于生成知识及多原型CLIP(GK-MP-CLIP)的新型预测模型,该模型利用类别图像的数量形成多原型表示以支持分类。所提方法全面应用生成式的视觉和语言知识构建视频与类别之间的关系,从而提升ZSAR性能。实验结果证明了所提方法在提升物体交互动作的零样本识别准确率方面的显著优势。这表明,选择与数据集特征相符的知识来源可以改善ZSAR性能。
Keyword:
Zero-shot action recognition
Generative external knowledge
Cross-modal representation

期刊

Expert Systems with Applications 封面图
Expert Systems with Applications
IF:
7.5
论文数:
3.0W
被引数:
10.2W

机构

C
china mobile commun grp henan co ltd
学者数:
1
论文数: 1
被引数: 0
引用论文

引用论文

Global Semantic Descriptors for Zero-Shot Action Recognition
err2022-01-01
err0
errOAAI
errEstevam, Valter; Laroca, Rayson; Pedrini, Helio; Menotti, David
err分享
err收藏
err分享
err收藏
Fine-tuned CLIP Models are Efficient Video Learners
err2023-06-01
err0
errOAAI
errHanoona Rasheed; Muhammad Uzair Khattak; Muhammad Maaz; Salman Khan; Fahad Shahbaz Khan
err分享
err收藏
Relative attributes
err2011-11-01
err0
PREAI
errDevi Parikh; Kristen Grauman
err分享
err收藏
A Closer Look at Spatiotemporal Convolutions for Action Recognition
err2018-06-01
err0
errOAAI
errDu Tran; Heng Wang; Lorenzo Torresani; Jamie Ray; Yann LeCun; Manohar Paluri
err分享
err收藏
学者 查看更多内容