返回
Transferring External Knowledge to Weakly Supervised Temporal Action Localization
DOI:10.1007/978-981-95-3483-8_19.png)
摘要
En 中文
弱监督时空动作定位是一种监督不完整的任务,旨在在视频级动作标签监督下定位动作实例。尽管近年来取得了显著进展,但仍存在上下文混淆和局部定位问题,这主要源于分类模型与定位任务之间的目标不一致。本质上,这是一个粗粒度标签信息难以确保实例级数据与视频级标签对齐的问题。该问题主要源于精确标注信息的缺乏,限制了任务性能。为解决此问题,我们提出引入两种外部知识:显式知识(如知识图谱),有助于从标签语义中提取复杂动作细节;以及来自预训练模型的隐性知识,通过利用丰富的潜在信息促进视觉与文本的最优对齐。在本文中,我们首先将这两种知识分别引入基准方法框架中。随后,我们旨在有效整合这些知识以引入额外信息。我们的方法采用模块化、即插即用设计,允许知识无缝集成到各种方法中,使其成为高效且灵活的尝试。此外,实验结果表明,我们的方法在THUMOS'14数据集和两个基准模型上提升了性能。
Keyword:
External knowledge
Weakly supervised
Annotation information
Temporal action localization
Pre-trained model
期刊
B
IF:
0
论文数:
29
被引数:
0
机构
引用论文
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks更快的r-cnn: 基于区域建议网络的实时目标检测
Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering使VQA中的V重要: 提升图像理解在视觉问答中的作用

