arrow
返回

Progressive Optimization Network for Open Vocabulary Point-supervised Temporal Action Localization

delete2026-07-31
delete0
PRE
AI
J
Jing Wang
孔
孔德慧 (Dehui Kong)
J
Jinghua Li
X
Xiaochen Wang
B
Baocai Yin
DOI:10.1109/tbdata.2026.3718719delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
开放词汇表时空动作定位(OVTAL)旨在利用已见动作类别的先验知识来检测未见类别。然而,现有方法常因视觉特征与类别语义之间的对齐不准确而受限,显著影响模型性能,尤其在处理新颖动作类别时。提升视觉与文本信息的对齐质量是OVTAL的关键挑战。因此,本文提出一种带单时间戳监督的渐进优化网络(PONet),以增强模型识别和定位新颖动作类别的能力。具体而言,PONet采用语义引导的早期增强进行初始特征筛选,有效强化类别相关视觉信息并抑制无关噪声。在此基础上,引入上下文语义晚期增强,联合建模来自时序和语义通道的视觉特征,分层优化视觉-语义对齐并提升视觉表征的类别判别力。最后,利用伪标签约束优化动作边界,显著提高动作定位的精度和鲁棒性。在THUMOS14和ActivityNet1.3数据集上的大量实验表明,PONet有效减少了对全标签数据的依赖,同时增强开放词汇场景下动作定位的完整性和精度,达到当前最佳性能。
Keyword:
Video Understanding
Action Localization
Multimodal Fusion
Open-vocabulary

期刊

I
IEEE Transactions on Big Data
IF:
5.7
论文数:
887
被引数:
3.0K

机构

B
Beijing University of Technology
学者数:
2.0K
论文数: 600
被引数: 0
引用论文

引用论文

暂无论文信息