返回
Action-to-Action Diffusion Network for Weakly Supervised Temporal Action Localization
DOI:10.1109/TMM.2025.3613174.png)
摘要
En 中文
弱监督时空动作定位(WTAL)旨在仅利用视频级监督在未剪辑视频中识别动作实例。尽管WTAL方法取得了近期进展,但实现精确的边界定位仍然是一个重大挑战。关键原因在于遵循定位-分类流水线的WTAL网络倾向于关注最具判别性的特征,而忽略了可能包含动作实例的一些模糊特征。为使WTAL模型聚焦于包含动作实例的低判别性特征,我们提出了动作到动作扩散(ActionDiff)网络。该网络利用扩散模型生成数据的平滑性,通过扩散模型输出平滑且高质量的特征来削弱基础分支的判别性动作特征,从而提升WTAL任务性能。首先,我们开发了一种基于topk的掩码策略,生成二值掩码作为扩散模型学习的伪标签。随后,我们提出扩散分支通过迭代去噪生成高质量的动作潜在空间,去噪过程由设计的伪标签和条件信息引导。为增强扩散分支生成人类行为特征的能力,我们设计了动作相关条件策略以获取条件信息,并利用其指导扩散分支建模人类行为知识。我们的全面实验表明,所提方法在THUMOS14、ActivityNet v1.2和v1.3三个基准数据集上取得了有前景的性能。
Keyword:
Temporal action localization
diffusion models
weakly supervised learning
temporal enhancement
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W

