返回
PointDiff: Conditional Diffusion Model for Point-Supervised Video Moment Retrieval
DOI:10.1109/tmm.2026.3676163.png)
摘要
En 中文
基于单点标注的视频时刻检索(PS-VMR)旨在通过利用单点标注,检索与给定自然语言查询语义对齐的视频时刻。现有方法性能欠佳主要由于两方面:i) 生成的候选片段以随机选取的标注帧为中心,ii) 多个高斯分布的使用导致边界越界。为解决这些问题,我们提出了一种具有扩散模型精神的PS-VMR生成框架。具体而言,我们引入高斯先验约束模块以探索显著区域,并利用高斯权重实现紧凑的伪片段。随后,多模态条件扩散模块将伪片段扩散为随机噪声,再通过查询与视频间的相似性引导,将其去噪还原为初始片段。该框架增强了捕捉视频-查询关系的能力,并缓解了对标注帧的依赖。此外,我们整合了噪声强度预测任务,以辅助多模态条件扩散模块的降噪过程。我们在Charades-STA、ActivityNet Captions和TACoS三个基准上进行了大量实验,所提网络优于现有最优方法,证明了其有效性。
Keyword:
Diffusion model
point-supervised video moment retrieval (PS-VMR)
video understanding

