arrow
返回

PointDiff: Conditional Diffusion Model for Point-Supervised Video Moment Retrieval

delete2026-03-20
delete0
PRE
AI
Z
Zihui Guo
Z
Zhenhai Yu
Y
Yan Zhang
DOI:10.1109/tmm.2026.3676163delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于单点标注的视频时刻检索(PS-VMR)旨在通过利用单点标注,检索与给定自然语言查询语义对齐的视频时刻。现有方法性能欠佳主要由于两方面:i) 生成的候选片段以随机选取的标注帧为中心,ii) 多个高斯分布的使用导致边界越界。为解决这些问题,我们提出了一种具有扩散模型精神的PS-VMR生成框架。具体而言,我们引入高斯先验约束模块以探索显著区域,并利用高斯权重实现紧凑的伪片段。随后,多模态条件扩散模块将伪片段扩散为随机噪声,再通过查询与视频间的相似性引导,将其去噪还原为初始片段。该框架增强了捕捉视频-查询关系的能力,并缓解了对标注帧的依赖。此外,我们整合了噪声强度预测任务,以辅助多模态条件扩散模块的降噪过程。我们在Charades-STA、ActivityNet Captions和TACoS三个基准上进行了大量实验,所提网络优于现有最优方法,证明了其有效性。
Keyword:
Diffusion model
point-supervised video moment retrieval (PS-VMR)
video understanding

期刊

IEEE Transactions on Multimedia 封面图
IEEE Transactions on Multimedia
IF:
9.7
论文数:
4.5K
被引数:
2.4W

机构

T
Tianjin Chengjian University
学者数:
206
论文数: 64
被引数: 0
引用论文

引用论文

暂无论文信息