返回
Enhancing video temporal grounding with large language model-based data augmentation
DOI:10.1007/s11227-025-07159-0.png)
摘要
En 中文
在给定未裁剪视频和自然语言查询的情况下,视频时序定位(VTG)任务旨在精确识别视频中与查询语义匹配的时间片段。该任务的现有数据集通常提供过于简单且人工标注的自然语言查询,这些查询缺乏足够的语义丰富性,无法充分捕捉视频内容。这一限制阻碍了模型理解复杂语义场景的能力,并降低了其整体性能。为解决这些挑战,我们提出了一种新颖的、低成本、基于大型语言模型的数据增强方法,该方法能够在不依赖外部数据的情况下丰富原始样本并扩展数据集。我们提出了一种带有噪声过滤器的细粒度图像描述模块,用于从视频中提取未利用的信息。此外,我们设计了一个层次化语义提示框架,以引导GPT-3.5生成语义丰富且上下文连贯的自然语言查询。我们的方法在与2D-TAN和VSLNet结合时,在三个公开的VTG数据集上超越了当前最优方法MRTNet,尤其在复杂语义和长时段时间片段定位方面表现突出。
Keyword:
Video temporal grounding
Large language model
Data augmentation
Video description
Semantic enrichment
期刊
IF:
2.7
论文数:
1.1K
被引数:
1.0W
机构
引用论文
D3G: Exploring Gaussian Prior for Temporal Sentence Grounding with Glance AnnotationD3G:探索带有瞥视标注的时序句子锚定中的高斯先验

