arrow
返回

Enhancing video temporal grounding with large language model-based data augmentation

delete2025-03-25
delete0
PRE
AI
Y
Yun Tian
X
Xiaobo Guo *
汪
汪劲松 (Jinsong Wang)
李彬 封面图
李彬 (Bin Li)
DOI:10.1007/s11227-025-07159-0delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在给定未裁剪视频和自然语言查询的情况下,视频时序定位(VTG)任务旨在精确识别视频中与查询语义匹配的时间片段。该任务的现有数据集通常提供过于简单且人工标注的自然语言查询,这些查询缺乏足够的语义丰富性,无法充分捕捉视频内容。这一限制阻碍了模型理解复杂语义场景的能力,并降低了其整体性能。为解决这些挑战,我们提出了一种新颖的、低成本、基于大型语言模型的数据增强方法,该方法能够在不依赖外部数据的情况下丰富原始样本并扩展数据集。我们提出了一种带有噪声过滤器的细粒度图像描述模块,用于从视频中提取未利用的信息。此外,我们设计了一个层次化语义提示框架,以引导GPT-3.5生成语义丰富且上下文连贯的自然语言查询。我们的方法在与2D-TAN和VSLNet结合时,在三个公开的VTG数据集上超越了当前最优方法MRTNet,尤其在复杂语义和长时段时间片段定位方面表现突出。
Keyword:
Video temporal grounding
Large language model
Data augmentation
Video description
Semantic enrichment

期刊

Journal of Supercomputing 封面图
Journal of Supercomputing
IF:
2.7
论文数:
1.1K
被引数:
1.0W

机构

C
Changchun University of Science and Technology
学者数:
1.8K
论文数: 578
被引数: 4.3K
C
chinese acad sci
学者数:
1.8W
论文数: 1.1W
被引数: 4.6K
引用论文

引用论文

BLEU布卢
err2001-01-01
err0
errOAAI
errKishore Papineni; Salim Roukos; Todd Ward; Wei-Jing Zhu
err分享
err收藏
err
IF0
err
err0
errOAAI
err
err分享
err收藏
Rethinking the Bottom-Up Framework for Query-Based Video Localization
err2020-04-03
err0
errOAAI
errLong Chen; Chujie Lu; Siliang Tang; Jun Xiao; Dong Zhang; Chilie Tan; Xiaolin Li
err分享
err收藏
Point-Supervised Video Temporal Grounding
err2023-01-01
err6
PREAI
errXu, Zhe; Wei, Kun; Yang, Xu; Deng, Cheng
err分享
err收藏
学者 查看更多内容