返回
Multi-Temporal Granularity Concept Induction for semantically driven video summarization
DOI:10.1016/j.eswa.2025.127128.png)
摘要
En 中文
现有视频摘要方法主要关注提取和分析视觉特征,但常常忽略了视频帧之间的高层语义关联。该方法虽然处理了表层视觉元素,但未能充分理解视频的复杂场景、人物及事件及其时序关联,导致生成的摘要缺乏代表性。为解决此问题,本文提出了一种基于多时序粒度概念诱导(MTGC-VS)的视频摘要方法。该方法首先通过多粒度的概念编码器对输入视频的时序关联和语义信息进行建模,识别视频中最具代表性的语义原型作为视频概念,随后将这些概念整合以形成视频的整体语义。在此基础上,引入语义增强器以强化每帧与整体语义的相关性,识别与整体意义最契合的关键内容,增强摘要与原视频的语义一致性,使摘要更具语义代表性。该方法在TVSum和SumMe数据集上进行了大量实验验证,并与当前最先进方法进行了比较。实验结果表明,MTGC-VS方法具有显著有效性。
Keyword:
Video summarization
Multi-temporal granularity
Concept induction
General semantic
期刊
IF:
7.5
论文数:
2.9W
被引数:
10.2W
机构
暂无机构信息
引用论文
Unsupervised Video Summarization With Cycle-Consistent Adversarial LSTM Networks基于周期一致性对抗LSTM网络的无监督视频摘要
Unsupervised video summarization using deep Non-Local video summarization networks
NEUROCOMPUTING
IF6.5

