返回
Video Segmentation and Tokenization for Model-Based Video Scene Classification
DOI:10.1109/TMM.2025.3595019.png)
摘要
En 中文
本文提出了一种新颖的方法,用于将视频场景记录分割并标记化为一系列级联单元,这些单元被称为视觉片段单元,并通过视觉片段模型(VSMs)进行建模,以实现视频场景分类(VSC)。具体而言,所提出的VSM框架以预训练编码器提取的深度视觉特征作为输入,并通过隐马尔可夫模型(HMM)来建模片段单元之间的时序交互。接下来,我们使用单元共现统计量来引入视频场景记录内VSM单元之间的关系。此外,VSM方法被扩展为一种声学-视觉变体,随后将其整合到一个基于深度学习的多模态场景分类系统中。这种组合旨在进一步利用音频和视频数据的互补特性。通过将一组视觉片段单元纳入视频场景类的建模中,它能够捕捉类间相似性和类内多样性,从而促进场景分类的改进,特别是在容易混淆的类别中。在DCASE(声学场景和事件检测与分类)2021挑战赛发布的基准数据集上的广泛实验结果表明,所提出的框架能够有效处理相似视频场景之间的混淆问题。此外,我们的多模态集成系统在DCASE 2021挑战赛的视听场景分类任务中达到了当前最优(state-of-the-art)性能,从而证明了所提出方法的有效性。
Keyword:
Video scene classification
visual segment model
pre-trained model
latent semantic analysis
deep learning
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W
机构
引用论文
暂无论文信息

