arrow
返回

Video Segmentation and Tokenization for Model-Based Video Scene Classification

delete2025-01-01
delete0
PRE
AI
Q
Qing Wang
Y
Yajian Wang
H
Hang Chen
S
Shuxian Wang
杜俊 (Jun Du)
C
Chin‐Hui Lee
DOI:10.1109/TMM.2025.3595019delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文提出了一种新颖的方法,用于将视频场景记录分割并标记化为一系列级联单元,这些单元被称为视觉片段单元,并通过视觉片段模型(VSMs)进行建模,以实现视频场景分类(VSC)。具体而言,所提出的VSM框架以预训练编码器提取的深度视觉特征作为输入,并通过隐马尔可夫模型(HMM)来建模片段单元之间的时序交互。接下来,我们使用单元共现统计量来引入视频场景记录内VSM单元之间的关系。此外,VSM方法被扩展为一种声学-视觉变体,随后将其整合到一个基于深度学习的多模态场景分类系统中。这种组合旨在进一步利用音频和视频数据的互补特性。通过将一组视觉片段单元纳入视频场景类的建模中,它能够捕捉类间相似性和类内多样性,从而促进场景分类的改进,特别是在容易混淆的类别中。在DCASE(声学场景和事件检测与分类)2021挑战赛发布的基准数据集上的广泛实验结果表明,所提出的框架能够有效处理相似视频场景之间的混淆问题。此外,我们的多模态集成系统在DCASE 2021挑战赛的视听场景分类任务中达到了当前最优(state-of-the-art)性能,从而证明了所提出方法的有效性。
Keyword:
Video scene classification
visual segment model
pre-trained model
latent semantic analysis
deep learning

期刊

IEEE Transactions on Multimedia 封面图
IEEE Transactions on Multimedia
IF:
9.7
论文数:
4.5K
被引数:
2.4W

机构

G
Georgia Institute of Technology
学者数:
1.8W
论文数: 1.4W
被引数: 5.9W
U
university of science and technology of china
学者数:
1.0W
论文数: 3.9K
被引数: 3
引用论文

引用论文

暂无论文信息