arrow
返回

Dense video captioning using unsupervised semantic information

delete2025-03-01
delete1
PRE
AI
V
Valter Estevam *
R
Rayson Laroca
H
Hélio Pedrini
D
David Menotti
DOI:10.1016/j.jvcir.2024.104385delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
我们提出了一种基于以下前提的无监督视觉语义信息学习方法:复杂事件可以分解为更简单的事件,而这些简单事件在多个复杂事件中是共享的。首先,我们采用聚类方法对表示进行分组,生成视觉词典。然后,通过编码词典条目的共现概率矩阵来学习密集表示。该表示在仅使用视觉特征的场景下,提升了密集视频字幕生成的性能。例如,我们替换了BMT方法中的音频信号,并生成了具有可比性能的时序提议。此外,我们将视觉表示与我们的描述符在标准的Transformer方法中进行拼接,与仅探索视觉特征的方法相比,在字幕生成子任务上实现了最佳性能,同时与多模态方法相比也取得了有竞争力的性能。我们的代码可在https://github.com/valterlej/dvcusi获取。
Keyword:
Visual similarity
Unsupervised learning
Co-occurrence estimation
Self-attention
Bi-modal attention

期刊

Journal of Visual Communication and Image Representation 封面图
Journal of Visual Communication and Image Representation
IF:
3.1
论文数:
427
被引数:
5.6K

机构

U
Univ Estadual Campinas
学者数:
769
论文数: 482
被引数: 94
U
Univ Fed Parana
学者数:
523
论文数: 245
被引数: 90