返回
Dense video captioning using unsupervised semantic information
DOI:10.1016/j.jvcir.2024.104385.png)
摘要
En 中文
我们提出了一种基于以下前提的无监督视觉语义信息学习方法:复杂事件可以分解为更简单的事件,而这些简单事件在多个复杂事件中是共享的。首先,我们采用聚类方法对表示进行分组,生成视觉词典。然后,通过编码词典条目的共现概率矩阵来学习密集表示。该表示在仅使用视觉特征的场景下,提升了密集视频字幕生成的性能。例如,我们替换了BMT方法中的音频信号,并生成了具有可比性能的时序提议。此外,我们将视觉表示与我们的描述符在标准的Transformer方法中进行拼接,与仅探索视觉特征的方法相比,在字幕生成子任务上实现了最佳性能,同时与多模态方法相比也取得了有竞争力的性能。我们的代码可在https://github.com/valterlej/dvcusi获取。
Keyword:
Visual similarity
Unsupervised learning
Co-occurrence estimation
Self-attention
Bi-modal attention
期刊
IF:
3.1
论文数:
427
被引数:
5.6K

