返回
Frame-by-Frame Multi-Object Tracking-Guided Video Captioning
DOI:10.1109/TCSVT.2025.3541965.png)
摘要
En 中文
通过深度学习的视频字幕生成呈现出一个多方面的挑战,涵盖了复杂时空视觉特征的提取和有意义自然语言描述的合成。大多数现有的深度学习模型可以大致分为基于卷积或基于Transformer的编码器-解码器网络,前者的视频字幕从像素级编码的特征生成,而后者的字幕则根据编码器的复杂性从网格级、帧级或视频级编码的特征生成。本文主张帧级特征作为更平衡和紧凑的表示形式,用于快速字幕生成,并介绍了Tracking-guided Information Augmentation for Captioning(Track4Cap)模型,该模型集成了跟踪引导的信息增强以增强帧级特征,而无需依赖复杂架构或额外的数据模态。具体而言,Track4Cap采用帧级多目标跟踪模块(FMoT)来识别输入视频中最相关的对象,并使用对象关系编码器(ORE)将对象间关系建模为字幕生成的补充高级提示。通过避免耗时的一体化训练并利用紧凑表示,Track4Cap在提高字幕性能的同时实现了计算效率。在两个常用基准数据集上的广泛实验表明,Track4Cap不仅实现了更快的推理时间,还在性能上优于当前最先进的基于卷积和基于Transformer的视频字幕生成模型。我们的方法实现公开可访问于https://github.com/ccc000-png/Tracker4Cap。
Keyword:
Video captioning
natural language descriptions
deep learning
spatio-temporal visual features
frame-level features
期刊
IF:
11.1
论文数:
845
被引数:
3.1W
机构
引用论文
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks更快的r-cnn: 基于区域建议网络的实时目标检测
CLIP4Clip: An empirical study of CLIP for end to end video clip retrieval and captioningCLIP4Clip: 端到端视频剪辑检索和字幕剪辑的实证研究
NEUROCOMPUTING
IF6.5

