arrow
返回

Frame-by-Frame Multi-Object Tracking-Guided Video Captioning

delete2025-07-01
delete0
PRE
AI
H
Huilan Luo
X
Xia Cai
L
Lik‐Kwan Shark
DOI:10.1109/TCSVT.2025.3541965delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
通过深度学习的视频字幕生成呈现出一个多方面的挑战,涵盖了复杂时空视觉特征的提取和有意义自然语言描述的合成。大多数现有的深度学习模型可以大致分为基于卷积或基于Transformer的编码器-解码器网络,前者的视频字幕从像素级编码的特征生成,而后者的字幕则根据编码器的复杂性从网格级、帧级或视频级编码的特征生成。本文主张帧级特征作为更平衡和紧凑的表示形式,用于快速字幕生成,并介绍了Tracking-guided Information Augmentation for Captioning(Track4Cap)模型,该模型集成了跟踪引导的信息增强以增强帧级特征,而无需依赖复杂架构或额外的数据模态。具体而言,Track4Cap采用帧级多目标跟踪模块(FMoT)来识别输入视频中最相关的对象,并使用对象关系编码器(ORE)将对象间关系建模为字幕生成的补充高级提示。通过避免耗时的一体化训练并利用紧凑表示,Track4Cap在提高字幕性能的同时实现了计算效率。在两个常用基准数据集上的广泛实验表明,Track4Cap不仅实现了更快的推理时间,还在性能上优于当前最先进的基于卷积和基于Transformer的视频字幕生成模型。我们的方法实现公开可访问于https://github.com/ccc000-png/Tracker4Cap。
Keyword:
Video captioning
natural language descriptions
deep learning
spatio-temporal visual features
frame-level features

期刊

IEEE Transactions on Circuits and Systems for Video Technology 封面图
IEEE Transactions on Circuits and Systems for Video Technology
IF:
11.1
论文数:
845
被引数:
3.1W

机构

J
Jiangxi University of Science and Technology
学者数:
4.0K
论文数: 1.3K
被引数: 7.2K
U
University of Central Lancashire
学者数:
2.9K
论文数: 2.9K
被引数: 3.5K
引用论文

引用论文

BLEU布卢
err2001-01-01
err0
errOAAI
errKishore Papineni; Salim Roukos; Todd Ward; Wei-Jing Zhu
err分享
err收藏
Diverse Video Captioning by Adaptive Spatio-temporal Attention
err2022-09-20
err0
errOAAI
errZohreh Ghaderi; Leonard Salewski; Hendrik P. A. Lensch
err分享
err收藏
err分享
err收藏
Long Short-Term Memory长短期记忆
err1997-11-01
err0
PREAI
errSepp Hochreiter; Jürgen Schmidhuber
err分享
err收藏
Hierarchical Representation Network With Auxiliary Tasks for Video Captioning and Video Question Answering
err2022-01-01
err53
PREAI
errGao, Lianli; Lei, Yu; Zeng, Pengpeng; Song, Jingkuan; Wang, Meng; Shen, Heng Tao
err分享
err收藏
Video Swin Transformer视频Swin变压器
err2022-06-01
err0
PREAI
errZe Liu; Jia Ning; Yue Cao; Yixuan Wei; Zheng Zhang; Stephen Lin; Han Hu
err分享
err收藏
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
err2024-11-27
err0
PREAI
errYi Wang; Kunchang Li; Xinhao Li; Jiashuo Yu; Yinan He; Guo Chen; Baoqi Pei; Rongkun Zheng; Zun Wang; Yansong Shi; Tianxiang Jiang; Songze Li; Jilan Xu; Hongjie Zhang; Yifei Huang; Yu Qiao; Yali Wang; Limin Wang
err分享
err收藏
学者 查看更多内容