arrow
返回

Scene adaptive dynamic multi-modal knowledge for video captioning

delete2025-12-20
delete0
PRE
AI
H
Haoying Sun
S
Shuyi Li
Z
Zeyu Xi
Y
Yunhao Zhao
H
Haoran Zhang
毋立芳 封面图
毋立芳 (Lifang Wu) *
DOI:10.1016/j.eswa.2025.130820delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 将静态概念和动态上下文整合到Dynamic Multi-modal Knowledge中。 • 开发带有结构化Dynamic Multi-modal Knowledge的视频字幕模型。 • 引入上下文感知的自适应融合,用于细粒度多模态去噪。 • 应用属性引导的硬负样本对比对齐,进行跨模态匹配。 • 在定量和定性实验中展示了具有竞争力的性能。

期刊

Expert Systems with Applications 封面图
Expert Systems with Applications
IF:
7.5
论文数:
2.9W
被引数:
10.2W

机构

暂无机构信息
引用论文

引用论文

err分享
err收藏
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉
err2017-02-06
err3.1K
errOAAI
errKrishna, Ranjay; Zhu, Yuke; Groth, Oliver; Johnson, Justin; Hata, Kenji; Kravitz, Joshua; Chen, Stephanie; Kalantidis, Yannis; Li, Li-Jia; Shamma, David A.; Bernstein, Michael S.; Li Fei-Fei
err分享
err收藏
Knowledge Graphs for Multi-Modal Learning: Survey and Perspective多模态学习中的知识图谱:综述与展望
err
IF0
err2024-01-01
err0
PREAI
errZhuo Chen; Yichi Zhang; Yin Fang; Yuxia Geng; Lingbing Guo; Wen Zhang; Jiaoyan Chen; Xiaoze Liu; Jeff Z. Pan; Ningyu Zhang; Huajun Chen
err分享
err收藏
Generating Video Descriptions With Latent Topic Guidance
err2019-09-01
err0
PREAI
errShizhe Chen; Qin Jin; Jia Chen; Alexander G. Hauptmann
err分享
err收藏
Hierarchical Representation Network With Auxiliary Tasks for Video Captioning and Video Question Answering
err2022-01-01
err53
PREAI
errGao, Lianli; Lei, Yu; Zeng, Pengpeng; Song, Jingkuan; Wang, Meng; Shen, Heng Tao
err分享
err收藏
学者 查看更多内容