返回
Scene adaptive dynamic multi-modal knowledge for video captioning
DOI:10.1016/j.eswa.2025.130820.png)
摘要
En 中文
• 将静态概念和动态上下文整合到Dynamic Multi-modal Knowledge中。
• 开发带有结构化Dynamic Multi-modal Knowledge的视频字幕模型。
• 引入上下文感知的自适应融合,用于细粒度多模态去噪。
• 应用属性引导的硬负样本对比对齐,进行跨模态匹配。
• 在定量和定性实验中展示了具有竞争力的性能。
期刊
IF:
7.5
论文数:
2.9W
被引数:
10.2W
机构
暂无机构信息
引用论文
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks更快的r-cnn: 基于区域建议网络的实时目标检测
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉
Semantic-filtered Soft-Split-Aware video captioning with audio-augmented feature具有音频增强功能的语义过滤软分割感知视频字幕
NEUROCOMPUTING
IF6.5

