返回
A knowledge-guided multimodal network for video summarization
DOI:10.1016/j.eswa.2026.132566.png)
摘要
En 中文
• 基于知识的编码器提供高级隐式知识以增强视频摘要。
• 设计了一个从精细到粗略的空间投影模块来建模多粒度多模态表示。
• 预测头保持同一镜头内语义的完整性和平滑性。
• 实验结果证明了所提出模型的有效性。
Keyword:
knowledge-guided
multimodal network
video summarization
representation learning
shot integrity
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
引用论文
暂无论文信息

