返回
Continual Learning for Image Captioning Through Improved Image-Text Alignment
DOI:10.1007/978-3-032-14492-8_2.png)
摘要
En 中文
在持续学习环境下生成准确且连贯的图像字幕仍是一个主要挑战,这归因于灾难性遗忘以及随着时间的推移将不断演变的视觉概念与语言对齐的困难。本文提出了一种新颖的多损失框架用于持续图像字幕生成,该框架通过基于提示的持续学习和对比对齐整合了语义指导。基于预训练的ViT-GPT-2骨干网络,我们的方法结合了标准交叉熵损失与三个附加组件:(1)一种基于提示的余弦相似度损失,用于将图像嵌入与合成构建的提示对齐,这些提示编码了物体、属性和动作;(2)一种CLIP风格的损失,促进图像嵌入与目标字幕嵌入之间的对齐;(3)一种语言引导的对比损失,采用三元组损失以增强任务间的类别级可区分性。值得注意的是,我们的方法在推理时引入了无额外开销,且在字幕生成过程中无需提示。我们发现该方法能缓解灾难性遗忘,同时在语义字幕对齐方面优于当前最先进的方法。代码可通过以下链接获取 https://github.com/Gepardius/Taetz_Bordelius_Continual_ImageCaptioning。
Keyword:
Image Captioning
Continual Learning
Image-Text Alignment
期刊
A
IF:
0
论文数:
30
被引数:
0
机构
暂无机构信息

