返回
Attribute-Based Learning for Remote Sensing Image Captioning in Unseen Scenes
DOI:10.3390/rs17071237.png)
摘要
En 中文
遥感图像字幕生成(RSIC)旨在以自然语言形式描述遥感图像中的地面物体和场景。随着遥感图像中场景的复杂性和多样性增加,现有方法虽然在特定任务中有效,但主要是在特定场景图像和语料库上进行训练。这限制了它们对训练中未遇到的场景生成描述的能力。鉴于数据标注资源的有限性和应用场景范围的扩大,训练数据通常仅覆盖部分常见场景,导致许多潜在的场景类型未被代表。因此,开发能够有效处理未见场景且训练数据有限的模型势在必行。本研究介绍了一种基于场景属性学习的创新遥感图像字幕生成模型-SALCap。所提出的模型定义了场景属性,并采用专门设计的全局对象场景属性提取器来捕获这些属性。然后,它使用属性推理模块通过场景属性预测场景信息,并通过额外的属性损失确保这部分场景信息在句子生成中被重用。实验表明,该方法不仅提高了描述的准确性,而且显著增强了模型对未见场景的适应性和泛化能力。这一进展扩展了遥感图像字幕生成在多种场景下的实际应用,特别是在标注有限的约束条件下。
Keyword:
image captioning
remote sensing
unseen scenes
transformer network
global semantic information

