返回
Entity-Guided Caption Generation for Remote Sensing Images
DOI:10.1109/TGRS.2026.3660344.png)
摘要
En 中文
遥感图像字幕生成(RSIC)旨在通过自然语言描述遥感图像中的高层语义、空间配置以及物体之间的关系。近期进展尝试将遥感图像中的实体信息融入其中,以引导准确字幕的生成。尽管这些方法已展现出有前景的结果,但由于实体识别精度低和提取的实体信息利用不足,其有效性仍受限制。为解决这些问题,我们提出了一种双流框架,即针对遥感图像的实体引导字幕生成(EG-Cap)。具体而言,EG-Cap首先采用顺序多实体生成器(SMEG)将实体识别重新表述为序列生成任务,通过捕捉实体上下文依赖关系提高识别精度。随后,通过实体-视觉自适应融合(EVAF)模块,利用实体感知门控机制,根据语义兼容性对实体与视觉特征进行加权融合,从而增强实体信息的利用。最后,多尺度上下文聚合(MCA)模块借助级联Transformer解码器,从实体-视觉表示中捕捉多尺度上下文依赖关系,确保语义连贯的字幕生成。在Sydney-Captions、UCM-Captions和RSICD数据集上的实验结果表明,EG-Cap相较于现有最先进方法具有更优的性能。EG-Cap的实现代码将公开可访问于:https://github.com/Xiliang-Li/EG-Cap
Keyword:
Entity sequence generation
image caption
multimodal fusion
multiscale aggregation
remote sensing
期刊
IF:
8.6
论文数:
2.1W
被引数:
10.7W
机构
引用论文
Semantic-Spatial Collaborative Perception Network for Remote Sensing Image Captioning面向遥感图像标注的语义-空间协同感知网络

