arrow
返回

Geometric understanding in spatial contexts for image captioning

delete2026-07-01
delete3
PRE
AI
M
Mohammad Alamgir Hossain
M
Md. Bipul Hossen
Z
Zhongfu Ye *
M
Md Shohidul Islam
M
Md.Ibrahim Abdullah
DOI:10.1016/j.image.2026.117645delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
准确图像描述不仅需要识别物体,还需要对其空间布局进行推理。然而,许多描述模型主要依赖外观驱动,仅弱化编码物体几何特征,这限制了多物体场景中的空间锚定描述。我们提出GeoL(几何LSTM),一种几何感知的描述框架,直接将连续的RoI边界框属性(归一化坐标、质心、面积、周长、长宽比和紧凑度)注入到注意力计算中。GeoL引入两个互补模块:编码器端的几何注意力模块(GeoL-GeoAtt),通过几何条件化的多头注意力优化区域特征;以及解码器端的GeoL-Att模块,对几何增强的区域执行语言条件化注意力,并辅以轻量级空间和通道重加权。GeoL采用交叉熵训练,并通过自关键序列训练进一步优化以直接最大化CIDEr。在MSCOCO(COCO 2014,Karpathy划分)数据集上,GeoL在交叉熵训练下达到38.4 BLEU-4和120.8 CIDEr,经过SCST微调后达到39.9 BLEU-4和129.9 CIDEr,在保持与强注意力及Transformer时代基线竞争力同时,提升了复杂场景中的空间一致性。代码可从https://github.com/alamgirustc/GeoL获取。
Keyword:
Geometric feature
Geometric attention
Image captioning
GeoL-GeoAtt
GeoL-Att block
Encoder-decoder

期刊

S
SIGNAL PROCESSING-IMAGE COMMUNICATION
IF:
2.7
论文数:
128
被引数:
0

机构

U
University of Science and Technology of China
学者数:
1.9K
论文数: 639
被引数: 0
I
Islamic University
学者数:
35
论文数: 14
被引数: 0
C
Chinese Academy of Sciences
学者数:
9.5K
论文数: 2.7K
被引数: 0
学者 查看更多机构
引用论文

引用论文

暂无论文信息