返回
Geometric understanding in spatial contexts for image captioning
DOI:10.1016/j.image.2026.117645.png)
摘要
En 中文
准确图像描述不仅需要识别物体,还需要对其空间布局进行推理。然而,许多描述模型主要依赖外观驱动,仅弱化编码物体几何特征,这限制了多物体场景中的空间锚定描述。我们提出GeoL(几何LSTM),一种几何感知的描述框架,直接将连续的RoI边界框属性(归一化坐标、质心、面积、周长、长宽比和紧凑度)注入到注意力计算中。GeoL引入两个互补模块:编码器端的几何注意力模块(GeoL-GeoAtt),通过几何条件化的多头注意力优化区域特征;以及解码器端的GeoL-Att模块,对几何增强的区域执行语言条件化注意力,并辅以轻量级空间和通道重加权。GeoL采用交叉熵训练,并通过自关键序列训练进一步优化以直接最大化CIDEr。在MSCOCO(COCO 2014,Karpathy划分)数据集上,GeoL在交叉熵训练下达到38.4 BLEU-4和120.8 CIDEr,经过SCST微调后达到39.9 BLEU-4和129.9 CIDEr,在保持与强注意力及Transformer时代基线竞争力同时,提升了复杂场景中的空间一致性。代码可从https://github.com/alamgirustc/GeoL获取。
Keyword:
Geometric feature
Geometric attention
Image captioning
GeoL-GeoAtt
GeoL-Att block
Encoder-decoder
期刊
S
IF:
2.7
论文数:
128
被引数:
0
机构
引用论文
暂无论文信息

