返回
DFSA: Dynamic-Feature Collaborative Optimization and Semantic-Alignment Network for UAV Cross-View Geo-Localization
DOI:10.3390/drones10080632.png)
摘要
En 中文
交叉视角地理定位(CVGL)是无人 aerial vehicles(UAVs)中的一项关键技术,并在导航和目标定位任务中得到了广泛应用。然而,由于UAV斜视图与卫星垂直视图之间存在极端视角差异,CVGL仍面临重大挑战,包括由视角差异引起的几何失真、外观急剧不一致以及异构数据间语义差距难以弥合等问题。为解决这些问题,我们提出了一种名为动态特征协同优化与语义对齐网络(DFSA)的新型CVGL方法,旨在提取鲁棒特征表示并实现精细对齐。具体而言,DFSA采用基于残差的视觉Transformer作为骨干网络,以捕捉全局上下文,同时缓解标准Transformer中常见的训练不稳定和特征坍塌问题。为弥合全局与局部特征间的语义差距,我们设计了一个特征优化模块,包含局部特征增强器和全局特征聚合器。该模块构建了一个闭环协同系统,促进自上而下的语义引导和自下而上的细节反馈。此外,我们引入了一个语义分割与对齐模块,该模块基于特征响应分布自适应地将图像分割为语义区域,将匹配粒度从全局级别转移到语义区域级别,以有效克服由位置偏移和尺度变化引起的特征不匹配问题。在University-1652和SUES-200数据集上进行的大量实验证明了所提DFSA的优越图像检索性能。具体而言,DFSA在University-1652数据集上达到94.87%的Recall@1和95.32%的平均精度(AP),并在SUES-200数据集的不同高度上保持96.83%至99.25%之间极具竞争力的Recall@1性能。这些结果验证了该模型在处理UAV基交叉视角图像检索任务中极端视角变化方面的有效性。
Keyword:
cross-view geo-localization
UAV
vision transformer
remote sensing
image retrieval

