arrow
返回

Could Describe Anything Model Understand Remote Sensing Objects?

delete2025-01-01
delete0
delete
OA
AI
Z
Ziyi Gao
S
Shuzhou Sun
M
Ming‐Ming Cheng
Y
Yunli Long
刘
刘永祥 (Yongxiang Liu)
L
Li Liu
DOI:10.1109/JSTARS.2025.3616330delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
遥感图像(RSIs)的细粒度图像描述生成仍然是一个未被充分探索但至关重要的多模态场景理解任务,尤其是在需要局部语义解释的领域中。然而,遥感数据的异质性——涵盖可见光、红外和合成孔径雷达(SAR)等模态——对泛化能力提出了显著挑战,尤其是在缺乏句子级标注的情况下。现有的视觉-语言模型主要基于自然图像-文本对训练,往往难以捕捉遥感图像中的空间锚定语义,导致在迁移到非自然领域时性能下降。在本文中,我们首次对describe anything model(DAM)在遥感领域的局部描述生成任务进行了系统性评估。为解决对齐监督的稀缺问题,我们构建了一个弱监督基准框架,包含三个级别的感兴趣区域提示(完整图像、中心点和边界框),并统一了跨三种模态(以“船舶”为统一对象类别)的测试数据。描述质量通过语言多样性指标和多模态对齐指标进行评估,包括对比语言-图像预训练(CLIP)和RemoteCLIP分数。实验结果表明,DAM在可见光图像上配合细粒度提示表现稳健,但在红外和SAR领域性能显著下降,因为模态特定的失真阻碍了有效的空间锚定。我们的基准揭示了当前基础模型在跨模态描述生成中的关键瓶颈,并为评估和改进遥感领域的多模态语言理解建立了统一的测试平台。
Keyword:
Describe anything model (DAM)
localized image captioning
remote sensing image (RSI)
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing 封面图
IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing
IF:
5.3
论文数:
1.7K
被引数:
3.0W

机构

N
National University of Defense Technology
学者数:
3.3K
论文数: 1.0K
被引数: 8.2K
T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
N
nankai university
学者数:
4.8W
论文数: 3.3W
被引数: 74
学者 查看更多机构
引用论文

引用论文

暂无论文信息