arrow
返回

ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation

delete2026-02-03
delete0
PRE
AI
H
Hanbo Bi
Y
Yulong Xu
Y
Ya Li
Y
Yongqiang Mao
B
Boyuan Tong
C
Chongyang Li
C
Chunbo Lang
W
Wenhui Diao
H
Hongqi Wang
Y
Yingchao Feng
X
Xian Sun
DOI:10.1109/TGRS.2026.3659897delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
段式任何模型(SAM),凭借其提示驱动范式,在通用分割任务中表现出强大的泛化能力。然而,将SAM应用于遥感(RS)图像仍面临两大挑战。首先,为每张图像手动构建精确的提示(如点或框)劳动密集且效率低下,尤其是在RS场景中存在密集小对象或空间碎片化分布的情况下。其次,SAM缺乏领域适应性,因为它主要在自然图像上预训练,难以捕捉RS特有的语义和空间特征,尤其是在分割新颖或未见过的类别时。为解决这些问题,受小样本学习(FSL)启发,我们提出ViRefSAM,一种新型框架,利用仅包含类别特定对象的少数标注参考图像来引导SAM。无需手动提示,ViRefSAM能够实现RS图像中类别一致性对象的自动分割。具体而言,ViRefSAM在保持SAM原始架构不变的同时引入两个关键组件:1)一个视觉上下文提示(VCP)编码器,从参考图像中提取类别特定语义线索,并通过与目标图像的上下文交互生成目标感知提示;2)一个动态目标对齐(DTA)适配器,集成到SAM的图像编码器中,通过将类别特定语义注入目标图像特征来弥合领域差距,使SAM能够动态聚焦于任务相关区域。在三个小样本分割(FSS)基准测试(包括iSAID- $5^{i}$ 、LoveDA- $2^{i}$ 和COCO- $20^{i}$ )上的广泛实验表明,ViRefSAM通过利用仅有的少数参考图像,实现了未见类别的准确自动分割,并在不同数据集上持续优于现有的FSS方法。
Keyword:
Few-shot learning (FSL)
remote sensing (RS)
segment anything model (SAM)
semantic segmentation

期刊

IEEE Transactions on Geoscience and Remote Sensing 封面图
IEEE Transactions on Geoscience and Remote Sensing
IF:
8.6
论文数:
2.1W
被引数:
10.7W

机构

N
northwestern polytechnical university
学者数:
1.3W
论文数: 4.6K
被引数: 0
T
Tsinghua University
学者数:
8.6K
论文数: 4.1K
被引数: 17.7W
C
Chinese Academy of Sciences
学者数:
3.9W
论文数: 1.5W
被引数: 58.4W
学者 查看更多机构
引用论文

引用论文

暂无论文信息