返回
ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation
DOI:10.1109/TGRS.2026.3659897.png)
摘要
En 中文
段式任何模型(SAM),凭借其提示驱动范式,在通用分割任务中表现出强大的泛化能力。然而,将SAM应用于遥感(RS)图像仍面临两大挑战。首先,为每张图像手动构建精确的提示(如点或框)劳动密集且效率低下,尤其是在RS场景中存在密集小对象或空间碎片化分布的情况下。其次,SAM缺乏领域适应性,因为它主要在自然图像上预训练,难以捕捉RS特有的语义和空间特征,尤其是在分割新颖或未见过的类别时。为解决这些问题,受小样本学习(FSL)启发,我们提出ViRefSAM,一种新型框架,利用仅包含类别特定对象的少数标注参考图像来引导SAM。无需手动提示,ViRefSAM能够实现RS图像中类别一致性对象的自动分割。具体而言,ViRefSAM在保持SAM原始架构不变的同时引入两个关键组件:1)一个视觉上下文提示(VCP)编码器,从参考图像中提取类别特定语义线索,并通过与目标图像的上下文交互生成目标感知提示;2)一个动态目标对齐(DTA)适配器,集成到SAM的图像编码器中,通过将类别特定语义注入目标图像特征来弥合领域差距,使SAM能够动态聚焦于任务相关区域。在三个小样本分割(FSS)基准测试(包括iSAID- $5^{i}$ 、LoveDA- $2^{i}$ 和COCO- $20^{i}$ )上的广泛实验表明,ViRefSAM通过利用仅有的少数参考图像,实现了未见类别的准确自动分割,并在不同数据集上持续优于现有的FSS方法。
Keyword:
Few-shot learning (FSL)
remote sensing (RS)
segment anything model (SAM)
semantic segmentation
期刊
IF:
8.6
论文数:
2.1W
被引数:
10.7W
机构
引用论文
暂无论文信息

