返回
Hierarchical Compositional Alignment for Zero-Shot Part-Level Segmentation
DOI:10.3390/s26072130.png)
摘要
En 中文
在机器人精细粒度任务(例如抓取和装配)中,精确的交互需要详细理解物体组件。尽管视觉语言模型(VLMs)在物体级识别方面表现出色,但在部件级分割(例如刀具手柄)方面存在困难,限制了复杂场景下的性能。VLMs面临三大关键挑战:(1)视觉粒度不匹配——物体级特征缺乏部件级细节;(2)语义层级差异——部件与物体在语义上存在显著差异;(3)跨模态偏差——CLIP的文本-图像对齐更倾向于全局而非局部特征。为解决这些问题,我们提出了一种基于VLM的一阶段部件分割方法。首先,层级感知特征选择机制分析不同层级中的Transformer特征,以增强部件分割的空间和语义精度。其次,多层级特征适配器通过层级适配桥接物体到部件的特征粒度。最后,层级多模态对齐模块通过视觉-语言的层级对齐调和分类精度与掩码完整性,缓解CLIP的物体级先验知识的偏差。实验表明,所提出的方法提升了零样本部件分割性能,在Pascal-Part上达到25.86%,在ADE20K-Part上达到13.09%(相比基线hIoU提升0.81%和2.96%)。这项工作推进了机器人视觉感知,在智能制造和智能服务领域具有应用价值。
Keyword:
visual language models
part segmentation
multi-hierarchy feature
multimodal alignment
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.5
论文数:
7.2W
被引数:
20.9W
机构
引用论文
Multi-Level Medical Image Segmentation Network Based on Multi-Scale and Context Information Fusion Strategy基于多尺度和上下文信息融合策略的多层次医学图像分割网络
SegLD: Achieving universal, zero-shot and open-vocabulary segmentation through multimodal fusion via latent diffusion processes
INFORMATION FUSION
IF15.5
Collaborative Attention Guided Multi-Scale Feature Fusion Network for Medical Image Segmentation协同注意引导的多尺度特征融合网络在医学图像分割中的应用
Multi-Scale Group Agent Attention-based Graph Convolutional Decoding Networks for 2D Medical Image Segmentation基于多尺度组代理注意力机制的图卷积解码网络用于2D医学图像分割
Gundavarapu, S.K.; Arora, A.; Agarwal, S. Zero shot context-based object segmentation using SLIP (SAM+ CLIP). arXiv 2024, arXiv:2405.07284. [Google Scholar] [CrossRef]Gundavarapu, S.K.; Arora, A.; Agarwal, S. 基于零样本上下文的对象分割方法,使用SLIP(SAM+CLIP)。arXiv 2024, arXiv:2405.07284. [Google Scholar] [CrossRef]
Huang, Q.; Wake, N.; Sarkar, B.; Durante, Z.; Gong, R.; Taori, R.; Noda, Y.; Terzopoulos, D.; Kuno, N.; Famoti, A.; et al. Position paper: Agent ai towards a holistic intelligence. arXiv 2024, arXiv:2403.00833. [Google Scholar] [CrossRef]黄, Q.; 韦克, N.; 萨卡尔, B.; 杜兰蒂, Z.; 龚, R.; 塔罗伊, R.; 野田, Y.; 特尔佐波洛斯, D.; 龚诺, N.; 法莫蒂, A.; 等. 位置论文:面向整体智能的智能体AI. arXiv 2024, arXiv:2403.00833. [Google Scholar] [CrossRef]

