arrow
返回

Hierarchical Compositional Alignment for Zero-Shot Part-Level Segmentation

delete2026-04-04
delete0
delete
OA
AI
S
Shan Yang
S
Shujie Ji
Z
Zhendong Xiao
X
Xiongding Liu *
W
Wei Wu *
DOI:10.3390/s26072130delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
在机器人精细粒度任务(例如抓取和装配)中,精确的交互需要详细理解物体组件。尽管视觉语言模型(VLMs)在物体级识别方面表现出色,但在部件级分割(例如刀具手柄)方面存在困难,限制了复杂场景下的性能。VLMs面临三大关键挑战:(1)视觉粒度不匹配——物体级特征缺乏部件级细节;(2)语义层级差异——部件与物体在语义上存在显著差异;(3)跨模态偏差——CLIP的文本-图像对齐更倾向于全局而非局部特征。为解决这些问题,我们提出了一种基于VLM的一阶段部件分割方法。首先,层级感知特征选择机制分析不同层级中的Transformer特征,以增强部件分割的空间和语义精度。其次,多层级特征适配器通过层级适配桥接物体到部件的特征粒度。最后,层级多模态对齐模块通过视觉-语言的层级对齐调和分类精度与掩码完整性,缓解CLIP的物体级先验知识的偏差。实验表明,所提出的方法提升了零样本部件分割性能,在Pascal-Part上达到25.86%,在ADE20K-Part上达到13.09%(相比基线hIoU提升0.81%和2.96%)。这项工作推进了机器人视觉感知,在智能制造和智能服务领域具有应用价值。
Keyword:
visual language models
part segmentation
multi-hierarchy feature
multimodal alignment
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Sensors 封面图
Sensors
IF:
3.5
论文数:
7.2W
被引数:
20.9W

机构

H
hangzhou dianzi university
学者数:
1.3K
论文数: 507
被引数: 0
S
south china university of technology
学者数:
6.8W
论文数: 5.1W
被引数: 85
引用论文

引用论文

Collaborative Attention Guided Multi-Scale Feature Fusion Network for Medical Image Segmentation协同注意引导的多尺度特征融合网络在医学图像分割中的应用
err2024-03-01
err0
PREAI
errXu, Zhenghua; Tian, Biao; Liu, Shijie; Wang, Xiangtao; Yuan, Di; Gu, Junhua; Chen, Junyang; Lukasiewicz, Thomas; Leung, Victor C. M.
err分享
err收藏
LM-Net: A light-weight and multi-scale network for medical image segmentation
err2024-01-01
err16
PREAI
errLu, Zhenkun; She, Chaoyin; Wang, Wei; Huang, Qinghua
err分享
err收藏
err分享
err收藏
Transformer's Role in Brain MRI: A Scoping Review
err2024-01-01
err3
errOAAI
errHayat, Mansoor; Aramvith, Supavadee
err分享
err收藏
学者 查看更多内容