返回
Text-Driven Multiplanar Visual Interaction for Semi-supervised Medical Image Segmentation
DOI:10.1007/978-3-032-04971-1_57.png)
摘要
En 中文
半监督医学图像分割在缓解数据标注高成本方面发挥着关键作用。当标注数据有限时,文本信息可提供额外上下文以增强视觉语义理解。然而,探索文本数据以增强3D医学影像任务中视觉语义嵌入的研究尚不多见。本文提出了一种新颖的文本驱动多平面视觉交互框架用于半监督医学图像分割(命名为Text-SemiSeg),该框架包含三个主要模块:文本增强多平面表示(TMR)、类别感知语义对齐(CSA)和动态认知增强(DCA)。具体而言,TMR通过平面映射促进文本-视觉交互,从而增强视觉特征的类别感知能力。CSA在引入可学习变量的文本特征与视觉特征中间层之间执行跨模态语义对齐。DCA通过交互减少标注数据与未标注数据之间的分布差异,从而提升模型鲁棒性。最终,在三个公开数据集上的实验表明,本模型能有效利用文本信息增强视觉特征,并优于其他方法。代码地址:https://github.com/taozh2017/Text-SemiSeg
Keyword:
Semi-supervised medical segmentation
TMR
CSA
DCA

