返回
Content and Relation Fuzzy Mitigation Framework for Intent Perception
DOI:10.1109/TFUZZ.2024.3476948.png)
摘要
En 中文
本文针对图像意图感知中的内容模糊和关系模糊问题展开研究。当前研究主要聚焦于额外的建模机制和跨模态信息,但在意图感知任务中,处理不准确标注下的关系模糊问题往往较为困难。我们利用大型语言模型强大的表征能力,并创新性地将其应用于解决图像意图感知任务。该方法包含两个创新模块:多维适配器和模糊和谐优化器。多维适配器将不同难度级别的意图图像特征投射到不同大小的特征维度上,以缓解由图像多样性引起的内容模糊问题。此外,意图类别标注具有一定的主观性,且某些类别更倾向于协同出现。我们设计了模糊和谐优化器来挖掘各类别之间的关系,以增强感知结果。与传统专家指定的规则不同,我们从训练数据中学习不同意图类别间的共现频率,生成模糊和谐矩阵以校正得分,从而缓解意图感知中的关系模糊问题。我们在Intentonomy数据集上取得了新的最佳性能,宏观F1得分为42.52%,微观F1得分为54.80%,样本F1得分为57.57%,平均F1得分为51.63%。与现有方法相比,我们的方法提升了9.8%。
Keyword:
Fuzzy
intent perception
multidimension adapter
vision-language model
期刊
IF:
11.9
论文数:
5.0K
被引数:
2.9W
机构
引用论文
Understanding and Mitigating Overfitting in Prompt Tuning for Vision-Language Models在视觉语言模型的快速调优中理解和减轻过拟合

