返回
Detailed Object Description With Controllable Dimensions
DOI:10.1109/TMM.2025.3607747.png)
摘要
En 中文
物体描述对于视障人士理解并比较物体差异起着重要作用。近期多模态大语言模型(MLLMs)展现出强大的感知能力,并证明了在生成以物体为中心的描述方面具有显著潜力。然而,此类模型生成的描述可能仍通常包含大量与用户意图无关的内容,或遗漏某些重要的物体维度细节。在特定场景下,用户可能仅需了解物体某些维度的详情。本文提出了一种无需训练的物体描述精炼流程,即Dimension Tailor,旨在增强物体描述中用户指定的细节。该流程包含三个步骤:维度提取、擦除和补充,用于将描述分解为用户指定的维度。Dimension Tailor不仅能提升物体细节的质量,还能根据用户偏好灵活地包含或排除特定维度。我们进行了大量实验以证明Dimension Tailor在可控物体描述方面的有效性。值得注意的是,所提出的流程能够持续提升近期MLLMs的性能。
Keyword:
Controllable object description
multimodal large language model
object dimensions
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W
机构
引用论文
暂无论文信息

