arrow
返回

Detailed Object Description With Controllable Dimensions

delete2025-01-01
delete0
PRE
AI
X
Xinran Wang
H
Haiwen Zhang
B
Baoteng Li
K
Kongming Liang
H
Hao Sun
Z
Zhongjiang He
马
马占宇 (Zhanyu Ma)
J
Jun Guo
DOI:10.1109/TMM.2025.3607747delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
物体描述对于视障人士理解并比较物体差异起着重要作用。近期多模态大语言模型(MLLMs)展现出强大的感知能力,并证明了在生成以物体为中心的描述方面具有显著潜力。然而,此类模型生成的描述可能仍通常包含大量与用户意图无关的内容,或遗漏某些重要的物体维度细节。在特定场景下,用户可能仅需了解物体某些维度的详情。本文提出了一种无需训练的物体描述精炼流程,即Dimension Tailor,旨在增强物体描述中用户指定的细节。该流程包含三个步骤:维度提取、擦除和补充,用于将描述分解为用户指定的维度。Dimension Tailor不仅能提升物体细节的质量,还能根据用户偏好灵活地包含或排除特定维度。我们进行了大量实验以证明Dimension Tailor在可控物体描述方面的有效性。值得注意的是,所提出的流程能够持续提升近期MLLMs的性能。
Keyword:
Controllable object description
multimodal large language model
object dimensions

期刊

IEEE Transactions on Multimedia 封面图
IEEE Transactions on Multimedia
IF:
9.7
论文数:
4.5K
被引数:
2.4W

机构

B
Beijing University of Posts and Telecommunications
学者数:
2.6K
论文数: 1.2K
被引数: 4.2K
引用论文

引用论文

暂无论文信息