返回
Comp-PointLLM: An Explainable Multimodal Large Language Model for 3D Object Comparison
DOI:10.1093/jcde/qwag039.png)
摘要
En 中文
物体比较,人类理解和决策的核心认知能力,在复杂3D环境中至关重要,例如使智能机器人系统能够自主选择合适工具并规划物体操作序列,支持计算机辅助设计(CAD)评估对先前模型的修改,以及通过验证制造产品是否匹配原始设计来确保质量控制。然而,目前缺乏对各种格式(如网格、体素和点云)的复杂3D物体进行直接比较和解释的研究。为解决这一差距,我们提出Comp-PointLLM,一种用于可解释比较3D点云物体的新型多模态大型语言模型(MLLM)框架。Comp-PointLLM通过集成3D几何特征和2D视觉特征的混合架构增强3D物体理解。此外,我们提出一个基于LLMs的自动化数据生成管道,以构建比较-描述和问答数据集。实验结果表明,Comp-PointLLM在各类物体和比较标准上显著优于基线模型,并对未见类别展现出强大的零样本泛化能力。消融研究证实,混合架构、两阶段训练和集成数据策略均有助于性能提升。Comp-PointLLM为产品设计、工程和智能机器人系统中的真实世界3D物体比较奠定了坚实基础,为更高级的AI应用铺平了道路。
Keyword:
3D object comparison
Multimodal Large Language Model
Point cloud
Explainable AI
Object understanding
期刊
IF:
6.1
论文数:
406
被引数:
3.2K
机构
引用论文
暂无论文信息

