arrow
返回

Comp-PointLLM: An Explainable Multimodal Large Language Model for 3D Object Comparison

delete2026-04-17
delete0
delete
OA
AI
M
Mingi Kim
H
Hyungki Kim *
DOI:10.1093/jcde/qwag039delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
物体比较,人类理解和决策的核心认知能力,在复杂3D环境中至关重要,例如使智能机器人系统能够自主选择合适工具并规划物体操作序列,支持计算机辅助设计(CAD)评估对先前模型的修改,以及通过验证制造产品是否匹配原始设计来确保质量控制。然而,目前缺乏对各种格式(如网格、体素和点云)的复杂3D物体进行直接比较和解释的研究。为解决这一差距,我们提出Comp-PointLLM,一种用于可解释比较3D点云物体的新型多模态大型语言模型(MLLM)框架。Comp-PointLLM通过集成3D几何特征和2D视觉特征的混合架构增强3D物体理解。此外,我们提出一个基于LLMs的自动化数据生成管道,以构建比较-描述和问答数据集。实验结果表明,Comp-PointLLM在各类物体和比较标准上显著优于基线模型,并对未见类别展现出强大的零样本泛化能力。消融研究证实,混合架构、两阶段训练和集成数据策略均有助于性能提升。Comp-PointLLM为产品设计、工程和智能机器人系统中的真实世界3D物体比较奠定了坚实基础,为更高级的AI应用铺平了道路。
Keyword:
3D object comparison
Multimodal Large Language Model
Point cloud
Explainable AI
Object understanding

期刊

Journal of Computational Design and Engineering 封面图
Journal of Computational Design and Engineering
IF:
6.1
论文数:
406
被引数:
3.2K

机构

C
chungnam national university
学者数:
856
论文数: 330
被引数: 0
引用论文

引用论文

暂无论文信息