1
Return

LM2CNet: Enhancing Monocular 3D Visual Grounding with Language Guided Multi-Modality Coupling Network

delete2026-04-29
delete0
PRE
AI
M
Meng Li
Q
Qi Zhao
S
Shuchang Lyu
J
Jun Jiang *
L
Longhao Zou
G
Guangliang Cheng
DOI:10.1016/j.patrec.2026.03.023delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• We introduce a novel Mono3DRefer-nuScenes dataset tailored for the monocular 3D visual grounding task. • Our dataset accounts for diversity in both scenarios and languages, encompassing three language types. • We propose a novel multi-modality coupling network designed to utilize linguistic inputs to bridge the gap between visual and depth modalities • We evaluated various methods on the Mono3DRefer-nuScenes dataset, accompanied by visualization experiments.
Keywords:
Mono3DRefer-nuScenes
monocular 3D visual grounding
multi-modality coupling network
language-guided
depth modality

Journal

Pattern Recognition Letters cover
Pattern Recognition Letters
IF:
3.3
Papers:
7.8K
Citations:
1.6W

Organization

U
university of liverpool
Scholars:
2.7K
Papers: 1.4K
Citations: 0
B
Beihang University
Scholars:
5.0W
Papers: 4.0W
Citations: 37
P
pengcheng laboratory
Scholars:
415
Papers: 204
Citations: 0
Cited Papers

Cited Papers

Citing Papers

Citing Papers