Return
Panoptic-VSNet: Visual-semantic prior knowledge-driven multimodal 3D panoptic segmentation
DOI:10.1016/j.patcog.2026.113239.png)
Abstract
En 中文
• Maps points to semantic regions via CLIP-driven activation to reduce semantic gaps. • Fuses image panoptic masks and text embeddings for precise instance boundaries. • Employs dynamic kernels and multi-scale fusion for context capture and detail boost.
Keywords:
Panoptic segmentation
Visual-semantic prior
CLIP-driven activation
Multi-scale fusion
Dynamic kernels
Journal
IF:
7.6
Papers:
1.3W
Citations:
4.5W

