返回
Improved Gen6D network with vision transformer encoding detection
DOI:10.1007/s11760-025-04944-5.png)
摘要
En 中文
在6D位姿估计中,物体位置先验初始化3D平移和旋转预测。然而,Gen6D方法在处理未见物体时,在复杂场景中检测目标位置的准确性和鲁棒性不足,常导致最终位姿估计不精确。为解决此问题,本文首次引入Vision Transformer编码器,并提出了一种新的位姿估计方法。该方法利用ViT的多头自注意力机制与传统卷积相结合,整合全局上下文和局部特征,以增强相似度分数和尺度偏移预测的准确性,从而提升目标检测的几何一致性和定位精度。实验表明,改进后的模型在GenMOP和LINEMOD数据集上均优于其他方法。通过将三种主流模型的消融比较引入原始检测网络,进一步证明所提方法在所有验证目标上均表现出更优的检测和预测性能,验证了其有效性和泛化能力。
Keyword:
6D pose estimation
Gen6D
Position priors
Vision Transformer
期刊
IF:
2.1
论文数:
908
被引数:
4.6K
机构
暂无机构信息
引用论文
Dp-M3D: Monocular 3D object detection algorithm with depth perception capabilityDp-M3D:具有深度感知能力的单目3D目标检测算法

