arrow
返回

Future object localization using multi-modal ego-centric video

delete2025-12-18
delete0
PRE
AI
J
Jee-Ye Yoon
J
Je‐Won Kang *
DOI:10.1016/j.jvcir.2025.104684delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
未来物体定位(FOL)旨在利用过去和当前视频帧的信息预测物体的未来位置。车载摄像头的第一人称视角视频是关键的数据来源。然而,这些视频受限于有限的视场角和易受外部条件影响的特性。为解决这些挑战,本文提出了一种新颖的FOL方法,结合第一人称视角视频数据和点云数据,提升了系统的鲁棒性和准确性。所提出的模型基于深度神经网络,优先利用前置摄像头的第一人称视角视频,挖掘其丰富的视觉线索。通过整合点云数据,系统增强了三维(3D)物体定位能力。此外,本文引入了一种新颖的自身运动预测方法。自身运动预测网络采用多模态传感器,全面捕捉二维和三维空间中的物理位移,有效处理第一人称视角视频中的遮挡和有限视角问题。实验结果表明,带有自身运动预测的FOL系统(MS-FOLe)在大型开放智能驾驶数据集上优于现有方法。

期刊

Journal of Visual Communication and Image Representation 封面图
Journal of Visual Communication and Image Representation
IF:
3.1
论文数:
433
被引数:
5.6K

机构

E
ewha w. university
学者数:
7
论文数: 3
被引数: 0
引用论文

引用论文

BiTraP: Bi-Directional Pedestrian Trajectory Prediction With Multi-Modal Goal Estimation
err2021-04-01
err0
errOAAI
errYu Yao; Ella Atkins; Matthew Johnson-Roberson; Ram Vasudevan; Xiaoxiao Du
err分享
err收藏
err分享
err收藏
err分享
err收藏
M2P3
err2020-03-30
err0
PREAI
errAtanas Poibrenski; Matthias Klusch; Igor Vozniak; Christian Müller
err分享
err收藏
学者 查看更多内容