返回
Future object localization using multi-modal ego-centric video
DOI:10.1016/j.jvcir.2025.104684.png)
摘要
En 中文
未来物体定位(FOL)旨在利用过去和当前视频帧的信息预测物体的未来位置。车载摄像头的第一人称视角视频是关键的数据来源。然而,这些视频受限于有限的视场角和易受外部条件影响的特性。为解决这些挑战,本文提出了一种新颖的FOL方法,结合第一人称视角视频数据和点云数据,提升了系统的鲁棒性和准确性。所提出的模型基于深度神经网络,优先利用前置摄像头的第一人称视角视频,挖掘其丰富的视觉线索。通过整合点云数据,系统增强了三维(3D)物体定位能力。此外,本文引入了一种新颖的自身运动预测方法。自身运动预测网络采用多模态传感器,全面捕捉二维和三维空间中的物理位移,有效处理第一人称视角视频中的遮挡和有限视角问题。实验结果表明,带有自身运动预测的FOL系统(MS-FOLe)在大型开放智能驾驶数据集上优于现有方法。
期刊
IF:
3.1
论文数:
433
被引数:
5.6K
机构
引用论文
Realtime Video Latency Reduction for Autonomous Vehicle Teleoperation Using RTMP Over UDP Protocols基于RTMP over UDP协议的自主车辆遥操作系统实时视频延迟降低
Multi-Sensor Multi-Vehicle (MSMV) Localization and Mobility Tracking for Autonomous Driving用于自动驾驶的多传感器多车辆 (MSMV) 定位和移动跟踪
ViewBirdiformer: Learning to Recover Ground-Plane Crowd Trajectories and Ego-Motion From a Single Ego-Centric ViewViewBirdiformer: 从单一自我中心视角学习恢复地面平面人群轨迹和自我运动

