返回
Vision-Based Driver Behavior Recognition using Multi-Modal Deep Learning for Autonomous Vehicles
DOI:10.1142/s1469026826410075.png)
摘要
En 中文
本研究提出了一种旨在提高自动驾驶车辆安全性与可靠性的多模态驾驶员行为识别框架,该框架利用传感器和视觉数据。框架收集与驾驶员活动相关的惯性信号(加速度计和陀螺仪)及视觉图像以观察驾驶员行为。处理阶段首先通过噪声滤波、归一化和插值预处理惯性数据,随后采用短时傅里叶变换(STFT)和连续小波变换(CWT)提取特征,生成互补的时间-频率数据表示。对于视觉数据,先进行对比度增强和归一化,再利用Vision Transformer(ViT)获取空间嵌入。两种模态的特征通过Swin Transformer进行编码以捕捉局部和全局依赖关系,然后通过交叉注意力和通道注意力组合进行融合,以增强特征交互。融合后的表示通过ResNet-18进行处理,生成最终行为表示,分为9个类别。实验结果表明,该框架在准确率、F1分数、召回率和精确率均超过99.6%,误报率和漏报率极低,展现出其鲁棒性及在自动驾驶系统驾驶员监控中的应用潜力。STFT与CWT的组合在频域提供了多样化的固定和多分辨率表示,而ViT与Swin Transformer的集成进一步深化了时空编码,较以往的多模态方法更为深入;ResNet-18分类器的应用增强了判别融合能力,使得行为识别比现有任何单分支或双分支系统组合都更为可信。
Keyword:
Multi-modal learning
driver behavior recognition
Vision Transformer
Swin Transformer
ResNet-18
STFT
CWT
sensor data
cross-attention
autonomous vehicles
期刊
I
IF:
1.3
论文数:
38
被引数:
0
机构
引用论文
Towards Socially Responsive Autonomous Vehicles: A Reinforcement Learning Framework With Driving Priors and Coordination Awareness面向社会响应的自动驾驶汽车: 具有驾驶先验和协调意识的强化学习框架
Vehicle Motion Prediction Algorithm Based on Artificial Potential Field Correction and Fuzzy C-Mean Driving Intention Classification
Electronics
IF0
A Recognition Method of Aggressive Driving Behavior Based on Ensemble Learning一种基于集成学习的攻击性驾驶行为识别方法
SENSORS
IF3.5
STADe: Sensory Temporal Action Detection via Temporal-Spectral Representation LearningSTADe:基于时频表示学习的感官时序动作检测
Analysis of the Spatiotemporal Effects on the Severity of Motorcycle Accidents Without Helmets and Strategies for Building Sustainable Traffic Safety无头盔摩托车事故严重程度的时空效应分析及可持续交通安全策略构建
SUSTAINABILITY
IF3.3
Plant-CNN-ViT: Plant Classification with Ensemble of Convolutional Neural Networks and Vision Transformer
PLANTS-BASEL
IF4.1

