返回
Feature-based optimization enables 2D CNNs for efficient spatio-temporal perception
DOI:10.1016/j.patcog.2026.114035.png)
摘要
En 中文
高效的动作识别仍然是模式识别领域的一个基本挑战,主要由于计算可行性与时空动态精确建模之间的权衡。视觉Transformer(ViT)能够捕捉长距离依赖关系,但存在二次复杂度问题,而二维卷积神经网络(CNN)虽然计算高效,却常因时空采样不足和背景诱导冗余而受限。为解决此困境,我们提出了动作精炼网络(ARN),一种新型框架,能够在不修改其核心架构的情况下,增强单二维CNN骨干网络中的时空表示。ARN引入两个关键组件:差异空间采样器(DSS)和多分支特征对齐(MFA)模块。DSS将视频数据适配至卷积层以实现可靠的时空特征提取,而MFA则整合空间与时间特征以形成抽象语义表示。ARN全面分析浅层至深层以及不同时间点的动作变化,指导模型在最终置信度中准确表示动作。在HMDB51、UCF101、Kinetics400及突发运动转换检测上的大量实验表明,ARN实现了最先进的Top-1准确率(HMDB51为78.8%,UCF101为98.2%,Kinetics400为77.8%),同时模型参数数量仅为ViT-B的28.6%,计算复杂度为Swin-T的24.3%(2460万 vs 8600万)。相较于Swin-T,ARN将计算复杂度降低了75.7%(43 GFLOPs vs 177 GFLOPs)。此外,在突发运动转换检测中,ARN的推理速度比TSM快16 QPS,同时准确率提升了9.7%。
Keyword:
Video understanding
Action recognition
Deep learning
Model optimization
Approximate treatment

