返回
Feature Hallucination for Self-supervised Action Recognition
DOI:10.1007/s11263-025-02513-4.png)
摘要
En 中文
理解视频中的人类动作不仅需要原始像素分析,还需要依赖高层次语义推理和有效的多模态特征融合。我们提出了一种深度翻译动作识别框架,通过联合预测动作概念和辅助特征来自RGB视频帧,从而提升识别精度。在测试阶段,幻觉流推断缺失的线索,丰富特征表示而无需增加计算开销。为聚焦于原始像素之外的与动作相关的区域,我们引入了两种新颖的领域特定描述符。物体检测特征(ODF)聚合多个物体检测器的输出来捕捉上下文线索,而显著性检测特征(SDF)突出对动作识别至关重要的空间和强度模式。我们的框架无缝集成了这些描述符与辅助模态,如光流、改进的密集轨迹、骨骼数据和音频线索。它仍与当前先进架构兼容,包括I3D、AssembleNet、Video Transformer Network、FASTER以及近期模型如VideoMAE V2和InternVideo2。为处理辅助特征中的不确定性,我们在幻觉步骤中纳入了偶发不确定性建模,并引入了一种鲁棒损失函数以缓解特征噪声。我们的多模态自监督动作识别框架在多个基准测试上取得了当前最佳性能,包括Kinetics-400、Kinetics-600和Something-Something V2,证明了其在捕捉精细动作动态方面的有效性。
Keyword:
Multimodal
Self-supervision
Action recognition
Uncertainty modeling
Feature hallucination
Optical flow
Skeleton
Audio
Object detection
Saliency detection
Domain-specific descriptor
Fine-grained recognition
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition用于基于骨架的动作识别的时空图卷积网络

