arrow
返回

Feature Hallucination for Self-supervised Action Recognition

delete2025-08-07
delete0
delete
OA
AI
L
Lei Wang *
P
Piotr Koniusz
DOI:10.1007/s11263-025-02513-4delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
理解视频中的人类动作不仅需要原始像素分析,还需要依赖高层次语义推理和有效的多模态特征融合。我们提出了一种深度翻译动作识别框架,通过联合预测动作概念和辅助特征来自RGB视频帧,从而提升识别精度。在测试阶段,幻觉流推断缺失的线索,丰富特征表示而无需增加计算开销。为聚焦于原始像素之外的与动作相关的区域,我们引入了两种新颖的领域特定描述符。物体检测特征(ODF)聚合多个物体检测器的输出来捕捉上下文线索,而显著性检测特征(SDF)突出对动作识别至关重要的空间和强度模式。我们的框架无缝集成了这些描述符与辅助模态,如光流、改进的密集轨迹、骨骼数据和音频线索。它仍与当前先进架构兼容,包括I3D、AssembleNet、Video Transformer Network、FASTER以及近期模型如VideoMAE V2和InternVideo2。为处理辅助特征中的不确定性,我们在幻觉步骤中纳入了偶发不确定性建模,并引入了一种鲁棒损失函数以缓解特征噪声。我们的多模态自监督动作识别框架在多个基准测试上取得了当前最佳性能,包括Kinetics-400、Kinetics-600和Something-Something V2,证明了其在捕捉精细动作动态方面的有效性。
Keyword:
Multimodal
Self-supervision
Action recognition
Uncertainty modeling
Feature hallucination
Optical flow
Skeleton
Audio
Object detection
Saliency detection
Domain-specific descriptor
Fine-grained recognition

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

S
School of Engineering and Built Environment
学者数:
44
论文数: 31
被引数: 1
C
College of Engineering
学者数:
1.2K
论文数: 744
被引数: 6
引用论文

引用论文

Video Transformer Network
err2021-10-01
err0
errOAAI
errDaniel Neimark; Omri Bar; Maya Zohar; Dotan Asselmann
err分享
err收藏
OmniMAE: Single Model Masked Pretraining on Images and Videos
err2023-06-01
err0
errOAAI
errRohit Girdhar; Alaaeldin El-Nouby; Mannat Singh; Kalyan Vasudev Alwala; Armand Joulin; Ishan Misra
err分享
err收藏
DeepFlow: Large Displacement Optical Flow with Deep Matching
err2013-12-01
err0
errOAAI
errPhilippe Weinzaepfel; Jerome Revaud; Zaid Harchaoui; Cordelia Schmid
err分享
err收藏
err分享
err收藏
学者 查看更多内容