返回
Spatial-Temporal Heatmap Masked Autoencoder for Skeleton-Based Action Recognition
DOI:10.3390/s25103146.png)
摘要
En 中文
骨骼表示学习通过编码复杂的运动细节和关节间的时空依赖关系,为动作识别提供了显著优势。然而,全监督方法需要大量标注数据,这些数据的获取通常需要大量人力且成本高昂。在本工作中,我们提出了空间-时间热力图掩码自编码器(STH-MAE),一种专为基于骨骼的动作识别设计的自监督框架。与基于坐标的方法不同,STH-MAE采用热力图体积作为其主要表示,在缓解姿态估计固有噪声的同时,利用了视觉转换器的进展。该框架通过在空间和时轴上聚集2D关节热力图来构建空间-时间热力图(STH)。将此STH划分为不重叠的补丁以促进局部特征学习,并应用掩码策略随机掩盖输入的部分区域。在预训练期间,配备轻量级预测头的基于视觉转换器的自编码器重建被掩盖的区域,从而促进鲁棒且可迁移的骨骼表示的提取。在NTU RGB+D 60和NTU RGB+D 120基准上的全面实验证明了STH-MAE的优越性,在多种评估协议下实现了最先进的表现。
Keyword:
skeleton-based action recognition
self-supervised learning
masked autoencoder
spatial-temporal heatmap
visual transformer
期刊
IF:
3.5
论文数:
7.2W
被引数:
20.9W
机构
引用论文
Channel-wise Topology Refinement Graph Convolution for Skeleton-Based Action Recognition基于骨架的动作识别的通道拓扑细化图卷积

