返回
Multimodal Skeleton-based Action Representation Learning via Decomposition and Composition
DOI:10.1007/s11633-025-1583-z.png)
摘要
En 中文
多模态人体动作理解是计算机视觉中的一个重要问题,其核心挑战在于有效利用不同模态间的互补性同时保持模型效率。然而,现有方法大多依赖简单的晚期融合来提升性能,导致巨大的计算开销。尽管为所有模态共享骨干网络的早期融合方式效率较高,但难以实现优异性能。为解决效率与效果之间的平衡困境,我们提出了一种自监督多模态骨架基础动作表示学习框架,命名为分解与组合。分解策略将融合的多模态特征精细分解为独立的单模态特征,随后将其与各自的真实单模态对应特征对齐。另一方面,组合策略整合多个单模态特征,利用其作为自监督指导以增强多模态表示的学习。在NTU RGB+D 60、NTU RGB+D 120和PKU-MMD II数据集上的大量实验表明,所提方法在计算成本和模型性能之间取得了出色的平衡。
Keyword:
Action recognition
action understanding
skeleton-based action recognition
multimodal fusion
self-supervised learning
期刊
IF:
8.7
论文数:
303
被引数:
882
机构
引用论文
Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition用于基于骨架的动作识别的时空图卷积网络
SkeletonMAE: Graph-based Masked Autoencoder for Skeleton Sequence Pre-trainingSkeletonMAE: 用于骨架序列预训练的基于图的掩码自动编码器

