arrow
返回

Multimodal Skeleton-based Action Representation Learning via Decomposition and Composition

delete2026-04-15
delete0
PRE
AI
H
Hongsong Wang
H
Heng Fei
B
Bingxuan Dai
J
Jie Gui *
DOI:10.1007/s11633-025-1583-zdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
多模态人体动作理解是计算机视觉中的一个重要问题,其核心挑战在于有效利用不同模态间的互补性同时保持模型效率。然而,现有方法大多依赖简单的晚期融合来提升性能,导致巨大的计算开销。尽管为所有模态共享骨干网络的早期融合方式效率较高,但难以实现优异性能。为解决效率与效果之间的平衡困境,我们提出了一种自监督多模态骨架基础动作表示学习框架,命名为分解与组合。分解策略将融合的多模态特征精细分解为独立的单模态特征,随后将其与各自的真实单模态对应特征对齐。另一方面,组合策略整合多个单模态特征,利用其作为自监督指导以增强多模态表示的学习。在NTU RGB+D 60、NTU RGB+D 120和PKU-MMD II数据集上的大量实验表明,所提方法在计算成本和模型性能之间取得了出色的平衡。
Keyword:
Action recognition
action understanding
skeleton-based action recognition
multimodal fusion
self-supervised learning

期刊

Machine Intelligence Research 封面图
Machine Intelligence Research
IF:
8.7
论文数:
303
被引数:
882

机构

C
computer science and engineering
学者数:
1.3K
论文数: 615
被引数: 0
C
cyber science and engineering
学者数:
77
论文数: 35
被引数: 0
引用论文

引用论文

MS2L
err2020-10-12
err0
errOAAI
errLilang Lin; Sijie Song; Wenhan Yang; Jiaying Liu
err分享
err收藏
学者 查看更多内容