返回
From temporal thumbnail to semantics: Debiasing multi-view action recognition
DOI:10.1016/j.patcog.2026.113055.png)
摘要
En 中文
• 将静态偏差和语义视角偏差识别为多视角动作识别中的两个关键挑战。
• 引入时序快照模块以增强运动建模并抑制静态线索。
• 提出基于Mamba的语义融合方法,结合Dirichlet引导的不确定性加权,实现平衡的多视角整合。
• 在仅使用RGB数据的情况下达到当前最佳性能,在N-UCLA数据集上达到97.0%,在NTU-RGB+D数据集上达到96.7%。
• 展示了高效率特性,仅需1.35小时训练时间和25.4百万参数,支持资源受限环境下的部署。
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
THTFormer: Topology-adaptive hypergraph transformer network for skeleton-based action recognitionTHTFormer:一种基于拓扑自适应超图变换器的骨架动作识别网络
Pattern Recognition
IF7.6

