返回
Temporal diffuser: Timing scale-aware modulation for sign language production
DOI:10.1016/j.engappai.2025.112739.png)
摘要
En 中文
近期在手语生成(SLP)领域的进展表明,去噪扩散模型是传统自回归方法的潜在替代方案。大多数现有方法采用两阶段流水线,将手语动作编码为离散的潜在码,通常牺牲时空保真度,并需要词目标注或复杂的码本。基于Transformer的模型旨在简化这一过程,但常生成过度平滑、不自然的动作。我们提出一种新颖的单阶段、无词目手语生成框架SignSAM(Scale-Aware Modulation),该框架直接在连续空间中合成动作,保留精细的时序细节。其核心是一个时空U-Net,通过联合降采样帧和手语特征维度来学习紧凑的时序特征,从而相比无金字塔U-Net或维度不一致的金字塔U-Net降低计算成本。为进一步提升时序精度,我们提出一种时序尺度感知调制模块,融合多尺度时序分辨率以改善动作连贯性。在PHOENIX14T和How2Sign数据集上的实验表明,SignSAM在流畅度、准确性和自然度方面达到当前最佳(SOTA)水平,为SLP提供了一种高效且富有表现力的解决方案。项目主页为https://kha-kim-thuy.github.io/SLP-Demo/。
Keyword:
Sign language production
Space–Time U-Net
Timing scale-aware modulation
Temporal diffusion
Motion generation
Time series attention mechanism
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
8
论文数:
5.7K
被引数:
3.5W
机构
引用论文
Continuous 3D Multi-Channel Sign Language Production via Progressive Transformers and Mixture Density Networks通过渐进式变换器和混合密度网络进行连续3D多通道手语制作
Vo, A.H., Kim, T.S., Jin, H., Choi, S.M., Kim, Y.G., 2025. Instruction-driven 3d facial expression generation and transition. IEEE Transactions on Multimedia , 1–15.Vo, A.H., Kim, T.S., Jin, H., Choi, S.M., Kim, Y.G., 2025. 指令驱动的3D面部表情生成与过渡. IEEE Transactions on Multimedia, 1–15.
Dynamic GAN for high-quality sign language video generation from skeletal poses using generative adversarial networks
SOFT COMPUTING
IF2.5
Text2Sign: Towards Sign Language Production Using Neural Machine Translation and Generative Adversarial NetworksText2Sign: 使用神经机器翻译和生成对抗网络进行手语制作

