arrow
返回

Temporal diffuser: Timing scale-aware modulation for sign language production

delete2025-10-22
delete0
delete
OA
AI
K
Kim-Thuy Kha
A
Anh H. Vo
V
Van-Vang Le *
O
Oh-Young Song
Y
Yong-Guk Kim *
DOI:10.1016/j.engappai.2025.112739delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
近期在手语生成(SLP)领域的进展表明,去噪扩散模型是传统自回归方法的潜在替代方案。大多数现有方法采用两阶段流水线,将手语动作编码为离散的潜在码,通常牺牲时空保真度,并需要词目标注或复杂的码本。基于Transformer的模型旨在简化这一过程,但常生成过度平滑、不自然的动作。我们提出一种新颖的单阶段、无词目手语生成框架SignSAM(Scale-Aware Modulation),该框架直接在连续空间中合成动作,保留精细的时序细节。其核心是一个时空U-Net,通过联合降采样帧和手语特征维度来学习紧凑的时序特征,从而相比无金字塔U-Net或维度不一致的金字塔U-Net降低计算成本。为进一步提升时序精度,我们提出一种时序尺度感知调制模块,融合多尺度时序分辨率以改善动作连贯性。在PHOENIX14T和How2Sign数据集上的实验表明,SignSAM在流畅度、准确性和自然度方面达到当前最佳(SOTA)水平,为SLP提供了一种高效且富有表现力的解决方案。项目主页为https://kha-kim-thuy.github.io/SLP-Demo/。
Keyword:
Sign language production
Space–Time U-Net
Timing scale-aware modulation
Temporal diffusion
Motion generation
Time series attention mechanism
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Engineering Applications of Artificial Intelligence 封面图
Engineering Applications of Artificial Intelligence
IF:
8
论文数:
5.7K
被引数:
3.5W

机构

S
Sejong University
学者数:
8.3K
论文数: 1.1W
被引数: 1.5W
T
Ton Duc Thang University
学者数:
3.4K
论文数: 4.8K
被引数: 6.6K
引用论文

引用论文

EEGCiD: EEG Condensation Into Diffusion Model
err2024-01-01
err0
PREAI
errChen, Junfu; Pi, Dechang; Jiang, Xiaoyi; Gao, Feng; Wang, Bi; Chen, Yang
err分享
err收藏
Progressive Transformers for End-to-End Sign Language Production
err2020-11-27
err0
errOAAI
errBen Saunders; Necati Cihan Camgoz; Richard Bowden
err分享
err收藏
SignSynth: Data-Driven Sign Language Video Generation
err2021-01-03
err0
PREAI
errStephanie Stoll; Simon Hadfield; Richard Bowden
err分享
err收藏
学者 查看更多内容