未登录
分享
收藏SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
Wang, Xiaofei; Thakker, Manthan; Chen, Zhuo; Kanda, Naoyuki; Eskimez, Sefik Emre; Chen, Sanyuan; Tang, Min; Liu, Shujie; Li, Jinyu; Yoshioka, Takuya
分享
收藏
分享
收藏WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech ProcessingWavLM: 用于全栈语音处理的大规模自监督预训练
Chen, Sanyuan; Wang, Chengyi; Chen, Zhengyang; Wu, Yu; Liu, Shujie; Chen, Zhuo; Li, Jinyu; Kanda, Naoyuki; Yoshioka, Takuya; Xiao, Xiong; Wu, Jian; Zhou, Long; Ren, Shuo; Qian, Yanmin; Qian, Yao; Zeng, Michael; Yu, Xiangzhan; Wei, Furu
分享
收藏
分享
收藏
分享
收藏
分享
收藏Speech recognition in living rooms: Integrated speech enhancement and recognition system based on spatial, spectral and temporal modeling of sounds
Delcroix, Marc; Kinoshita, Keisuke; Nakatani, Tomohiro; Araki, Shoko; Ogawa, Atsunori; Hori, Takaaki; Watanabe, Shinji; Fujimoto, Masakiyo; Yoshioka, Takuya; Oba, Takanobu; Kubo, Yotaro; Souden, Mehrez; Hahm, Seong-Jun; Nakamura, Atsushi
分享
收藏
分享
收藏