返回
Audio-visual source separation with localization and individual control
DOI:10.1371/journal.pone.0321856.png)
摘要
En 中文
对视频会议软件日益增长的依赖带来了显著益处,但也引入了挑战,尤其是在音频质量管理方面。在多参与者场景中,环境噪声和干扰会阻碍发言人识别并中断对话流程。本研究提出了一种专为视频会议和远程呈现机器人应用设计的视听源分离管道。该框架旨在隔离并增强噪声环境中个体的语音,同时实现对视频帧中特定被摄者音量的控制。所提出的管道包含关键组件:基于深度学习的音频和视频特征提取器、音频引导的视觉注意力机制、背景噪声抑制及人声分离模块,以及Deep Multi-Resolution Network(DMRN)模块。为进行人声分离,采用了稳健的深度神经网络框架DPRNN-TasNet。实验结果证明,该方法能有效隔离并放大个体参与者的语音,在AVE和Music 21数据集上均达到71.88%的测试准确率。
期刊
IF:
2.6
论文数:
2.6W
被引数:
81.6W
机构
引用论文
Multiple Sound Source Localization, Separation, and Reconstruction by Microphone Array: A DNN-Based Approach基于麦克风阵列的多声源定位、分离与重建:一种基于DNN的方法
Self-Supervised Sound Promotion Method of Sound Localization from Video基于视频的声音定位自监督促进方法
Electronics
IF0
A Real-Time Speech Separation Method Based on Camera and Microphone Array Sensors Fusion Approach
SENSORS
IF3.5

