arrow
返回

Audio-visual source separation with localization and individual control

delete2025-05-23
delete0
delete
OA
AI
M
Mohanaprasad Kothandaraman
B
Balakrishnan Ramalingam *
K
Kai Sheng
A
Aman Verma
U
Utkarsh Dhagat
P
Pranav Parab
S
Siddhartha Mallavolu
S
Sankar Ganesh
DOI:10.1371/journal.pone.0321856delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
对视频会议软件日益增长的依赖带来了显著益处,但也引入了挑战,尤其是在音频质量管理方面。在多参与者场景中,环境噪声和干扰会阻碍发言人识别并中断对话流程。本研究提出了一种专为视频会议和远程呈现机器人应用设计的视听源分离管道。该框架旨在隔离并增强噪声环境中个体的语音,同时实现对视频帧中特定被摄者音量的控制。所提出的管道包含关键组件:基于深度学习的音频和视频特征提取器、音频引导的视觉注意力机制、背景噪声抑制及人声分离模块,以及Deep Multi-Resolution Network(DMRN)模块。为进行人声分离,采用了稳健的深度神经网络框架DPRNN-TasNet。实验结果证明,该方法能有效隔离并放大个体参与者的语音,在AVE和Music 21数据集上均达到71.88%的测试准确率。

期刊

PLoS One 封面图
PLoS One
IF:
2.6
论文数:
2.6W
被引数:
81.6W

机构

V
Vellore Inst Technol
学者数:
1.0K
论文数: 507
被引数: 111
引用论文

引用论文

Localization of Sound Sources: A Systematic Review
err2021-06-29
err0
errOAAI
errMuhammad Usman Liaquat; Hafiz Suliman Munawar; Amna Rahman; Zakria Qadir; Abbas Z. Kouzani; M. A. Parvez Mahmud
err分享
err收藏
A survey of sound source localization with deep learning methods
err2022-07-05
err0
errOAAI
errPierre-Amaury Grumiaux; Srđan Kitić; Laurent Girin; Alexandre Guérin
err分享
err收藏
An Audio-Visual Separation Model Integrating Dual-Channel Attention Mechanism
err2023-01-01
err2
errOAAI
errZhang, Yutao; Wu, Kaixing; Zhao, Mengfan
err分享
err收藏
A Real-Time Speech Separation Method Based on Camera and Microphone Array Sensors Fusion Approach
errSENSORS
IF3.5
err2020-06-22
err4
errOAAI
errLiu, Ching-Feng; Ciou, Wei-Siang; Chen, Peng-Ting; Du, Yi-Chun
err分享
err收藏
Asteroid: The PyTorch-Based Audio Source Separation Toolkit for Researchers
err2020-10-25
err0
errOAAI
errManuel Pariente; Samuele Cornell; Joris Cosentino; Sunit Sivasankaran; Efthymios Tzinis; Jens Heitkaemper; Michel Olvera; Fabian-Robert Stöter; Mathieu Hu; Juan M. Martín-Doñas; David Ditter; Ariel Frank; Antoine Deleforge; Emmanuel Vincent
err分享
err收藏
学者 查看更多内容