arrow
返回

YOLO-Based Transfer Learning for Sound Event Detection Using Visual Object Detection Techniques

delete2025-12-24
delete0
PRE
AI
G
Gonzalez, Sergio Segovia *
Q
Quiros, Sara Barahona
D
Doroteo T. Toledano
DOI:10.3390/app16010205delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
传统声音事件检测(SED)方法基于专用模型或这些模型与通用音频嵌入提取器的结合。在本文中,我们提出将SED重新表述为时频平面上的目标检测任务,并引入现代YOLO检测器在音频领域的直接适配。据我们所知,这是首批将YOLOv8和YOLOv11不仅作为特征提取器,而且作为在梅尔频谱图上定位和分类声音事件的端到端模型的研究之一。在方法论上,我们的方法(i)从原始音频动态生成梅尔频谱图,以简化流程并实现从视觉模型的迁移学习;(ii)应用课程学习,使检测器接触渐进式更复杂的混合音频,提高对重叠的鲁棒性;(iii)使用根据DCASE 2023指南构建的合成音频扩充训练数据,以丰富稀有类别和具有挑战性的场景。全面的实验将我们的YOLO框架与强大的CRNN和Conformer基线进行比较。在DCASE风格设置的实验中,该方法在检测精度上与CRNN和Conformer基线具有竞争力,在某些重叠/嘈杂条件下有所提升,但在几个短时类上存在不足。这些结果表明,将现代目标检测器适配到音频领域在这种设置下是有效的,而更广泛的泛化和编码器增强比较仍需进一步研究。
Keyword:
event detection
object detection
transfer learning
YOLO

期刊

A
Applied Sciences-Basel
IF:
2.5
论文数:
7.6K
被引数:
4

机构

A
autonomous university of madrid
学者数:
457
论文数: 222
被引数: 0
引用论文

引用论文

Scalable Object Detection Using Deep Neural Networks
err2014-06-01
err0
errOAAI
errDumitru Erhan; Christian Szegedy; Alexander Toshev; Dragomir Anguelov
err分享
err收藏
err分享
err收藏
err分享
err收藏
err分享
err收藏
err分享
err收藏
学者 查看更多内容