arrow
返回

Visual Feature Domain Audio Coding for Anomaly Sound Detection Application

delete2025-10-15
delete0
delete
OA
AI
B
Byun, Subin
J
Jeongil Seo *
DOI:10.3390/a18100646delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
传统音频和视频编解码器是为人类感知设计的,通常会丢弃对机器分析至关重要的微妙频谱线索。为克服此限制,我们提出了一种面向机器的压缩框架,将频谱图重新解释为视觉对象,并将面向机器的特征编码(FCM)应用于异常声音检测(ASD)。在我们的方法中,音频信号转换为对数梅尔频谱图,从中提取中间特征图,并通过FCM流程进行压缩和重建。为进行比较,我们实现了AAC-LC(高级音频编码低复杂度)作为代表性感知音频编解码器,以及VVC(多功能视频编码)作为基于频谱图的视频编解码器。实验在DCASE(声学场景和事件检测与分类)2023任务2数据集上进行,涵盖四种机器类型(风扇、阀门、玩具车、滑块),使用DCASE 2024发布的官方自动编码器基线模型进行异常检测。检测得分基于重建误差和马氏距离计算。结果表明,所提出的基于FCM的ACoM(面向机器的音频编码)在比特率不到AAC的一半时,实现了相当或更优的性能,即使在超低比特率条件(1.3-6.3 kbps)下也能可靠地保留关键特征。而VVC仅在较高比特率下保持竞争力,在低比特率下性能急剧下降。这些发现表明,基于特征压缩为下一代ACoM标准化提供了有前景的方向,能够在带宽受限的工业环境中实现高效且鲁棒的ASD。
Keyword:
anomalous sound detection
audio coding for machines
deep learning

期刊

Algorithms 封面图
Algorithms
IF:
2.1
论文数:
644
被引数:
5.4K

机构

D
Dong A University
学者数:
3.7K
论文数: 3.6K
被引数: 111
引用论文

引用论文

err分享
err收藏
Deep Learning for Audio Signal Processing
err2019-05-01
err423
errOAAI
errPurwins, Hendrik; Li, Bo; Virtanen, Tuomas; Schlueter, Jan; Chang, Shuo-Yiin; Sainath, Tara
err分享
err收藏
AST: Audio Spectrogram Transformer
err2021-08-30
err0
errOAAI
errYuan Gong; Yu-An Chung; James Glass
err分享
err收藏