返回
FD-DeCap: A Front-Door Causal Inference-Based Framework for Debiasing Automatic Audio Captioning
DOI:10.1109/ACCESS.2026.3651636.png)
摘要
En 中文
自动音频字幕生成(AAC)旨在为音频内容生成自然语言描述。然而,现有方法常受数据中潜在混淆因素和虚假共现模式的影响,导致偏差和语义不准确。本文提出FD-DeCap,一种基于前门因果推断的框架,用于AAC任务。该框架包含三个核心组件:1)AudioAug模块在音频特征中引入噪声扰动,以增强对环境干扰的鲁棒性;2)MedGate模块显式引入中介变量以满足前门标准的可识别条件,从而分离直接和间接效应;3)MSeCE一致性损失联合优化交叉熵和MSE约束,鼓励依赖中介表示而非虚假相关性。实验结果表明,与当前最佳框架相比,FD-DeCap在Clotho和AudioCaps数据集上实现了稳定的性能提升,SPIDEr分数分别为0.282和0.429。在Clotho数据集上执行的前门调整多视角因果验证,包括相似度分数分布、特征分布和代表性案例研究的分析。去偏后,生成字幕与参考字幕的相似度总体上向上偏移,中介特征分布变得更加分散,代表性案例更准确地捕捉了真实的声学场景。这些发现表明,所提出的FD-DeCap框架有效缓解了由潜在混淆因素和虚假共现引起的偏差,增强了生成字幕的语义一致性和鲁棒性,并为复杂声学场景下的AAC任务提供了新的解决方案。
Keyword:
Semantics
Birds
Feature extraction
Transformers
Training
Dogs
Data models
Convolutional neural networks
Chirp
Acoustics
Automatic audio captioning (AAC)
bias
causal inference
front-door adjustment
期刊
IF:
3.6
论文数:
9.8W
被引数:
29.4W
机构
引用论文
Fundamentals of Recurrent Neural Network (RNN) and Long Short-Term Memory (LSTM) network递归神经网络 (RNN) 和长短期记忆 (LSTM) 网络的基本原理

