arrow
返回

FD-DeCap: A Front-Door Causal Inference-Based Framework for Debiasing Automatic Audio Captioning

delete2026-01-01
delete0
PRE
AI
J
Jinyun Liu
H
Hui Li
M
Mingjun Wei
Z
Zhanlin Ji *
Z
Zhang, Haiyang *
И
Иван Ганчев *
DOI:10.1109/ACCESS.2026.3651636delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
自动音频字幕生成(AAC)旨在为音频内容生成自然语言描述。然而,现有方法常受数据中潜在混淆因素和虚假共现模式的影响,导致偏差和语义不准确。本文提出FD-DeCap,一种基于前门因果推断的框架,用于AAC任务。该框架包含三个核心组件:1)AudioAug模块在音频特征中引入噪声扰动,以增强对环境干扰的鲁棒性;2)MedGate模块显式引入中介变量以满足前门标准的可识别条件,从而分离直接和间接效应;3)MSeCE一致性损失联合优化交叉熵和MSE约束,鼓励依赖中介表示而非虚假相关性。实验结果表明,与当前最佳框架相比,FD-DeCap在Clotho和AudioCaps数据集上实现了稳定的性能提升,SPIDEr分数分别为0.282和0.429。在Clotho数据集上执行的前门调整多视角因果验证,包括相似度分数分布、特征分布和代表性案例研究的分析。去偏后,生成字幕与参考字幕的相似度总体上向上偏移,中介特征分布变得更加分散,代表性案例更准确地捕捉了真实的声学场景。这些发现表明,所提出的FD-DeCap框架有效缓解了由潜在混淆因素和虚假共现引起的偏差,增强了生成字幕的语义一致性和鲁棒性,并为复杂声学场景下的AAC任务提供了新的解决方案。
Keyword:
Semantics
Birds
Feature extraction
Transformers
Training
Dogs
Data models
Convolutional neural networks
Chirp
Acoustics
Automatic audio captioning (AAC)
bias
causal inference
front-door adjustment

期刊

IEEE Access 封面图
IEEE Access
IF:
3.6
论文数:
9.8W
被引数:
29.4W

机构

U
university of limerick
学者数:
1.2K
论文数: 580
被引数: 0
Z
Zhejiang A&F University
学者数:
1.0W
论文数: 6.1K
被引数: 178
N
north china university of science & technology
学者数:
6.6K
论文数: 3.7K
被引数: 5
X
xi'an jiaotong-liverpool university
学者数:
1.1K
论文数: 578
被引数: 0
学者 查看更多机构
引用论文

引用论文

Local Information Assisted Attention-Free Decoder for Audio Captioning
err2022-01-01
err10
errOAAI
errXiao, Feiyang; Guan, Jian; Lan, Haiyan; Zhu, Qiaoxi; Wang, Wenwu
err分享
err收藏
Training Audio Captioning Models without Audio
err2024-04-14
err0
errOAAI
errSoham Deshmukh; Benjamin Elizalde; Dimitra Emmanouilidou; Bhiksha Raj; Rita Singh; Huaming Wang
err分享
err收藏
Causal inference in regression: advice to authors
err2021-12-10
err7
errOAAI
errBulbulia, Joseph; Schjoedt, Uffe; Shaver, John H.; Sosis, Richard; Wildman, Wesley J.
err分享
err收藏
err分享
err收藏
学者 查看更多内容