返回
Zero-shot diverse audio captioning with diffusion models
DOI:10.1016/j.knosys.2025.115205.png)
摘要
En 中文
• 首次将多样性(diversity)和零样本学习(zero-shot)能力结合应用于音频字幕生成。
• 发现噪声引起的条件退化问题,并采用条件平铺(condition tiling)方法加以解决。
• 无需音频输入即可适配对齐模型,以实现检索引导的Langevin动力学(retrieval-guided Langevin dynamics)。
• 在主要基准测试中,超越先前零样本工作的多样性表现,并弥补基线准确率差距。
期刊
K
IF:
7.6
论文数:
1.2W
被引数:
4.5W
机构
引用论文
Diff-PC: Identity-preserving and 3D-aware controllable diffusion for zero-shot portrait customizationDiff-PC:保持身份特征且具有3D感知能力的可控扩散模型,用于零样本肖像定制
INFORMATION FUSION
IF15.5
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal ResearchWavCaps: 用于音频语言多模态研究的ChatGPT辅助弱标记音频字幕数据集
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio GenerationAuffusion: 利用扩散和大型语言模型的力量进行文本到音频的生成

