arrow
返回

Zero-shot diverse audio captioning with diffusion models

delete2025-12-29
delete0
PRE
AI
Y
Yonggang Zhu
Z
Zhang, Yiming
L
Li Xiao
W
Wenwu Wang
A
Aidong Men
DOI:10.1016/j.knosys.2025.115205delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 首次将多样性(diversity)和零样本学习(zero-shot)能力结合应用于音频字幕生成。 • 发现噪声引起的条件退化问题,并采用条件平铺(condition tiling)方法加以解决。 • 无需音频输入即可适配对齐模型,以实现检索引导的Langevin动力学(retrieval-guided Langevin dynamics)。 • 在主要基准测试中,超越先前零样本工作的多样性表现,并弥补基线准确率差距。

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.2W
被引数:
4.5W

机构

B
Beijing University of Posts and Telecommunications
学者数:
2.6K
论文数: 1.2K
被引数: 4.2K
U
University of Surrey
学者数:
1.2W
论文数: 1.3W
被引数: 22
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏
AudioLDM 2: Learning Holistic Audio Generation With Self-Supervised Pretraining
err2024-01-01
err8
errOAAI
errLiu, Haohe; Yuan, Yi; Liu, Xubo; Mei, Xinhao; Kong, Qiuqiang; Tian, Qiao; Wang, Yuping; Wang, Wenwu; Wang, Yuxuan; Plumbley, Mark D.
err分享
err收藏
AudioSetCaps: An Enriched Audio-Caption Dataset Using Automated Generation Pipeline With Large Audio and Language Models
err2025-01-01
err0
PREAI
errBai,Jisheng; Liu,Haohe; Wang,Mou; Shi,Dongyuan; Wang,Wenwu; Plumbley,Mark D.; Gan,Woon-Seng; Chen,Jianfeng
err分享
err收藏
学者 查看更多内容