返回
DiffMusic: Efficient Music Generation From a Single Image Using Diffusion-Based Representations
DOI:10.1109/TASLPRO.2026.3660263.png)
摘要
En 中文
本文提出DiffMusic,一种从单幅图像生成高质量音乐的新型方法。现有方法通过整合多领域数据或采用高成本方法(如大型语言模型LLMs)实现多模态,以生成高质量音乐。所提出的DiffMusic采用基于扩散的方法从单幅图像生成音乐描述,旨在解决传统音乐生成方法中遇到的问题。与传统的图像描述方法不同,该方法并非仅描述图像中的场景,而是生成包含音乐生成所必需的与流派相关的、旋律性和节奏性元素等描述。该方法通过单次推理过程即可实现图像到音乐的直接转换,同时能够无缝集成到各种现有的音乐生成器中。实验结果表明,在Frechet音频距离指标上,本方法比现有方法提升了29.9%,且成本更低。
Keyword:
Visualization
Music
Speech processing
Videos
Training
Diffusion models
Vectors
Instruments
Translation
Transformers
Music generation
diffusion-based representations
large language models
期刊
I
IF:
0
论文数:
151
被引数:
0
机构
引用论文
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference OptimizationTango 2:通过直接偏好优化对基于扩散的文本到音频生成进行对齐

