arrow
返回

DiffMusic: Efficient Music Generation From a Single Image Using Diffusion-Based Representations

delete2026-01-01
delete0
PRE
AI
J
Juhyeon Park
J
Junseok Kwon *
DOI:10.1109/TASLPRO.2026.3660263delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文提出DiffMusic,一种从单幅图像生成高质量音乐的新型方法。现有方法通过整合多领域数据或采用高成本方法(如大型语言模型LLMs)实现多模态,以生成高质量音乐。所提出的DiffMusic采用基于扩散的方法从单幅图像生成音乐描述,旨在解决传统音乐生成方法中遇到的问题。与传统的图像描述方法不同,该方法并非仅描述图像中的场景,而是生成包含音乐生成所必需的与流派相关的、旋律性和节奏性元素等描述。该方法通过单次推理过程即可实现图像到音乐的直接转换,同时能够无缝集成到各种现有的音乐生成器中。实验结果表明,在Frechet音频距离指标上,本方法比现有方法提升了29.9%,且成本更低。
Keyword:
Visualization
Music
Speech processing
Videos
Training
Diffusion models
Vectors
Instruments
Translation
Transformers
Music generation
diffusion-based representations
large language models

期刊

I
IEEE Transactions on Audio Speech and Language Processing
IF:
0
论文数:
151
被引数:
0

机构

C
Chung Ang University
学者数:
1.3W
论文数: 1.4W
被引数: 133
引用论文

引用论文

CLIPSonic: Text-to-Audio Synthesis with Unlabeled Videos and Pretrained Language-Vision Models
err2023-10-22
err0
PREAI
errDong,Hao-Wen; Liu,Xiaoyu; Pons,Jordi; Bhattacharya,Gautam; Pascual,Santiago; Serrà,Joan; Berg-Kirkpatrick,Taylor; McAuley,Julian
err分享
err收藏
Audio Set: An ontology and human-labeled dataset for audio events
err2017-03-01
err0
PREAI
errJort F. Gemmeke; Daniel P. W. Ellis; Dylan Freedman; Aren Jansen; Wade Lawrence; R. Channing Moore; Manoj Plakal; Marvin Ritter
err分享
err收藏
ImageBind One Embedding Space to Bind Them All
err2023-06-01
err0
errOAAI
errRohit Girdhar; Alaaeldin El-Nouby; Zhuang Liu; Mannat Singh; Kalyan Vasudev Alwala; Armand Joulin; Ishan Misra
err分享
err收藏
Meshed-Memory Transformer for Image Captioning
err2020-06-01
err0
errOAAI
errMarcella Cornia; Matteo Stefanini; Lorenzo Baraldi; Rita Cucchiara
err分享
err收藏
学者 查看更多内容