arrow
Return

DiffMusic: Efficient Music Generation From a Single Image Using Diffusion-Based Representations

delete2026-01-01
delete0
PRE
AI
J
Juhyeon Park
J
Junseok Kwon *
DOI:10.1109/TASLPRO.2026.3660263delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
In this paper, we present DiffMusic, a novel methodology for generating high-quality music from a single image. Existing methodologies have achieved multi-modality by integrating data from various domains or employing high-cost approaches, such as Large Language Models (LLMs), to generate high-quality music. The proposed DiffMusic adopts a diffusion-based approach to generate music descriptions from a single image, aiming to solve the issues encountered in traditional music generation methods. Unlike traditional image captioning, this approach does not simply describe the scene within the image. Instead, it generates descriptions that capture genre-related, melodic, and rhythmic elements essential for music generation. This approach enables the direct conversion of an image into music with a single inference process while allowing seamless integration into various existing music generators. Experimental results demonstrate that our method outperforms existing approaches by 29.9% in terms of Frechet Audio Distance, while remaining more cost-effective.
Keywords:
Visualization
Music
Speech processing
Videos
Training
Diffusion models
Vectors
Instruments
Translation
Transformers
Music generation
diffusion-based representations
large language models

Journal

I
IEEE Transactions on Audio Speech and Language Processing
IF:
0
Papers:
151
Citations:
0

Organization

C
Chung Ang University
Scholars:
1.3W
Papers: 1.4W
Citations: 133
Cited Papers

Cited Papers

CLIPSonic: Text-to-Audio Synthesis with Unlabeled Videos and Pretrained Language-Vision Models
err2023-10-22
err0
PREAI
errDong,Hao-Wen; Liu,Xiaoyu; Pons,Jordi; Bhattacharya,Gautam; Pascual,Santiago; Serrà,Joan; Berg-Kirkpatrick,Taylor; McAuley,Julian
errShare
errSave
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
err2024-10-28
err0
PREAI
errNavonil Majumder; Chia-Yu Hung; Deepanway Ghosal; Wei-Ning Hsu; Rada Mihalcea; Soujanya Poria
errShare
errSave
High-Resolution Image Synthesis with Latent Diffusion Models
err2022-06-01
err0
errOAAI
errRobin Rombach; Andreas Blattmann; Dominik Lorenz; Patrick Esser; Bjorn Ommer
errShare
errSave
errShare
errSave
Audio Set: An ontology and human-labeled dataset for audio events
err2017-03-01
err0
PREAI
errJort F. Gemmeke; Daniel P. W. Ellis; Dylan Freedman; Aren Jansen; Wade Lawrence; R. Channing Moore; Manoj Plakal; Marvin Ritter
errShare
errSave
ImageBind One Embedding Space to Bind Them All
err2023-06-01
err0
errOAAI
errRohit Girdhar; Alaaeldin El-Nouby; Zhuang Liu; Mannat Singh; Kalyan Vasudev Alwala; Armand Joulin; Ishan Misra
errShare
errSave
Meshed-Memory Transformer for Image Captioning
err2020-06-01
err0
errOAAI
errMarcella Cornia; Matteo Stefanini; Lorenzo Baraldi; Rita Cucchiara
errShare
errSave
researcher View more