返回
Second-order wavelet-based multi-frequency music generation
DOI:10.1007/s11760-025-04146-z.png)
摘要
En 中文
得益于人工智能算法的进步,音乐生成在质量和时长方面均取得了显著进展。目前,基于人类文本提示生成的音乐在连续性和旋律方面能够获得较高的偏好度。然而,大多数研究忽视了旋律(高低频率)在音乐生成中的重要性。事实上,当前基于扩散的音乐生成模型的输出倾向于平均概率,导致模型难以有效生成或处理高低频信号。在本文中,我们构建了一个二阶小波自动编码器,用于将波形分解为低频和高频分量。随后,我们使用扩散模型(DM)对不同的频率信号进行建模。此外,我们提出一个频域感知模块,以增强DM在不同时间步处理频率的能力。与最先进的工作相比,在生成质量和时长相似条件下,我们的方法在偏好度上表现更优。
Keyword:
Music generation
Diffusion model
Second-order wavelet
Autoencoder
期刊
IF:
2.1
论文数:
908
被引数:
4.6K
机构
暂无机构信息
引用论文
Fundamentals of Recurrent Neural Network (RNN) and Long Short-Term Memory (LSTM) network递归神经网络 (RNN) 和长短期记忆 (LSTM) 网络的基本原理
NetDiffus: Network traffic generation by diffusion models through time-series imagingNetDiffus: 通过时间序列成像通过扩散模型生成网络流量
Music Generation Using Deep Learning and Generative AI: A Systematic Review使用深度学习和生成人工智能的音乐生成: 系统综述
IEEE ACCESS
IF3.6
A systematic review of artificial intelligence-based music generation: Scope, applications, and future trends基于人工智能的音乐生成的系统综述: 范围、应用和未来趋势

