返回
MARS: Multimodal-Assisted Refined Semantic Alignment
DOI:10.1016/j.ipm.2025.104292.png)
摘要
En 中文
• MARS优化了基于音频的图像生成的语义对齐。
• 一个基于Mamba的编码器处理长音频序列。
• MLLMs提供丰富的视觉内容以增强语义和美学效果。
• 大量实验证明了其有效性和鲁棒性。
Keyword:
Audio-Based image generation
Audio-visual learning
Multimodal alignment
Contrastive learning
期刊
I
IF:
6.9
论文数:
5.2K
被引数:
1.4W

