arrow
返回

MARS: Multimodal-Assisted Refined Semantic Alignment

delete2025-08-07
delete0
PRE
AI
J
Junjie Xu
X
Xingjiao Wu *
Z
Zihao Zhang
S
Shuwen Yang
T
Tianlong Ma
D
Daoguo Dong
何亮 封面图
何亮 (Liang He)
DOI:10.1016/j.ipm.2025.104292delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• MARS优化了基于音频的图像生成的语义对齐。 • 一个基于Mamba的编码器处理长音频序列。 • MLLMs提供丰富的视觉内容以增强语义和美学效果。 • 大量实验证明了其有效性和鲁棒性。
Keyword:
Audio-Based image generation
Audio-visual learning
Multimodal alignment
Contrastive learning

期刊

I
Information Processing and Management
IF:
6.9
论文数:
5.2K
被引数:
1.4W

机构

E
east china normal university
学者数:
3.1W
论文数: 2.1W
被引数: 25
引用论文

引用论文

Sound-Guided Semantic Image Manipulation
err2022-06-01
err0
errOAAI
errSeung Hyun Lee; Wonseok Roh; Wonmin Byeon; Sang Ho Yoon; Chanyoung Kim; Jinkyu Kim; Sangpil Kim
err分享
err收藏
Multi-level semantics probability embedding for image-text matching
err2025-03-01
err0
PREAI
errLiu, An-An; Yang, Long; Li, Wenhui; Nie, Weizhi; Liu, Xianzhu; Chen, Haipeng
err分享
err收藏
Rare-aware attention network for image-text matching
err2023-05-01
err11
PREAI
errWang, Yan; Su, Yuting; Li, Wenhui; Sun, Zhengya; Wei, Zhiqiang; Nie, Jie; Li, Xuanya; Liu, An-An
err分享
err收藏
err分享
err收藏
学者 查看更多内容