返回
Using large multimodal models to predict outfit compatibility
DOI:10.1016/j.dss.2025.114457.png)
摘要
En 中文
搭配协调是人们表达自我的直接方式。然而,判断上衣和下装的兼容性需要考虑颜色、风格等多种因素。这一过程耗时且易出错。近年来,大型语言模型和大型多模态模型的发展已转变了许多应用领域。本研究旨在探索如何利用这些模型实现服装搭配推荐领域的突破。该研究结合了大型语言模型Gemini在视觉问答(VQA)任务中的关键词响应文本,以及大型多模态模型Beit3的深度特征融合技术。通过仅提供服装的图像数据,用户即可评估上衣和下装的兼容性,使过程更加便捷。我们提出的服装推荐大型多模态语言模型(LMLMO)在FashionVC和Evaluation3数据集上优于先前提出的模型。此外,实验结果表明,不同类型的关键词响应会对模型产生不同影响,为未来研究提供了新的方向和见解。
Keyword:
Large multi-modal models
Large language models
Outfit compatibility
Outfit recommendation
期刊
IF:
6.8
论文数:
3.8K
被引数:
1.5W
机构
引用论文
Mining Fashion Outfit Composition Using an End-to-End Deep Learning Approach on Set Data在集合数据上使用端到端深度学习方法挖掘时尚服装成分
Multimodal Co-learning: Challenges, applications with datasets, recent advances and future directions多模态协同学习: 挑战、数据集应用、最新进展和未来方向
INFORMATION FUSION
IF15.5
You can try without visiting: a comprehensive survey on virtually try-on outfits您可以在不访问的情况下尝试: 对虚拟试穿服装的全面调查

