arrow
返回

Self-improved holistic alignment for preference enhancement

delete2026-02-07
delete0
PRE
AI
K
Kejia Chen
J
Jiawen Zhang
J
Jiazhen Yang
M
Mingli Song
冯
冯尊磊 (Zunlei Feng)
DOI:10.1016/j.patcog.2026.113238delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 提出的SHAPE:一种无需人工标签的自监督框架,用于对齐LVLMs。 • 通过多视角摘要将图文对转化为偏好元组。 • 通过迭代优化显著减少幻觉并增强鲁棒性。 • 在POPE及多个标准基准测试中超越现有最优基线。 • 提供了一种可扩展、成本效益高的鲁棒视觉语义对齐解决方案。
Keyword:
SHAPE
self-supervised framework
visual-semantic alignment
preference learning
iterative optimization

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

Z
zhejiang university
学者数:
17.7W
论文数: 12.1W
被引数: 152
引用论文

引用论文

err分享
err收藏
Visual primitives as words: Alignment and interaction for compositional zero-shot视觉原语作为单词: 组合零镜头的对齐和交互
err2025-01-01
err0
PREAI
errShuang, Feng; Li, Jiahuan; Huang, Qingbao; Zhao, Wenye; Xu, Dongsheng; Han, Chao; Cheng, Haonan
err分享
err收藏
Foundation Models Defining a New Era in Vision: a Survey and Outlook基础模型:定义视觉领域的新纪元——综述与展望
err2025-01-01
err0
PREAI
errMuhammad Awais; Muzammal Naseer; Salman Khan; Rao Muhammad Anwer; Hisham Cholakkal; Mubarak Shah; Ming-Hsuan Yang; Fahad Shahbaz Khan
err分享
err收藏
A survey on multimodal large language models多模态大语言模型研究综述
err2024-11-12
err0
errOAAI
errYin, Shukang; Fu, Chaoyou; Zhao, Sirui; Li, Ke; Sun, Xing; Xu, Tong; Chen, Enhong
err分享
err收藏