返回
Self-improved holistic alignment for preference enhancement
DOI:10.1016/j.patcog.2026.113238.png)
摘要
En 中文
• 提出的SHAPE:一种无需人工标签的自监督框架,用于对齐LVLMs。
• 通过多视角摘要将图文对转化为偏好元组。
• 通过迭代优化显著减少幻觉并增强鲁棒性。
• 在POPE及多个标准基准测试中超越现有最优基线。
• 提供了一种可扩展、成本效益高的鲁棒视觉语义对齐解决方案。
Keyword:
SHAPE
self-supervised framework
visual-semantic alignment
preference learning
iterative optimization
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
Language-Image Consistency Augmentation and Distillation Network for visual grounding语言-图像一致性增强与蒸馏网络用于视觉定位
PATTERN RECOGNITION
IF7.6
Instruction-guided fusion of multi-layer visual features in Large Vision-Language Models指令引导的多层视觉特征融合在大视觉语言模型中的应用
Pattern Recognition
IF7.6
Visual primitives as words: Alignment and interaction for compositional zero-shot视觉原语作为单词: 组合零镜头的对齐和交互
PATTERN RECOGNITION
IF7.6

