返回
Visual-Language Scene-Relation-Aware Zero-Shot Captioner
DOI:10.1109/TPAMI.2025.3581174.png)
摘要
En 中文
零样本图像字幕生成可以利用预训练视觉语言模型(VLMs)和语言模型(LMs)的知识,为目标域图像生成字幕,而无需配对样本训练。现有方法试图在仅文本的预训练任务中建立视觉和文本模态之间的高质量连接。这些方法可分为两种视角:句子级和实体级。尽管它们在某些指标上取得了有效性能,但由于训练过程中的偏差关联,它们会遭受幻觉问题。在本文中,我们提出了一种场景关系级预训练任务,将关系视为更有价值的模态连接桥梁。基于此,我们构建了一个新颖的视觉-语言场景关系感知字幕生成器(SRACap),它在为图像生成字幕的同时扩展了预测场景关系的能力。此外,SRACap具备优秀的跨域零样本泛化能力,这由一个精心设计的场景强化切换管道驱动。我们引入一个场景策略网络,动态裁剪图像中的显著区域,并将其输入语言模型以生成字幕。我们集成了多个专家CLIP模型,形成一个奖励混合模块(MoR)作为奖励来源,并通过零样本推理阶段的策略梯度算法对SRACap进行深度优化。随着场景强化切换的迭代,SRACap可以在保持视觉-语言模态间高语义一致性的同时,逐步细化生成的字幕细节。我们在多个标准图像字幕生成基准上进行了大量实验,表明SRACap能够准确理解场景结构并生成高质量文本,显著优于其他零样本推理方法。
Keyword:
Image captioning
zero-shot inference
reinforcement learning
scene relation modeling
text-only pretrain
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
暂无论文信息

