返回
Multi-VLM collaborated adaptive sampling for enhanced data pruning
DOI:10.1016/j.neucom.2026.134668.png)
摘要
En 中文
数据剪枝对于在计算和数据资源受限条件下将大规模基础模型适配到下游任务至关重要。然而,许多现有方法依赖浅层统计,忽略了图像与文本之间的语义关系,这在多模态设置中尤为有害。我们提出了多视觉语言模型协作自适应采样(mCAS)的数据剪枝框架,该框架利用多个预训练视觉语言模型(VLMs)的互补优势。mCAS包含三个组件:一个语义增强模块,利用大语言模型优化文本描述并丰富图像表示;一个多-VLM协作模块,通过无训练、等权重共识策略聚合来自不同VLM的序数排名;以及一个自适应采样模块,从中等相似度范围内选择信息样本,减少冗余同时缓解过拟合和欠拟合。在Mini-ImageNet、COCO-GLT、Caltech101和ImageNet-1K上的实验表明,mCAS在不同少样本和迁移设置下均一致优于代表性剪枝基线。在Mini-ImageNet上,mCAS在5-shot和10-shot分类准确率上分别提升高达41.3和32.6个百分点,同时使用更少的训练样本。在ImageNet-1K上,它在5-shot、10-shot和15-shot设置下分别进一步提升了8.24、9.72和8.81个百分点的分类准确率。额外的消融研究验证了各组件的贡献,并确认多-VLM协作产生更稳定可靠的剪枝决策。这些结果表明,利用多-VLM协作和自适应采样为保留关键语义信息提供了有效途径,使基础模型在数据稀缺的多模态环境中实现更可靠高效的部署。
Keyword:
Data pruning
Vision-language models
Multi-VLM collaboration
Adaptive sampling
Vision-text similarity
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
暂无论文信息

