返回
Incremental Vision–Language Object Detection via Sparse Frequency Transform
DOI:10.1109/tip.2026.3723720.png)
摘要
En 中文
视觉-语言目标检测器(VLODs)在大型图像-文本语料库上预训练后表现出强大的零样本检测能力,但其在后续出现的专业化下游任务上的性能往往下降。因此,我们研究了增量视觉-语言目标检测(IVLOD),该任务要求在跨领域和/或类别变化的任务中持续调整VLOD,同时缓解先前任务的灾难性遗忘并保留其零样本泛化能力。为解决此问题,我们提出了一种新颖的方法,命名为稀疏频率变换(SFT),该方法通过频域设计最小化任务间干扰。基于遗忘与Frobenius内积(FIP)之间的理论联系,SFT在谱支撑上强制执行稀疏独立性,通过构造实现零任务间FIP,并在对预训练模型影响较小的情况下实现减少遗忘。谱支撑通过在线梯度幅度评分规则选择,并屏蔽先前使用的支撑,然后通过逆离散余弦变换(IDCT)转换为密集时域更新,以保留FIP约束并提高优化效率。在完全样本和少样本IVLOD设置下的广泛实验表明,我们的SFT能够在保持预训练模型零样本泛化能力的同时持续学习新任务。
Keyword:
Incremental object detection
vision-language model
catastrophic forgetting
discrete cosine transform
期刊
IF:
13.7
论文数:
1.0W
被引数:
8.4W
机构
引用论文
暂无论文信息

