arrow
返回

Incremental Vision–Language Object Detection via Sparse Frequency Transform

delete2026-08-19
delete0
PRE
AI
X
Xiang Song
Z
Ziye Yang
Y
Yuhang He
S
Songlin Dong
Q
Qiang Wang
Y
Yihong Gong
DOI:10.1109/tip.2026.3723720delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
视觉-语言目标检测器(VLODs)在大型图像-文本语料库上预训练后表现出强大的零样本检测能力,但其在后续出现的专业化下游任务上的性能往往下降。因此,我们研究了增量视觉-语言目标检测(IVLOD),该任务要求在跨领域和/或类别变化的任务中持续调整VLOD,同时缓解先前任务的灾难性遗忘并保留其零样本泛化能力。为解决此问题,我们提出了一种新颖的方法,命名为稀疏频率变换(SFT),该方法通过频域设计最小化任务间干扰。基于遗忘与Frobenius内积(FIP)之间的理论联系,SFT在谱支撑上强制执行稀疏独立性,通过构造实现零任务间FIP,并在对预训练模型影响较小的情况下实现减少遗忘。谱支撑通过在线梯度幅度评分规则选择,并屏蔽先前使用的支撑,然后通过逆离散余弦变换(IDCT)转换为密集时域更新,以保留FIP约束并提高优化效率。在完全样本和少样本IVLOD设置下的广泛实验表明,我们的SFT能够在保持预训练模型零样本泛化能力的同时持续学习新任务。
Keyword:
Incremental object detection
vision-language model
catastrophic forgetting
discrete cosine transform

期刊

IEEE Transactions on Image Processing 封面图
IEEE Transactions on Image Processing
IF:
13.7
论文数:
1.0W
被引数:
8.4W

机构

S
shenzhen university of advanced technology
学者数:
360
论文数: 249
被引数: 0
N
northwestern polytechnical university
学者数:
1.3W
论文数: 4.6K
被引数: 0
X
xi'an jiaotong university
学者数:
9.3W
论文数: 6.7W
被引数: 75
学者 查看更多机构
引用论文

引用论文

暂无论文信息