返回
An efficient adaptive compression method for human perception and machine vision tasks
DOI:10.1016/j.patcog.2026.114421.png)
摘要
En 中文
尽管大多数现有的神经图像压缩(NIC)和神经视频压缩(NVC)方法已取得显著成功,但它们的优化主要集中于人类视觉感知。然而,随着人工智能的快速发展,许多图像和视频将用于各类机器视觉任务。因此,现有的压缩方法在机器视觉中无法实现有竞争力的性能。为解决这一问题,已提出一些面向机器视觉的编码方法,但它们在多任务压缩和高效优化方面仍存在挑战。在本工作中,我们提出了一种高效自适应压缩(EAC)方法,该方法兼顾人类感知和多种机器视觉任务。我们的方法包含两个关键模块:(1)自适应压缩机制,通过自适应选择潜在特征中的若干子集,以平衡对多种机器视觉任务(如分割和检测)及人类视觉的优化;(2)任务特定适配器,利用参数高效增量调优策略,激活特定机器视觉任务的下游综合分析网络。通过上述两个模块,我们能够优化比特率成本并提升机器视觉性能。总体而言,我们提出的EAC能够无缝集成到现有的NIC(即Ballé2018和Cheng2020)和NVC(即DVC和FVC)方法中。在多个基准数据集(即VOC2007、ILSVRC2012、VOC2012、COCO、UCF101和DAVIS)上的广泛评估表明,我们的方法在保持人类视觉质量的同时,提升了多种机器视觉任务的性能。
Keyword:
Image compression
Video compression
Compression for machine perception
Efficient fine-tuning
Multi-task learning

