返回
A dual-pathway framework with vision-language adaption for data-efficient fire image classification
DOI:10.1016/j.firesaf.2026.104941.png)
摘要
En 中文
基于视觉的火灾检测对于减少灾难性损害至关重要,但传统的深度学习方法因依赖大规模标注数据集而存在根本性局限。尽管视觉-语言模型(VLMs)通过丰富的跨模态先验知识提供了有前景的解决方案,但在极端数据稀缺条件下将其适应于特定领域的火灾场景仍是一项重大挑战。本文提出了一种新颖的双通路少样本火灾分类框架,协同整合了视觉缓存适应和测试时提示调优。首先,我们设计了一种交叉注意力缓存适配器,从有限的支撑样本构建类别分区的特征库,动态生成测试特定的视觉分类器。其次,我们引入了一种基于置信度选择机制的无监督测试时提示调优策略,在运行时优化火灾特定的文本提示,以确保在不同环境条件下的鲁棒适应。在四个基准数据集(AIDER、DeepQuest-AI、FASDD-RS和SmokeRS)上的广泛实验表明,我们的方法在少样本场景下建立了新的最佳水平。具体而言,我们的方法在持续优于现有的先进VLM微调范式,包括最佳提示调优和特征适应方法。此外,我们的框架在利用显著更少训练样本的情况下,超越了在完整数据集上训练的传统CNN和视觉变换器架构。这项研究突显了我们双通路VLM适应方法在现实世界、数据受限的火灾监测应用中的巨大潜力。
期刊
IF:
3.3
论文数:
3.3K
被引数:
9.6K
机构
引用论文
暂无论文信息

