返回
Masked autoencoder-based vision framework for robust fire detection in complex environments
DOI:10.1016/j.psep.2025.108019.png)
摘要
En 中文
基于视觉的火灾检测已成为计算机视觉领域日益重要的研究重点,其驱动力在于对监控环境中早期预警系统和公共安全的日益增长的需求。尽管传统模型主要依赖基于颜色的特征来区分火灾与背景,但在保持高检测精度的同时确保计算效率仍是一个持续的挑战,特别是在实时监控系统中。为解决这一问题,我们提出了一种基于掩码自编码和Vision Transformers(ViT)的新型火灾检测框架,旨在平衡检测性能与可扩展部署。我们的架构利用自监督学习来重建被掩码的视觉区域,增强了编码器在复杂场景中捕捉细粒度火灾线索的能力。全局注意力与层次化上下文建模的集成使系统能够在多样化环境条件下区分火灾与视觉上相似的非火灾模式,例如反射和人工照明。与先前对背景噪声敏感或严重依赖通道显著性的模型不同,我们的方法通过重建目标学习鲁棒表征,消除了对手工设计模块的需求。在五个基准数据集BWF、DQFF、LSFD、DSFD、FG和DFAN上进行的广泛实验表明,与现有方法相比实现了持续改进,在BWF上取得了2.5%、DQFF上2.2%、LSFD上1.42%、DSFD上1.8%、FG上1.14%和DFAN上1.10%的显著提升。所提出的模型还保持了计算效率,并能够有效泛化至广泛的火灾条件,支持其在实际实时系统中的部署。
期刊
IF:
7.8
论文数:
9.6K
被引数:
3.8W
机构
引用论文
暂无论文信息

