arrow
返回

Anomaly detection in data warehouse using machine learning techniques

delete2026-09-05
delete0
PRE
AI
N
Nawfal El Moukhi *
I
Ikram El Azami
DOI:10.1016/j.cie.2026.112365delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
数据利用的指数级增长使数据仓库成为存储海量信息的关键组件。然而,这些仓库中存储的数据可能包含异常值,从而对分析结果的可靠性和质量产生不利影响。因此,检测数据仓库中的异常已成为确保数据完整性的关键问题。本文提出了一种新的无监督方法,该方法使用一组基本检测器来描述仓库表,并通过一个共同的严重性标度使它们协同工作。数值属性的主要方向偏差、边缘偏差、符号的稀有性、分类模式的意外组合以及数值属性在类别内的条件偏差均通过在方法自身清理的参考集上估计的经验围栏转换为严重性。记录的得分为所有检测器中观察到的最大严重性,并且单个全局阈值在该聚合得分上进行校准,该得分考虑了同时评估的检测器的多重性。校准的任何阶段均不使用标签,且每个警报均附带产生该警报的检测器名称。我们在一个从电子商务公司数据仓库提取的真实数据集上验证了该方法的有效性。该方法达到93.98%的精确率、95.75%的召回率、94.85%的F度量值和0.125%的误报率,且在普通笔记本电脑上(无图形加速器)仅用不到两分钟即可处理整个测试集。这些结果表明,该方法是一种可靠且经济高效的工具,适用于跨不同领域和应用的数据仓库准确异常检测。

期刊

C
Computers & Industrial Engineering
IF:
6.5
论文数:
495
被引数:
0

机构

H
Hassan II University of Casablanca
学者数:
5.3K
论文数: 3.4K
被引数: 3
I
ibn tofaïl university
学者数:
217
论文数: 65
被引数: 0