返回
TEDA-Driven Adaptive Stream Clustering for Concept Drift Detection
DOI:10.1016/j.datak.2025.102484.png)
摘要
En 中文
数据驱动的应用程序的快速增长凸显了对分析和聚类流数据的强健方法的需求。数据流聚类旨在揭示隐藏在数据流中的有趣知识,这些数据流通常具有快速、结构和模式演化的特点。然而,大多数当前方法面临着显著挑战,如无法检测任意形状的簇、处理离群值、适应概念漂移以及减少对预定义参数的依赖。为解决这些挑战,我们提出了一种基于典型性和偏心性数据分析(TEDA)的概念漂移检测流聚类算法,该算法可将聚类问题划分为微观簇和宏观簇两个子问题。我们的方法利用基于TEDA的概念漂移检测方法来增强数据流聚类。我们的方法采用两个模型监控数据流,以在跟踪新概念出现的同时保留先前概念的信息。当数据样本的交集显著较低时(由Jaccard指数描述),这两个模型代表两个不同的概念。TEDA-CDD与文献中的已知方法进行了比较,实验中使用合成和真实数据集模拟实际应用。通过通过模型重用或创建动态更新簇,我们的算法确保了对数据分布实时变化的适应性。该提出的算法使用KDDCup-99数据集进行了全面评估,该数据集是入侵检测系统基准,涵盖了包括概念漂移、演化数据分布、不同簇大小和离群值条件在内的多种场景。经验结果证明了该算法在性能指标上优于基线方法,如DenStream、DStream、ClusTree和DGStream,达到了完美性能。这些发现强调了我们的算法在解决实际流数据挑战中的有效性,结合了对概念漂移的高敏感性、计算效率、适应性和稳健的聚类能力。
期刊
D
IF:
2.6
论文数:
116
被引数:
1.7K
机构
引用论文
暂无论文信息

