返回
An efficiency method for mining top-k multi-level high utility itemsets through multi-core parallelism
DOI:10.1007/s10586-026-06242-2.png)
摘要
En 中文
高效用项集挖掘(HUIM)是一种重要的数据挖掘任务,它通过包含数量和利润信息扩展了频繁项集挖掘。top-k HUIM通过检索最高效用项集克服了手动选择阈值( $$\:minU$$ )的限制。在现实世界的数据库中,物品通过分类学进行分层组织,形成了多级HUIM(MLHUIM)的基础,这提供了更多知识但需要更高的计算开销。随着数据量的增加,高效的并行策略对于管理搜索空间的不断增长的复杂性至关重要。并行化top-k HUIM具有挑战性,因为挖掘过程依赖于两个共享结构:全局阈值( $$\:minU$$ )和top-k优先级队列。这些结构需要跨线程同步更新以避免可能导致错误剪枝和不可靠结果的冲突。为解决这些问题,本研究引入了ParaTMH,一种针对多核处理器的top-k MLHUIM并行算法。它具有两个同步的全局变量:同步优先级队列( $$\:SPQ$$ )和原子 $$\:minU$$ ,以及一种锁定机制,确保安全更新并将阈值立即传播到所有线程。实验结果表明,ParaTMH使用2个线程时最高可加速32倍,使用32个线程时最高可加速82倍,同时保持适中的内存开销并持续减少生成的候选数量。此外,与基于项的并行版本的比较表明,ParaTMH提供了更好的加速效果、更均衡的工作负载和更低的内存使用量。
Keyword:
Data mining
Parallel computing
Synchronized Priority Queue
Taxonomy database
Top-k HUIM
期刊
C
IF:
4.1
论文数:
5.1K
被引数:
7.5K
机构
引用论文
Mining Cross-Level High Utility Itemsets in Unstable and Negative Profit Databases在不稳定和负利润数据库中挖掘跨层级高效用项集
CrossFIM: a spark-based hybrid frequent itemset mining algorithm for large datasetsCrossFIM: 一种基于spark的大数据集混合频繁项集挖掘算法

