返回
Efficient apache spark-based approach for a probabilistic entity resolution
DOI:10.1007/s10115-025-02609-w.png)
摘要
En 中文
实体解析(ER)是数据集成中的一个基础任务,旨在识别多个数据集中对应同一现实世界实体的对象。阻塞技术(blocking technique)在ER中起着关键作用,因为它在执行比较之前对数据集对象进行分组。其主要目标是克服笛卡尔积的二次复杂度,随着数据规模增大,这变得不切实际。文献中现有的阻塞方法通常以严格或二分的方式将对象分配到块中,即每个对象都被确信地放置到一个块中。然而,这可能导致对象被分配到错误的块,从而导致精度降低和有效性下降。在本文中,我们提出了一种针对ER中阻塞步骤的新方法,旨在克服二分分配的局限性。我们的方法利用模糊k-模算法(fuzzy k-modes algorithm),为每个对象分配其属于每个块的隶属度。我们将最初面向分类数据的模糊k-模算法,适配到实体解析背景下的字母数字数据。此外,我们使用Apache Spark对模糊k-模算法和整个阻塞方法进行并行化,以提高可扩展性和性能。我们在真实数据和合成数据集上进行的实验表明,与严格或二分分配技术相比,我们的方法显著提高了有效性,同时在大型数据集上也达到了较强的效率。
Keyword:
Entity resolution
Blocking
Fuzzy clustering
Probabilistic assignments
Apache Spark
期刊
IF:
3.1
论文数:
557
被引数:
5.2K
机构
引用论文
Outlier Detection in Time-Series Receive Signal Strength Observation Using Z-Score Method with Sn Scale Estimator for Indoor Localization基于Sn尺度估计器的Z分数方法在时间序列接收信号强度观测中的离群点检测,用于室内定位
MapReduce-based fuzzy c-means clustering algorithm: implementation and scalability基于MapReduce的模糊c均值聚类算法: 实现与可扩展性

