返回
Machine Learning-Based Data Deduplication: Techniques, Challenges, and Future Directions
DOI:10.1002/cpe.70574.png)
摘要
En 中文
数据去重在现代数据管理中发挥着重要作用,它通过消除冗余记录来降低存储成本并确保一致性。传统数据去重方法对于精确匹配有效,但在适应性和检测非结构化或复杂数据中的近似重复记录方面存在困难。机器学习(ML)通过使用模式识别、特征学习和统计建模来识别记录之间的细微相似性,从而解决了这些局限性。本文将基于机器学习的去重技术分为监督学习、非监督学习、半监督学习和深度学习方法。此外,还讨论了关键挑战,包括类别不平衡、模型可解释性和计算开销。本文还探讨了联邦学习、实时去重和多模态技术的最新进展,以突出这些领域的发展趋势。最后,本文识别了关键开放问题,并提出了一个统一视角,用于可扩展、实时的去重系统,以适应多样化的数据类型、结构和系统需求。
Keyword:
data deduplication
deep learning
machine learning
similarity matching
storage optimization
structured and unstructured data
期刊
C
IF:
1.5
论文数:
473
被引数:
0
机构
引用论文
A Survey of Multi-Access Edge Computing in 5G and Beyond: Fundamentals, Technology Integration, and State-of-the-Art
IEEE ACCESS
IF3.6
Using Machine Learning to Identify Health Outcomes from Electronic Health Record Data使用机器学习从电子健康记录数据中识别健康结果
Gopalakrishna, A.K., Ozcelebi, T., Liotta, A., Lukkien, J.J., 2013. Relevance as a metric for evaluating machine learning algorithms, in: Perner, P. (Ed.), Machine Learning and Data Mining in Pattern Recognition, Springer, Berlin, Heidelberg. pp. 195–208. URL: https://doi.org/10.1007/978-3-642-39712-7_15, doi: 10.1007/978-3-642-39712-7_15.Gopalakrishna, A.K., Ozcelebi, T., Liotta, A., Lukkien, J.J., 2013. 以相关性作为评估机器学习算法的指标,载于:Perner, P.(主编),《模式识别中的机器学习与数据挖掘》,Springer, 柏林, 海德堡。第195-208页。URL: https://doi.org/10.1007/978-3-642-39712-7_15, doi: 10.1007/978-3-642-39712-7_15.

