返回
GIDCL: A Graph-Enhanced Interpretable Data Cleaning Framework with Large Language Models
DOI:10.1145/3698811.png)
摘要
En 中文
数据质量在众多应用中至关重要。数据的效用因各种错误而受损,这使得严格的数据清洗成为必要。传统数据清洗系统高度依赖预定义的规则和约束,这需要大量的领域知识和手动工作。此外,虽然无配置方法和深度学习技术已被探索,但它们难以应对复杂错误模式,缺乏可解释性,需要广泛的特征工程或标注数据。本文介绍GIDCL(图增强可解释数据清洗与大型语言模型),一个开创性框架,它结合大型语言模型(LLMs)与图神经网络(GNN)的能力,以解决传统和基于机器学习的数据清洗方法所面临的挑战。通过将关系表转换为图结构,GIDCL利用GNN有效捕捉并利用数据间的结构相关性,增强模型理解和修正复杂依赖关系与错误的能力。该框架的创作者-批评者工作流创新性地采用LLMs自动生成可解释的数据清洗规则,并利用最少量的标注数据定制特征工程。该过程包括通过少样本学习迭代优化错误检测和修正模型,显著减少对大量手动配置的需求。GIDCL不仅提高了数据清洗的精度和效率,还增强了其可解释性,使其对非专家用户更易用、更实用。我们的广泛实验表明,GIDCL显著优于现有方法,平均提升F1分数10%,而仅需20个标注元组。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

