返回
A Zero-Training Data Cleaning System With Large Language Models
DOI:10.1109/TKDE.2026.3658627.png)
摘要
En 中文
数据清洗(DC)是许多数据工程任务中至关重要但也极具挑战性的一步。传统的预配置DC方法高度依赖预定义规则或约束,需要大量的领域知识和人工努力。尽管已探索无需配置的DC方法,但它们仍需大量特征工程或标注数据来进行密集的模型训练。在本文中,我们提出了一种零训练且可解释的DC系统,命名为${\sf ZeroDC}$,该系统利用大型语言模型(LLMs)生成数据清洗规则和思维链(CoTs),无需进行模型训练。${\sf ZeroDC}$由两个模块组成:迭代检测规则生成(IDG)和无需训练的可解释修正(TEC)。为生成高质量错误检测规则并最小化人工反馈,IDG首先通过对比规则初始化在采样的句法和语义对比对上启动一组规则,然后通过迭代规则精炼工作流逐步增强它们,该工作流选择最具有信息量的元素进行更新。TEC使用加权余弦相似度函数构建上下文相关元组检索器,以高效识别每个脏值的最相关元组,减少LLM提示中的冗余并降低计算成本。它进一步提示生成用户修正的代表值的修正CoTs,以及用于创建修正规则和可解释修正的提示,这些提示能自动提供修正结果的解释,且无需模型训练。在多个真实数据集上进行的大量实验表明,${\sf ZeroDC}$相较于当前最先进的方法,平均准确率提高了5.36%,速度提升了8.16倍。
Keyword:
Data cleaning (DC)
cleaning rule generation
correction chain-of-thoughts
large language models
期刊
IF:
10.4
论文数:
6.8K
被引数:
3.2W

